能自己绕开奶茶杯的机器人:重新理解具身智能
那天我去长三角的一个产业园拜访旧同事。
刚进门就撞见个有意思的事。
一个分拣机器人正往货位走,保洁阿姨放的半杯奶茶忘了拿,就挡在路中间。
换做以前我见的传统AGV,早就停在原地嗷嗷叫报警,等着人来挪障碍物了。
这个不一样。
它慢悠悠减速,绕了个半弧从侧边过去了,走之前还伸出机械臂,把奶茶往路边拨了两厘米,怕挡着后面的机器。
这就是我最近接触最多的具身智能,不是PPT里吹得天花乱坠的概念,是真的站在你面前,能解决实际问题的东西。
原来绝大多数AI,都没有“身体”
我们平时聊的AI,不管是聊天的大模型还是画图的生成工具,都是“非具身”的。
它们住在服务器里,处理的都是预处理好的数字化信息。你让它写一篇拿外卖的攻略,它写得头头是道,你让它真的去你家楼下外卖柜拿一杯冰可乐,它做不到。
很早之前的机器人,本质就是带轮子的执行器,所有路径、所有动作都是提前编死的,环境变一点点,它就瞎了。
具身智能的不同,就是它把智能和身体绑在一起了。
智能不是存在云端等着调用的指令,是身体在和环境互动的过程中,自己练出来的。
就像我们人类学骑自行车,你不是靠脑子背平衡公式,是摔个十几次,你的皮肤、肌肉、眼睛一起配合,身体记住了那种平衡感,你就会了。
这个就是“具身”两个字的核心。
仓库中自主避障的具身智能搬运机器人
装个摄像头加个大模型,就是具身智能了?差远了
说实话,我最近看了好多创业项目的PPT,上来就说自己“大模型+具身机器人”改变世界,翻完之后发现,不就是给机械臂装了个能识别物体的摄像头吗?
哪有这么简单。
第一个难点,真实世界太乱了,根本没有标准。大模型训练用的图片,都是网上修好、打好标的干净数据。你去普通人家里看看,拖鞋扔在门口,一半被沙发挡住,灯光晚上是黄的白天是白的,阴天还暗得看不清,这种五花八门的数据,你上哪找那么多人工标注去?
具身智能得能自己在互动里学,今天碰到一个没见过的纸箱子,碰一碰,知道是轻的能推,下次碰到就知道怎么处理了,不用重新训一遍模型。
第二个难点,决策得实时做。你不能碰到障碍物了,再把图片传到云端,等半秒大模型给你回指令,早撞上去了。
具身智能很多决策得在机身的本地芯片做,也就是端侧推理,这个对功耗和算法的要求,比纯云端AI高太多了。
我之前参与过一个家用导盲机器人的小项目,最头疼的就是下雨天,路面的积水反光,旧算法会把反光当成坑,直接停在原地不敢走。换了具身学习的方案之后,机器人走两次,就知道这种反光的平面是积水,可以压过去,不用停。省了不知道多少事。
具身智能机器人互动训练环境示意图
哪些真落地了?哪些是吹出来的
哪些真落地了?哪些是吹出来的
现在很多人一提具身智能,第一反应就是人形机器人,跑啊跳啊翻跟头,好像做不出来人形就是技术不行。其实完全是误区。
人形只是具身智能的一个载体,不是最终目的。对吧?你一个搬货的机器人,要两条腿干嘛?轮子比腿稳多了,还便宜,只要它能自己认路避障、调整动作,它就是合格的具身智能。
现在真正落地的项目,大多都在半封闭的特定场景里。工业这边最多,就是仓库里的搬运拣货,原来的AGV要改一次布局就得重新贴磁条重新建图,一个大仓库改一次得花好几天,耽误发货。现在带具身能力的机器人,你换了货位,掉了打包袋,它自己认,自己绕,运维成本降了不止一点。
家用这边也有小范围落地,就是最近新出的服务机器人,原来的扫地机器人碰到拖鞋、数据线就卡,现在带具身能力的,能识别,能绕,甚至能帮你把脏衣服叼到脏衣篮,把散落的垃圾扔到垃圾桶,这些都是普通人能接触到的具身智能应用。
不过话说回来,现在吹出来的泡沫也不少。有人说再过两年,具身机器人就能上门给你做饭洗衣,啥活都干,那还早得很。
现在的具身智能,它的智能是和自己的身体、所处的场景绑定长出来的,你让一个仓库搬货的机器人去家里收拾桌面,它根本不会,换个场景就不灵了。还有安全问题一直卡着,开放场景里人来人往,万一它判断错了撞到人怎么办?现在的方案还都是在半封闭场景里用,开放场景的安全冗余还做不到让人放心。
那天我在产业园门口买奶茶,送奶茶的就是个小型具身配送机器人,它自己绕开了乱跑的小朋友,稳稳停在我面前弹开舱门。我拿奶茶的时候就在想,我们说AI改变生活说了这么多年,AI一直都在手机里,在屏幕里,隔着一层玻璃和我们互动。
现在它终于长出了脚,长出了眼睛,一步步走到我们真实的物理世界里来了。它现在还很笨,会走错路,碰到完全没见过的东西还是会懵,但是你得承认,它已经和以前那个只会按指令走的铁疙瘩,完全不一样了。
说不定再过十几年,我们家里那个能帮你拿快递、能帮你收拾桌子的机器人,就是今天这台能绕开半杯奶茶的小家伙,一步步进化来的。