当前位置:首页 > 科研成果库

从南京车间码货到给老人喂饭:具身智能真不是给大模型装手脚

2026-10-01 21:24:58小研科研成果库11

9月23号我在南京溧水的一个自动化车间蹲了大半天,本来是帮朋友做项目调研,看新上线的分拣线。本来以为又是满眼的固定路径机械臂,按流程走一遍就完事。结果撞见个有意思的事儿。

一个工人搬原料的时候慌慌张张,胳膊肘碰掉了半箱打包好的元器件,箱子歪歪扭扭卡在了传送带和码垛区的缝隙边。换做以前的旧机器人,要么直接触发安全锁卡死停线,要么不管不顾直接往上撞,轻则撞歪箱子,重则把自己关节干错位。

那天这个新机器不一样。

它走到离箱子半米远突然停下来,机械臂转了小半圈,摄像头扫了两秒,然后慢慢挪了下底座,绕到侧面,伸出抓手轻轻把箱子扶回传送带,摆正,接着按原来的计划继续码垛。整套动作下来,没停线,没喊人,没人教过它遇到这种情况该怎么办。

这就是我第一次线下见能用的具身智能,不是PPT里的概念,不是发布会的演示视频,是真的在车间干活的玩意儿。

别被“长手脚”的说法骗了,核心根本不是硬件

说实话,我之前看了好多创投圈的PPT,十个里有九个把具身智能画成“ChatGPT装机械臂”,搞得好多人以为就是给大模型接几个关节就能卖钱。完全不对。

ChatGPT这类大模型,是在存量的文本、图像数据里找规律生成答案,它所有的“认知”都来自人类已经整理好的虚拟世界信息。它知道箱子要摆正,但是它不知道“摆正一个歪了的箱子需要用多大的力”,不知道“箱子卡在缝隙里我要转多少度才能绕过去”,更不知道“我现在的重心会不会歪,会不会自己摔了”。

南京工业车间具身智能码垛机器人现场图南京工业车间具身智能码垛机器人现场图

具身智能的核心,是让AI能在物理世界里自主感知、试错、调整,它的学习场景不是云端的数据集,是真刀真枪的现实环境。就像我们人类,你学走路不是靠看别人走路的视频学会的,是摔了好几跤,自己感觉到“脚这么抬会摔,那么踩能站稳”,才学会的。具身智能干的就是这么回事。

我那天跟调试的工程师聊天,他说最磨人的不是写算法,是调力反馈。你码纸箱子,抓力大了捏瘪,抓力小了掉地上;你做护理机器人给老人喂水,温度不对烫着,力度大了戳着,全是在虚拟世界里学不会的细节。以前的机器人是“人类教一步,它走一步”,具身智能是“人类告诉它要把箱子码好,它自己想办法应对各种意外”,这才是本质区别。

说人话,能用的具身智能就靠三件事转起来

很多科普喜欢说一大堆术语,什么大模型联动、运动控制规划,听得人头大。其实拆解开,就是三件事,一环套一环跑。

第一件是感知。不是装个摄像头就叫感知了,要把摄像头拍到的画面、力传感器感受到的压力、关节的位置、环境的温度湿度这些乱七八糟的信息,揉到一起,转成AI能读懂的信号。它得先搞清楚“我现在在哪,我面前是什么东西,我自己的身体是什么状态”,才能往下走。

第二件是决策。现在大多会用大模型当“大脑”,但是不是直接把摄像头画面丢给大模型就行,要把感知到的信息转成大模型能理解的语言,告诉它“现在有个箱子歪在路边,我该怎么办”,大模型给出方案之后,还要再把方案转成每个关节能听懂的动作指令:底座向左挪10厘米,机械臂抬5度,抓手力度调到3牛……一步都不能错。

第三件是反馈闭环。动作做出去了,不对怎么办?箱子滑了一下,抓手没抓稳,得马上调整力度和位置,一毫秒都不能等。这个实时反馈,比大模型生成一篇几千字的文章难多了。虚拟世界错了可以删了重写,物理世界错了就是撞车摔箱,搞不好要出事故。

具身智能感知决策反馈闭环工作流程图具身智能感知决策反馈闭环工作流程图

你看波士顿动力的机器人能翻跟斗能跑酷,大家都觉得外形酷,其实最值钱的就是这个毫秒级的反馈闭环。它每跳一步,重心调整几十次,不然早就摔了。

不过话说回来,现在能落地的具身智能,都只敢在特定场景里待着。我那天见的这个,就是专门训过来码垛分拣的,你让它转去给你泡杯茶,它肯定懵,换个环境变量一变,它那点经验就不够用了。

火爆背后的坑,别被PPT吹得晕头转向

火爆背后的坑,别被PPT吹得晕头转向火爆背后的坑,别被PPT吹得晕头转向

这两年具身智能火得一塌糊涂,好像明天就能家家户户都有个机器人保姆了。我蹲完车间最大的感受就是,路还长着呢,好多坑还没填。

第一个误区,就是觉得大模型参数越大,具身智能就越强。不对,大模型给了它做决策的脑子,但是物理世界的变量比虚拟世界多一万倍。你在家放个拖鞋在门口,训了一万次客厅环境的机器人,说不定就因为多了这双拖鞋卡壳。大模型再强,也不可能把物理世界所有可能的意外都训一遍,这个适配的问题,现在还没好的解法。

第二个误区,就是说具身智能要抢所有人的饭碗。我那天跟车间主任聊天,他说现在招年轻人来干码垛,开多少钱都招不到,都是干了十几年的老工人,腰都累坏了,实在干不动。现在机器人干的,都是没人愿意干的重体力、高重复的活,真说要抢复杂工序的活,十年内都未必能实现。倒是能把人从最累的活里解放出来,这是真的。

再说风险,真往生活里走,安全问题绕不开。一个能自由活动的机器人,小到家里帮你拿快递的,大到工厂里几吨重的机械臂,程序出问题了怎么办?撞到人谁负责?它到处走到处扫,收集了一堆家里、工厂的环境信息,这些数据存在哪,会不会泄露?

还有大家没怎么提的,情感的边界。以后要是真的有护理机器人,能帮独居老人喂饭穿衣擦身子,能陪老人说话,老人会不会对机器人产生依赖,反而更疏远了和人的连接?这些问题,现在都没人能说清楚答案,要等走一步看一步。

那天从车间出来,开车回市区,秋天的风从车窗吹进来,南京城外的稻子都黄了,晃得人眼晕。我就在想,之前这么多年的AI,大多都活在屏幕里,给你推广告,帮你写稿子,识别个图片,都是在虚拟世界打转。这回具身智能不一样,它是真的要踩进我们的物理世界里,和我们共享同一个空间了。

它不是什么改变人类命运的黑魔法,也不是骗投资的风口概念,就是一群工程师在车间里一点点调参数,一个个场景试错,慢慢磨出来的东西。今天能码好一个箱子,明天能分好一个快递,后天说不定就能帮老人换个灯泡扶个楼梯。

别着急。慢慢来。