人机交互技术:我们离“不用动手”的未来还有多远?
上个月去逛数字生活展,钻进一台号称做全沉浸式交互的VR冥想舱,五分钟摘下来闷了一脸痘坑的汗,本来一肚子火,结果刚抬手想擦汗,屏幕自动切到了我常听的那个自然白噪音歌单——我连碰都没碰它啊。那一秒突然反应过来,现在的人机交互技术,早就不是我们印象里点点触摸屏点点鼠标那回事了。
消费级VR设备手势交互演示图
说实话,整个领域的底层逻辑早就换了。原来的交互,核心是“人迁就机器”:你得记住操作规则,得配合机器的识别逻辑,错一步都不行。现在完全反过来,所有技术进步都围绕着“机器迁就人”,你下意识做什么动作,心里想表达什么需求,它得猜得懂,不用你特意改变自己的行为习惯。
就说现在新出的眼动追踪交互,你看屏幕哪里,它就知道你想选哪里,翻页不用点,翻小说的时候眼睛往右下角扫一下自动下一页,懒癌福音。
可穿戴肌电交互臂环穿戴展示图
不过话说回来,现在的坑也不少。我前阵子试了某品牌的全语音控制智能家居,我说“把客厅灯调暗一半”,它倒好,直接把我三个卧室的灯全关了,我站在客厅摸黑找开关,那时候真想把它扔出去。核心问题还是,大模型能懂字面的语义,但懂不了你当下的场景和潜意识的需求,这个坎,还得好几年才能跨过去。
脑机交互离普通人的生活,到底还有多远?
提到人机交互的未来,所有人都会说到脑机。现在确实进展很快,去年斯坦福的研究,侵入式脑机接口已经能让渐冻症患者每分钟输出90个字符,差不多接近普通人打字聊天的速度了。也就是说,那些失去说话能力的患者,终于能顺畅地和家人交流了,这个意义真的很大,说它改变命运一点都不夸张。
但是那些营销号吹的“买个头戴就能用脑机打游戏”“靠意念学外语”,听听就好,别当真。非侵入式脑机现在的信噪比太低了,你稍微动一动,想点别的事情,信号就乱了,最多就能做到切换个PPT,飞个简单航线的无人机,复杂操作根本不可能。现在脑机交互真正的落地场景,都在医疗领域,不是给普通人玩的,别被割韭菜。
我前阵子听一个做脑机的朋友吐槽,说天天有人找问能不能出个“意念吃鸡”的外设,他们解释半天普通用户听不懂,就认准了“意念操控”就是黑科技,就是要花钱买体验,真的挺无奈的。
其实你回头看,人机交互技术每一次进步,都是在把人和机器之间的那堵墙拆得更薄一点。最早那堵墙是打孔卡,然后是键盘,然后是触摸屏,现在墙越来越薄,说不定哪天就没了。以后我们甚至不会意识到“我在和机器交互”,就像我们呼吸空气一样自然,机器就在那里,懂你的需求,配合你的动作,不用你刻意做什么。
会不会有那一天?我觉得会。说不定我们的下一代,根本不知道键盘鼠标是什么,就像我们现在很少有人会用打孔卡一样。
从“人适应机器”到“机器适应人”,这二十年的颠覆比想象中大
最早操作大型机要学半年的打孔纸带规则,普通人连碰都碰不到。后来键盘鼠标出来,总算把门槛降下来,再后来触摸屏普及,三岁小孩都能上手滑手机。现在呢?手势、眼动、肌电、脑电,什么都能当输入设备。 我最早玩第一代Kinect的时候,为了玩切水果,站在电视前跳得满头大汗,它愣是识别不出来我在切左边,反而把我后退的动作当成切右边,那时候我就说,这种鬼东西谁会用啊。才十几年过去,Meta的消费级VR已经能做到亚毫米级手势识别,延迟不到10毫秒,你对着空气捏一支笔写字,屏幕上的轨迹都不带动画拖影的。
消费级VR设备手势交互演示图
说实话,整个领域的底层逻辑早就换了。原来的交互,核心是“人迁就机器”:你得记住操作规则,得配合机器的识别逻辑,错一步都不行。现在完全反过来,所有技术进步都围绕着“机器迁就人”,你下意识做什么动作,心里想表达什么需求,它得猜得懂,不用你特意改变自己的行为习惯。
就说现在新出的眼动追踪交互,你看屏幕哪里,它就知道你想选哪里,翻页不用点,翻小说的时候眼睛往右下角扫一下自动下一页,懒癌福音。
生成式AI带火的新交互,改变的不只是操作方式
生成式AI火了之后,很多人只盯着大模型能聊天能画图,其实最本质的改变,发生在人机交互这一层。原来的交互是“指令式”的,你必须一步一步告诉机器做什么:点这个文件夹,选这个文件,点导出,选格式,错一步都出不来你要的结果。 现在呢?你只要说清楚需求:“把我上周出差拍的那堆照片整理一下,挑出晴天拍的风景,调亮阴影,做成九宫格发朋友圈”,剩下的全交给机器。不需要你知道怎么点菜单,不需要你会用复杂的修图软件,任何人都能上手。 去年CMU机器人研究所的一篇顶会论文,他们把大语言模型和可穿戴肌电传感器结合,不用用户提前校准采集样本,直接就能做到92%以上的手势识别准确率。放在以前,你戴个肌电臂环,得对着软件做十几组指定动作,让系统记住你的肌肉信号,才能用,很多人嫌麻烦直接就扔抽屉了。现在完全不用,戴上就能用。
可穿戴肌电交互臂环穿戴展示图
不过话说回来,现在的坑也不少。我前阵子试了某品牌的全语音控制智能家居,我说“把客厅灯调暗一半”,它倒好,直接把我三个卧室的灯全关了,我站在客厅摸黑找开关,那时候真想把它扔出去。核心问题还是,大模型能懂字面的语义,但懂不了你当下的场景和潜意识的需求,这个坎,还得好几年才能跨过去。
脑机交互离普通人的生活,到底还有多远?
脑机交互离普通人的生活,到底还有多远?
提到人机交互的未来,所有人都会说到脑机。现在确实进展很快,去年斯坦福的研究,侵入式脑机接口已经能让渐冻症患者每分钟输出90个字符,差不多接近普通人打字聊天的速度了。也就是说,那些失去说话能力的患者,终于能顺畅地和家人交流了,这个意义真的很大,说它改变命运一点都不夸张。
但是那些营销号吹的“买个头戴就能用脑机打游戏”“靠意念学外语”,听听就好,别当真。非侵入式脑机现在的信噪比太低了,你稍微动一动,想点别的事情,信号就乱了,最多就能做到切换个PPT,飞个简单航线的无人机,复杂操作根本不可能。现在脑机交互真正的落地场景,都在医疗领域,不是给普通人玩的,别被割韭菜。
我前阵子听一个做脑机的朋友吐槽,说天天有人找问能不能出个“意念吃鸡”的外设,他们解释半天普通用户听不懂,就认准了“意念操控”就是黑科技,就是要花钱买体验,真的挺无奈的。
其实你回头看,人机交互技术每一次进步,都是在把人和机器之间的那堵墙拆得更薄一点。最早那堵墙是打孔卡,然后是键盘,然后是触摸屏,现在墙越来越薄,说不定哪天就没了。以后我们甚至不会意识到“我在和机器交互”,就像我们呼吸空气一样自然,机器就在那里,懂你的需求,配合你的动作,不用你刻意做什么。
会不会有那一天?我觉得会。说不定我们的下一代,根本不知道键盘鼠标是什么,就像我们现在很少有人会用打孔卡一样。