当前位置:首页 > 科研成果库

人机交互技术:被我们忽略的,悄悄改变生活的隐形革命

2026-08-29 22:23:22小研科研成果库9
最早碰电脑那会,我还得蹲在机房背DOS命令。错一个字符,直接罢工。那时候我想破头也想不到,二十多年后,普通人对着手机说句话就能缴电费、开空调,连瘫痪病人都能用意念打出完整的句子。

从人迁就机器,到机器适应人

最早期的人机交互,规则全是机器定的。你要让机器干活,就得先学会它的语言,从打孔卡到命令行,哪一步不是人削足适履? 鼠标的发明本来是为了给实验室工程图做定位,谁都没料到这个小玩意儿直接统治了PC交互整整三十年。直到现在,办公室里的设计师、程序员,哪离得开鼠标? 九十年代台式机房键盘鼠标人机交互场景九十年代台式机房键盘鼠标人机交互场景 触摸屏刚出来的时候,行业里一片唱衰,说谁会用手指在玻璃上打字,误触率高到离谱。乔布斯把第一个iPhone推出来的时候,多少老硬件玩家吐槽这是异端。现在呢?你上街找个不带触屏的手机给我看看?连家里的油烟机都给你整块触控屏。 说实话,人机交互技术的迭代从来不是按规划好的路线走的。哪次不是歪打正着,哪次不是用户用脚投票选出来的方向?

大模型时代,人机交互的坑比你想的多

现在所有人都在说,自然语言就是未来的人机交互入口。对着AI说句话,什么都能给你做,听起来很美对不对? 我亲身体验过好多次。要做个PPT,对着AI说“帮我做一个十五页的露营产品介绍,风格活泼一点”,结果出来的内容一半是重复的,页脚全错,风格别说活泼了,比公文还死板。要p个图,说“把我合影里左边这个人的脸调小一点”,AI直接把人给我移到右边去了。 去年MIT CSAIL发布的最新科研成果显示,当前大模型端的用户意图歧义识别错误率高达36.8%。也就是说,你说三句话,就有一句AI理解错了。 大模型自然语言人机交互理解错误案例展示大模型自然语言人机交互理解错误案例展示 很多人吹大模型交互要替代所有实体界面,其实根本站不住脚。你去公司做报表,点鼠标选单元格改格式,比对着AI说十句都靠谱。不过话说回来,自然语言交互确实打开了一扇门。我妈今年六十八,不会用PS不会剪视频,现在想把广场舞合影修一修,对着AI说两句话就搞定了,放十年前想都不敢想。 它不是来替代旧交互的,它是给原本不会用复杂工具的人,开了个新入口。

下一代交互,核心是读懂人的隐性需求

下一代交互,核心是读懂人的隐性需求下一代交互,核心是读懂人的隐性需求 现在学界和业界都在盯着下一代人机交互技术,很多人把宝全押在更聪明的大模型上,我反倒觉得,未来的突破在多模态情绪自适应交互上。 什么意思?就是交互不能只读懂你说出来的话,还要读懂你没说出来的情绪和需求。去年清华人机交互实验室发了一个面向车载导航的自适应系统,能通过你握方向盘的力度、你说话的语气、甚至你踩油门的加速度,判断你现在是不是赶时间、是不是烦躁。如果你已经不耐烦了,它就自动简化播报,只说关键的转向信息,不会絮絮叨叨给你讲周边景点,逼得你忍不住想把导航关了。 这个方向太戳人了。现在很多交互设计,明明一堆没用的信息往你脸上堆,美其名曰“个性化推荐”,其实根本不管你现在想不想要。 还有现在的脑机交互,别觉得这是科幻片里的东西。去年国内已经有团队做到了非侵入式脑机接口,帮助瘫痪病人实现了一分钟输入超过20个汉字,虽然速度还比不上打字,但是对于失去运动能力的人来说,这就是重新和世界连接的窗口啊。 还有VR里面的眼动追踪交互,你眼睛看哪,光标就跟到哪,还能通过你瞳孔缩放的幅度,判断你对哪个产品感兴趣,自动调整展示内容,比你用手柄按来按去舒服一百倍。 我前阵子在一个行业沙龙上,碰到几个刚毕业的博士生,他们做的方向是给认知障碍老人做非接触式交互,不需要动手说话,通过摄像头捕捉表情和眼神变化,就能判断患者想要喝水还是想要翻身,已经在几个养老院做测试了,反馈特别好。 你看,最好的人机交互技术,从来都不是堆参数堆出来的。它是蹲在用户身边,看懂用户没说出口的需求,做出来的。 你每天刷手机点外卖,用导航开车,对着AI问问题,其实每时每刻都在用人机交互技术。大多数时候你感觉不到它的存在,这才是它最厉害的地方。 对吧?等再过十年,我们现在用的触屏手机,说不定也会像当年的按键功能机一样,被摆在博物馆的玻璃柜里,当成老古董给孩子看。 那一天来的,肯定比我们想的要快。