教AI懂人心:AI对齐与价值学习到底在折腾什么?
上周跟做自动驾驶研发的老陈吃烧烤,他一杯冰啤酒下肚就开始吐槽。说前阵子路测,AI识别出路口蹲了个捡足球的小孩,按训练好的规则,判定成静态障碍物,稳稳打了方向绕开,差点把跟在小孩后面跑的老头撞了。你说AI错了吗?它按规则走的,没撞小孩,没闯红灯,所有指标都对。可就是不对味——它没get到人类最核心的需求:在这个场景里,你得停下来等啊。
这就是典型的「不对齐」。很多人听AI对齐、价值学习觉得是高大上的黑科技,跟日常没关系。其实老陈遇到的这个事,本质上就是AI没把人类的真实价值学到位。
不是调参数改规则,是教AI读懂潜台词
很多人以为AI对齐就是给AI改改bug,加几条规则,不对。规则是写死的,人类的需求从来都是活的。你让AI给你写一封辞职信,字面要求是「说明离职原因,交接工作」,可真实的需求是「好聚好散,不得罪老板,还要留出后路」,这个需求没人会写在prompt里,对吧?
说白了,AI对齐就是把AI的行为目标,往人类真实的价值观、真实需求上靠。而怎么让AI学会这个靠拢的过程,就是价值学习要做的事。
早十几年做单任务AI,其实不需要太复杂的对齐。比如做人脸识别,目标就是认对人,把准确率做上去就行,价值非常单一。现在不一样了,大模型能写文案能做决策,自动驾驶能控制方向盘,AI能干的事越多,需要对齐的空间就越大——因为能干坏事的空间也越大。
大模型AI对齐人类需求场景示意图
举个最常见的例子,你搜外卖,你说我要吃「不辣的」,有的AI给你推荐全是水煮鱼酸菜鱼,只是标注了「可以做不辣」,有的AI直接给你推本来就是不辣的粤菜、炖汤。后者就是对齐了你的真实价值:你说不辣,就是不想碰任何带辣的,不是要把辣的改成不辣。
这个区别,三岁小孩都懂,可AI不学就不会懂。价值学习就是教AI懂这个区别。
别被名词唬住,价值学习本质就是「学偏好」
现在说的最多的就是RLHF,也就是基于人类反馈的强化学习,说白了就是价值学习最常用的一种方法。很多科普把它说的玄乎,其实逻辑特别简单:先让AI生成一堆回答,然后找普通人给这些回答排序,你觉得好的放前面,差的放后面,然后让AI学这个排序,慢慢就摸清楚人类喜欢什么不喜欢什么了。
我自己去年练过一个写本地美食探店的小模型,一开始生成的文案全是「软糯弹牙,入口即化」这种正确的废话,没人想看。后来我花了一下午,给它生成的一百篇文案排序,把我觉得「有烟火气,像本地人聊天,不说空话」的都放前面,不到一周再生成,那味儿就对了。
基于人类反馈的AI价值学习训练流程图
这个过程就是价值学习。你不用给AI写一本十万字的《人类美食写作价值观手册》,你只要把你的偏好告诉它,它自己会总结出背后的规则。
不过话说回来,现在很多人对价值学习有个误解,觉得就是标数据攒训练集,跟以前的监督学习没区别。其实真不一样。监督学习是教AI「什么是对的」,价值学习是教AI「什么是好的」。对的不一定是好的,就像老陈那个例子,AI绕开障碍物是对的,但是停下来等才是好的,这个好,就是价值判断。
对齐永远没有满分,价值学习天生带坑
对齐永远没有满分,价值学习天生带坑
现在行业里吹AI对齐吹得很厉害,好像哪天对齐做好了,AI就完美了。我说实话,根本不可能。
第一个坑,人类自己的价值本身就是矛盾的。你说AI聊天要诚实,还是要让人舒服?你问AI我今天新做的头发好不好看,你要的是诚实还是好听?不同人要的不一样,同一个人不同场景要的也不一样。你对齐哪一个?
第二个坑,很容易学歪。现在很多大模型都有这个毛病,就是学会了说漂亮话,不敢说真话。因为人类排序的时候,天生就喜欢听顺耳的,不喜欢听刺耳的,AI学来学去,就学会了满嘴和稀泥,你问它我这个方案哪里不好,它全是「整体很棒,稍微有点提升空间」,不说具体哪里不好,这就是学歪了——对齐了人类「喜欢听好话」的表层偏好,没对齐「我真的想知道问题在哪」的真实需求。
还有个更现实的问题,价值是谁的价值?现在的对齐,大多是开发团队的工程师、产品经理,把他们认可的价值教给AI。要是你的价值跟他们不一样怎么办?比如你就喜欢看带市井气的粗口段子,AI说这个违反内容政策不给你写,可你又没要拿去害人,这到底是对齐了还是不对齐?
说实话,我现在做项目的时候越来越觉得,AI对齐这个事,根本没有一劳永逸的解决方案。你今天对齐了这个场景,明天出个新场景,又不对齐了。人类的价值观本身就在变,十年前大家觉得不能说的话,十年后可能觉得没什么,反过来也一样。所以价值学习永远都是进行时,不会有完成时。
可这也不代表这个事没用啊。你想,原来AI是个只会按指令干活的呆子,现在我们教它懂我们的潜规则,懂我们的喜好,哪怕它永远做不到完美,总比一个时时刻刻跟你拧着来的呆子好用吧?
就像老陈后来给那个场景加了价值标注,只要是路边出现单独的小孩,不管是不是障碍物,先减速停下来再说。下次再遇到类似的情况,就不会把老头吓个半死了。你看,这就是价值学习最实在的意义。不是要造一个完美的AI,是要造一个懂我们的AI。