搞懂反馈循环机制:为什么越努力越错,有的人躺平反而赢?
上个月跟做AI大模型训练的发小喝咖啡,他整个人烟都抽了半盒,说砸了快三千万训的垂直模型,越调越像个傻子。一开始刚训完,测试准确率还有92%,跟着人工改了三批训练集,现在准确率直接掉去71%,连行业常识都能说错。
我听了直接笑,问他是不是反馈循环搞反了?他猛地拍大腿,说就是这个问题,之前只想着往模型里堆数据,根本没管反馈是正的还是负的,硬生生把良性的路走歪了。
什么才是真正能成事的反馈循环机制
别听网上那些玄乎的解读,什么商业闭环、成长闭环,说来说去都没说到点子上。从控制论的科研定义来说,反馈循环本质就是系统把输出结果反过来当成输入,再影响下一轮输出的过程。
核心就分两种:正反馈放大初始偏差,负反馈拉回系统稳态。对吧?没有好坏,关键看你用在什么地方,有没有接对方向。
现在OpenAI玩得炉火纯青的RLHF,也就是基于人类反馈的强化学习,其实就是把正负反馈玩明白了。人类标注员给模型的输出打分会作为输入,纠正模型偏离人类认知的输出,这就是负反馈在起作用,把乱跑的模型拉回正常轨道;而模型答对之后获得的奖励信号,会让模型不断重复正确的逻辑,放大正确的输出效果,这就是正反馈的用处。
AI大模型RLHF反馈循环流程图
放到生活里看也是一样。你减肥,饿三天掉两斤,忍不住吃一顿反弹三斤,这就是典型的恶性正反馈:节食降低基础代谢,稍微摄入热量就会转化成脂肪堆积,越胖越想节食,越节食代谢越低,陷进去就出不来。这不就是很多人减肥减到崩溃的真实写照吗!
那好的循环是什么样?你每次运动完记录体脂变化,哪怕只掉了0.1公斤,就给自己一个小奖励,慢慢养成运动习惯,基础代谢一点点涨上去,就算偶尔吃顿火锅也不会胖,这就是正负结合的良性循环:负帮你稳住节奏,正帮你慢慢放大成果。
为什么90%的人都踩中了恶性反馈循环的坑
说实话,我见过最多的悲剧,都是一开始方向偏了,还一个劲给错误喂养料,把坑越挖越大,最后把自己埋进去。
前两年直播带货风口的时候,我认识一个杭州的小老板,一开始为了冲链接排名,刷了十万单假订单。平台算法一看,你这个品转化率这么高,赶紧给你推更多流量。结果进来的真实用户买完货,全给差评,好评率掉得比瀑布还快,算法一看你差评这么多,直接给你限流,不到三个月号就死了,压了上百万的货卖不出去。
这不就是典型的恶性正循环?你一开始作弊造出的偏差,被算法不断放大,最后偏差炸了,整个系统直接崩盘。
不止商业,连科研圈都逃不开。去年Nature子刊发过一篇很有意思的论文,说为啥现在很多AI药物筛选模型,发论文的时候效果吹得天花乱坠,一到落地做临床就全废?核心问题就是反馈循环错了。
现在绝大多数模型的训练集里,阳性样本都是已经被研究透的热门靶点,阴性样本都是随便找的无关分子凑数。模型学来学去,根本没学会怎么筛选有效新药,只学会了「热门靶点就是好靶点」。整个领域越用这种模型做筛选,就越往已经挤破头的热门方向扎,真正有潜力的新靶点根本没人碰,整个领域都被困在错误的循环里出不来。
药物AI筛选恶性反馈循环示意图
你说扯不扯?多少亿的科研经费,就因为一个没被发现的反馈偏差打了水漂。
不过话说回来,普通人踩坑最多的地方还是个人成长。你找工作,一开始为了进大厂,背了一堆面试题,进去之后发现自己根本不会做项目,又不敢花时间补基础,天天摸鱼混KPI,越混越没核心能力,越没能力越不敢跳槽,最后三十多岁被裁,连合适的工作都找不到。这不就是妥妥的恶性反馈吗?一开始你为了快选了捷径,捷径的甜头被不断放大,最后慢慢吃掉了你所有的长期竞争力。
怎么把恶性循环扭成良性的反馈循环
怎么把恶性循环扭成良性的反馈循环
我这几年见过不少从坑里爬出来的人,总结下来就三招,都是普通人能直接用的。
第一招,直接掐断坏反馈的输入源。别扯什么慢慢改,江山易改本性难移,坏反馈本来就是会放大的,你越拖陷得越深。比如你刷短视频越刷越焦虑,越焦虑越浪费时间,那直接把APP删了行不行?别骗自己说「我只看干货」,你进去就忍不住刷帅哥美女搞笑段子,算法给你推的全是你爱看的,几个小时一眨眼就没了,该做的事情一点没动,越没完成越焦虑,越焦虑越想刷,这就是死循环。直接掐断,从根源断了坏输入,比什么都有用。
第二招,给你的系统加一个负反馈调节阀。很多人做事情就只想着冲,巴不得每天都涨进度,只想要正反馈放大,根本不知道给自己装刹车。比如你做产品,不能只看销量涨就不停扩产能,你得每周抽时间看用户差评,每个月算一次留存率,差评多了就马上改产品,留存降了就马上调整方向,这就是负反馈给你拉回正轨,不会让你跑偏了还不知道。我那个做大模型的发小后来怎么调好的?他把之前错标得一塌糊涂的三批训练数据全删了,每次只调10%的参数,调完马上拿独立测试集跑,只要准确率掉了直接回滚到上一个版本,这不就是给模型装了调节阀吗?半年之后模型准确率就拉回了90%以上,现在已经拿到了两个商业化订单。
第三招,主动引入外源性反馈。很多人从头到尾都是自己给自己反馈,你自己做的东西,怎么看怎么好,偏差根本发现不了。你写了一篇文章,自己读着顺得不行,别人一眼就能看出你逻辑不通顺;你做了一个产品,你自己觉得功能全得很,用户上来连入口都找不到。为啥现在创业公司都要找外部顾问,都要提前找真实用户做测试?就是怕内部自说自话,慢慢形成信息茧房,把错的当成对的,滑进恶性循环里还不自知。
这世上哪有什么天生的幸运儿。大多数能一路往上走的人,不过是碰巧走对了反馈循环,而那些一直走背字的,也不是运气差,只是陷在恶性循环里自己没发现而已。
偶尔停下来看看。你的循环,是在往上推你,还是在往下拉你。