聊聊当下的推荐系统技术:从猜你喜欢到懂你想要
早期推荐系统技术,还在靠「热门凑数」
放在十年前,没人敢想能有现在这个精度。那时候主流的就是协同过滤,逻辑简单得很:找和你爱好差不多的用户,把他们喜欢的东西塞给你。要么就是基于内容的推荐,你喜欢看甜宠剧,就把所有标签带甜宠的都堆给你。
说穿了就是碰运气。冷启动问题解决不了,新来的用户没行为数据,新来的商品没互动记录,只能往首页堆全网最火的东西,用户爱不爱接,全看缘分。还有逃不开的马太效应,越是火的东西越容易被推,越推越火,小众内容哪怕质量再好,也没机会露出。
传统协同过滤推荐系统流程图
那时候也有人尝试改模型,加了各种规则调权重,折腾来折腾去,精度提升没多少,推理速度先掉了一半,小平台根本扛不住这个算力成本。
大模型入局后,推荐系统技术换了赛道
这两年变化真的快。前几年行业还在聊Wide&Deep、DIN这些深度推荐模型,转脸大模型就把整个玩法掀了个遍。
现在的推荐,早已经不是只靠点击、收藏这些显性行为数据了。多模态大模型能把你发的评论文字、晒的商品图、看视频时的暂停位置、甚至滑动屏幕的速度都做成特征,拼出一个比你自己还清晰的用户画像。比如你之前搜了“一岁宝宝辅食锅”,过半个月搜“学步鞋”,它能直接串出来你家有个刚学走路的小宝宝,不会瞎把成人运动鞋推给你。
说实话我上次亲身经历真的惊到。我帮我姐搜了一次新生儿奶粉,之后整整三个月,我打开淘宝全是母婴用品——哪怕我一个单身汉根本用不上,它都记得我的搜索意图。换十年前,根本不可能有这么准的上下文关联。
大模型多模态推荐系统架构图
不过话说回来,现在的进步不止是多模态。之前的推荐都是找关联,比如经典的“买啤酒的人大多买尿布”,不管因果直接推,现在加入了因果推荐技术,能分清楚哪些是相关性,哪些是真的用户需求,不会乱塞没用的东西。很多平台现在已经把大模型和传统推荐模型做了融合,大模型负责做特征提取和用户意图理解,传统模型负责做快速推理,既保住了精度,又没把算力成本涨得太离谱,中小平台也能玩得起。
推荐系统技术现在还卡着哪些难点?
推荐系统技术现在还卡着哪些难点?
吹了这么多,不代表现在就完美了。行业里现在卡着的问题,还真不少。
第一个就是隐私。现在监管越来越严,平台不能随便拿用户的隐私数据训练模型,联邦学习、隐私计算这些技术本来是用来解决这个问题的,可落地之后才发现,训练效率和推理精度掉得太厉害,成本又高,很多平台还在观望,不敢全量换。
第二个就是老生常谈的信息茧房。你喜欢看养猫的内容,算法就一个劲给你推猫,你哪怕就是偶尔好奇点了一次,接下来半个月全是猫,想看点别的都难。现在技术上不是没有解法,加多样性调优就能破,可一加多样性,点击率就掉,平台营收跟着掉,谁愿意先吃这个亏?说白了,技术要给商业让步,这也是没办法的事。
第三个,冷启动的问题还是没完全解决。新出来的小众创作者、小商家,哪怕你的东西再好,没有足够的互动数据,算法还是不敢轻易给你推流量,想要出来还是得先砸钱买推广,大模型能靠文本内容提前提特征,比之前好太多,但还是做不到完全公平。
现在走在街上,随便拉一个人,他每天刷的内容、买的东西,几乎都是推荐系统挑过的。 谁也逃不开。 技术在往前走,从凑热门到猜喜好,再到现在能懂你的人生阶段,进步真的肉眼可见。 至于那些还没解决的问题,慢慢来吧。 技术从来都不是完美的,不是吗?