推荐系统技术:从猜你喜欢到懂你想要的进化之路
你有没有过这种体验?早上刷短视频,刚看完一条橘猫拆家的搞笑视频,接下来三条全是猫。逛电商搜了一次婴儿奶粉,半个月首页全是母婴用品。
你看到的每一条内容,每一个商品,背后都是推荐系统技术在干活。不是什么玄之又玄的用户洞察,就是一堆模型和参数在疯狂计算。
推荐系统技术迭代历程对比图
现在的深度推荐模型,能抓到你自己都意识不到的隐式偏好。你逛女装的时候,在那条酒红色连衣裙上多停留了三秒,哪怕你没点击没加购,系统都能把这个特征记下来,后续给你推同风格的衣服。准确率比十年前的老方法,不知道高了多少倍。
推荐系统冷启动业务处理流程图
第二个痛点就是大家天天骂的信息茧房。
你喜欢看萌宠,系统就给你推一年萌宠,你想看点社会新闻都刷不到。你买过一次瑜伽垫,首页半年全是健身器材,你都忘了你其实只是买来当孩子的爬爬垫。
现在的解决思路是做带多样性约束的排序优化,就是在保证推荐准确率的前提下,强行插入一些你可能感兴趣的跨界内容。比如你天天看猫,偶尔给你推一条狗的视频,不会让你困在死胡同里。
不过话说回来,这个度真的太难把握了。多样性加太多,用户说推荐不准,体验更差。加太少,还是摆脱不了茧房。我之前帮一家内容平台调这个参数,整整半个月,每天改完参数跑测试,头发掉了快三分之一,最后还是只能找一个各方都能接受的折中方案。
还有个不能不提的问题,就是数据隐私。现在各国对用户数据的管控越来越严,拿不到足够的行为数据,推荐模型根本训不好。现在火的联邦学习就是解决这个问题的,多家平台一起训模型,还不用交换用户原始隐私数据,思路挺巧,就是落地成本太高,小公司根本玩不起。
大模型时代,推荐系统技术的新方向
这两年大模型火了之后,整个推荐圈都在往大模型靠,确实跑出了不少让人惊喜的效果。
原来的推荐,核心逻辑都是“你过去喜欢什么,就给你推什么”。大模型进来之后,第一次真正做到了深度理解用户的实时意图。
比如你现在打开电商平台搜“适合带三岁宝宝去的北京周末景点”,原来的推荐就是把所有带“北京 景点 亲子”标签的内容按热度排序给你。大模型推荐呢,它能结合你之前的行为数据,知道你家有车,怕走山路,不想人挤人,还需要有母婴室,直接给你推三个符合要求的近郊公园,连停车费门票多少钱都给你整理得明明白白。
还有现在火的生成式推荐,不是给你干巴巴的商品列表,直接给你生成一段推荐理由,告诉你为什么这个适合你,体验感比之前好太多。
不过我得吐槽一句,现在很多厂家吹大模型推荐吹得太离谱了。说白了就是换了个壳,把原来的深度学习模型换成大模型,实际准确率提升没几个点,推理成本翻了三五倍,完全就是蹭热点割投资人韭菜。对吧?
真正落地做得好的,都是混合架构。用大模型做线下的特征提取和用户画像生成,用小的精排模型做线上的实时推理,既拿到了大模型的效果,又能保证用户点进来一秒出结果,不会让你等半天加载不出来。
推荐系统技术从诞生到现在,核心其实从来没变过,就是帮你在海量内容里,找到你当下最可能喜欢的东西。从人工规则到深度学习,再到现在的大模型,技术一直在变,本质还是那个猜你喜欢的游戏。
只不过现在猜得越来越准,有时候准到让人害怕——你自己都忘了你想要什么,系统还记得。下次你刷手机的时候,不妨多停两秒,看看眼前这条内容,其实就是一堆算法给你挑的,细想还真挺有意思的。
从规则到深度学习:推荐系统技术的三次跳变
最早的推荐,全靠人工规则。 平台卖得好的放前面,你搜什么关键词就放什么标签的商品,简单粗暴。 后来有了协同过滤。说白了就是抱大腿——找一群和你口味差不多的用户,他们喜欢什么就推给你什么。说实话,早期协同过滤的体验真的差。你就帮朋友买了一次婚礼喜糖,系统给你推半年婚庆用品,烦得我直接卸载过APP。 再后来有了内容-based推荐,按你已经互动过的内容打标签,你点了五篇科幻影评,就一直给你推科幻。倒是不会乱推不相关的,可你想换换口味看看文艺片,门都没有。 直到深度学习杀进来,推荐系统技术才算跨过了一个大坎。
推荐系统技术迭代历程对比图
现在的深度推荐模型,能抓到你自己都意识不到的隐式偏好。你逛女装的时候,在那条酒红色连衣裙上多停留了三秒,哪怕你没点击没加购,系统都能把这个特征记下来,后续给你推同风格的衣服。准确率比十年前的老方法,不知道高了多少倍。
现在推荐系统技术绕不开的两大痛点
技术发展到今天,依然有两个问题,让所有做推荐的算法工程师头秃。 第一个就是新用户冷启动。 新用户刚注册,什么行为都没留下,你给人家推什么?推全网热门榜吗?百分之八十的新用户根本找不到自己喜欢的,转身就走了。 现在行业里常用的办法,是用大模型做用户画像迁移。比如你用社交账号授权登录,大模型可以从你公开发过的内容里,提取出你的兴趣偏好,不用等你互动就能摸个八九不离十。比早年瞎蒙强太多,可还是会出错。我之前碰到过一个案例,用户用他爸妈的账号登录,结果系统把爸妈的喜好安到他身上,推了一堆中老年保健品,闹了大笑话。
推荐系统冷启动业务处理流程图
第二个痛点就是大家天天骂的信息茧房。
你喜欢看萌宠,系统就给你推一年萌宠,你想看点社会新闻都刷不到。你买过一次瑜伽垫,首页半年全是健身器材,你都忘了你其实只是买来当孩子的爬爬垫。
现在的解决思路是做带多样性约束的排序优化,就是在保证推荐准确率的前提下,强行插入一些你可能感兴趣的跨界内容。比如你天天看猫,偶尔给你推一条狗的视频,不会让你困在死胡同里。
不过话说回来,这个度真的太难把握了。多样性加太多,用户说推荐不准,体验更差。加太少,还是摆脱不了茧房。我之前帮一家内容平台调这个参数,整整半个月,每天改完参数跑测试,头发掉了快三分之一,最后还是只能找一个各方都能接受的折中方案。
还有个不能不提的问题,就是数据隐私。现在各国对用户数据的管控越来越严,拿不到足够的行为数据,推荐模型根本训不好。现在火的联邦学习就是解决这个问题的,多家平台一起训模型,还不用交换用户原始隐私数据,思路挺巧,就是落地成本太高,小公司根本玩不起。
大模型时代,推荐系统技术的新方向
大模型时代,推荐系统技术的新方向
这两年大模型火了之后,整个推荐圈都在往大模型靠,确实跑出了不少让人惊喜的效果。
原来的推荐,核心逻辑都是“你过去喜欢什么,就给你推什么”。大模型进来之后,第一次真正做到了深度理解用户的实时意图。
比如你现在打开电商平台搜“适合带三岁宝宝去的北京周末景点”,原来的推荐就是把所有带“北京 景点 亲子”标签的内容按热度排序给你。大模型推荐呢,它能结合你之前的行为数据,知道你家有车,怕走山路,不想人挤人,还需要有母婴室,直接给你推三个符合要求的近郊公园,连停车费门票多少钱都给你整理得明明白白。
还有现在火的生成式推荐,不是给你干巴巴的商品列表,直接给你生成一段推荐理由,告诉你为什么这个适合你,体验感比之前好太多。
不过我得吐槽一句,现在很多厂家吹大模型推荐吹得太离谱了。说白了就是换了个壳,把原来的深度学习模型换成大模型,实际准确率提升没几个点,推理成本翻了三五倍,完全就是蹭热点割投资人韭菜。对吧?
真正落地做得好的,都是混合架构。用大模型做线下的特征提取和用户画像生成,用小的精排模型做线上的实时推理,既拿到了大模型的效果,又能保证用户点进来一秒出结果,不会让你等半天加载不出来。
推荐系统技术从诞生到现在,核心其实从来没变过,就是帮你在海量内容里,找到你当下最可能喜欢的东西。从人工规则到深度学习,再到现在的大模型,技术一直在变,本质还是那个猜你喜欢的游戏。
只不过现在猜得越来越准,有时候准到让人害怕——你自己都忘了你想要什么,系统还记得。下次你刷手机的时候,不妨多停两秒,看看眼前这条内容,其实就是一堆算法给你挑的,细想还真挺有意思的。