Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation
本文介绍了 Shape Your Feed (SYF),这是一个基于大语言模型(LLM)的智能体系统,它通过三层架构以实时、对话式的协同策展取代了被动排序,并通过离线对齐准确度和大规模在线 A/B 测试,证明了其在提升信息流相关性和用户情绪方面的显著改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的手机是一个充满魔力的、无尽的内容自助餐厅——视频、帖子和故事正被一位非常忙碌的隐形厨师端上桌来。多年来,这位厨师一直在黑暗中工作,仅根据你以前吃过的东西来猜测你的喜好。如果你在一张猫的照片前停留了很久,厨师就会假设你想看一千张猫的照片。如果你划过了某个食谱,他们就假设你讨厌烹饪。这被称为“被动排序”(passive ranking),虽然它很擅长猜测,但往往会失之毫厘,因为它听不见你的声音。它不知道你是真的想看那只猫,还是只是停下来摸了摸自己的宠物。
最近,一种被称为大语言模型(LLM)的新技术出现了。可以将它们想象成超级聪明、健谈的助手,它们不仅能理解你的点击,还能理解你的言语。它们可以倾听你的声音,阅读你的文本信息,并理解你情绪的细微差别。对于构建推荐系统的科学家们来说,一个大问题是:我们能否教会这个健谈的助手接管厨房?我们能否让你告诉厨师:“其实我今天看腻了猫;给我来点关于太空的知识吧,”并让厨师瞬间更换菜单?这就是“对话式推荐”(conversational recommendation)的挑战——从一个猜测你品味的系统,转向一个倾听你指令的系统。
“塑造你的动态”系统:一位倾听的厨师
在他们的论文中,来自 Meta 的研究团队介绍了一个名为 Shape Your Feed (SYF) 的新系统。他们建立了一个数字厨房,这里的厨师不仅会猜测,还会倾听、学习,并根据你的直接指令实时调整菜单。SYF 不再是一个等待你点击“不喜欢”的被动系统,而是一个“智能体”(agentic)系统,这是一个高级说法,意指它像一个能够代表你采取行动的智能助手。
研究人员发现,通过将健谈的 AI 与传统的推荐引擎相结合,可以创造出一个感觉更像是“属于你”的动态。他们展示了当用户可以与系统交谈,或使用智能按钮来表达确切需求时,系统在展示正确内容方面的表现会大幅提升。
魔法是如何发生的:三流向厨房
SYF 系统就像厨房里的一个由三部分组成的团队,每一部分都有特定的职责:
1. 感知流(耳朵与大脑)
这是系统倾听你的地方。你可能会输入“我想看更多烹饪视频,但不要辣的食物”,或者用语音说“少给我看点政治内容”,亦或是点击一个写着“我对这个话题腻了”的智能按钮。感知流将这些混乱的人类指令转化为清晰、有组织的“语义画像”(Semantic Profile)。你可以把它想象成厨师根据你含糊不清的订单写下的一份整洁的购物清单。它会记住你的历史记录,所以如果你昨天说“不要政治”,今天说“更多科技”,它会相应地更新这份清单。它甚至会在你说话的同时,悄悄去抓取一些符合你新清单的“食材”(视频或帖子)。
2. 服务流(摆盘与呈递)
一旦清单准备就绪,服务流便接管了工作。它会查看系统通常会向你展示的海量内容(“候选池”),并开始进行排序。它利用厨师的新购物清单来进行以下操作:
- 添加: 拉入符合你新兴趣的新鲜项目。
- 修剪: 剔除任何违反你规则的项目(比如那些你禁掉的政治帖子)。
- 重排: 重新排列盘中的顺序,让那些你要求的项目排在最前面。
至关重要的一点是,这一切发生得极快。系统不仅仅是猜测;它使用一种智能评分方法来决定你的新请求应该在多大程度上改变排序。它将你的明确指令与系统对你喜好的既有认知进行融合,确保你不会仅仅因为要求了一点改变,就失去了所有你最喜欢的内容。
3. 自进化流(试吃员)
这是让系统随着时间推移变得越来越聪明的环节。在系统为你呈上“餐点”后,它会观察你的行为。你是吃了那段新的烹饪视频吗?还是把那篇科技帖子扔掉了?它还会使用一组“评委”AI 来检查系统的决策是否正确。如果系统犯了错,它会从中学习。研究人员使用了一种名为**直接偏好优化(DPO)**的技术,这就像厨师在严厉的食评人指导下不断练习,直到掌握完美的口味。这个循环确保系统不仅仅是执行一次指令,而是每次都能做得更好。
研究发现:实践证明一切
研究人员不仅构建了这个系统,还对其进行了测试以验证其有效性。
离线测试(演习阶段)
首先,他们测试了系统的“对齐评分”模块——即决定一个帖子是否符合你请求的部分。他们将新系统与仅根据少量示例进行猜测的旧方法进行了对比。
- 旧的“少样本”(few-shot)方法大约有 83.84% 的决策是正确的。
- 经过“评委”AI 训练并结合真实用户数据进行精炼(SFT + DPO)后的新系统,决策正确率达到了 98.85%。
- 此外,它的速度极快,对一组项目进行评分仅需 323 毫秒,足以保证你的手机不会出现卡顿。
在线测试(正式开餐)
随后,他们在美加地区向真实用户推出了 SYF 系统,持续了数月。他们将用户分为两组:一组使用旧系统,另一组使用新的“塑造你的动态”系统。
- 用户非常喜爱新的控制方式: 当用户在旧的静态按钮和新的“上下文感知反馈药丸”(根据当前浏览内容变化的智能按钮)之间做出选择时,76.02% 的用户选择了后者。
- 减少了用户厌恶的内容: 新系统成功减少了用户忽略或不喜欢帖子的数量。“忽略帖子”率下降了 1.70%,“不喜欢帖子”率下降了 2.74%。这意味着系统在过滤用户不想要的内容方面做得更好。
- 增加了探索性: 用户开始更频繁地探索新兴趣,“兴趣消费”增长了 0.16%。这表明系统不仅是在隐藏内容,还在帮助用户发现他们真正喜欢的新事物。
这意味着什么
这篇论文表明,我们可以摆脱那些仅根据过去点击行为来猜测我们需求的系统。通过加入一层能够理解并执行我们语言的 AI,我们可以创造出感觉更具个性化且更少挫败感的动态流。研究人员发现,这种方法在现实世界中表现出色,能让用户更满意,并减少他们跳过内容的情况。
然而,作者也谨慎地指出,该系统依赖于你的“发声”。如果你从不告诉系统你的需求,它就会退回到旧的、被动的猜测模式。他们建议,未来的版本可能需要更加主动,例如在你意识到自己感到乏味之前就先询问你,以帮助那些不喜欢主动提供反馈的用户。但就目前而言,Shape Your Feed 证明了:一个会倾听的推荐系统,确实是一个表现更好的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。