🤖 machine learning
Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation
该论文介绍了 AdaGRPO,这是一个增强噪声鲁棒生成式推荐的新型框架,它通过仅将强化学习应用于策略具有不确定性且奖励模型具有判别性的样本,从而在离线指标和在线生产 A/B 测试中均优于统一的强化学习方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一位非常聪明、有创意的助手来向用户推荐电影。你有两种方式来教导这位助手:
- “教科书”法(监督学习): 你向助手展示成千上万个“用户历史 -> 正确电影推荐”的示例。助手通过记忆这些模式进行学习。这种方法安全且稳健,但它可能会陷入重复旧建议的困境。
- “教练”法(强化学习): 你让助手尝试自己猜测电影。然后,一位“教练”(一个排序算法)会观察并给出评分:“猜得好!”或“猜得差!”助手通过学习来追求高分。
问题所在:教练是有缺陷的
论文指出,在现实世界中,这个“教练”并不完美。它是基于一种数据进行训练的,而这些数据中,用户只能看到系统已经展示给他们的电影。这产生了一种偏差:
- “简单”情况: 如果助手已经擅长猜测一部热门电影,教练只会给出一个通用的“做得好!”。所有的猜测得分几乎都一样。助手学不到新东西,甚至更糟——它可能会为了讨好教练而开始随机猜测,从而忘记了真正重要的东西。
- “困难”情况: 如果助手需要猜测一部小众或新出的电影,教练可能会感到困惑。因为教练从未见过这部电影,它可能会给一部无聊的热门电影打高分,而不是给那部正确且独特的电影打高分。如果助手听从了这种错误的建议,它会变得越来越差。
解决方案:AdaGRPO(“选择性教练”)
作者创建了一个名为 AdaGRPO 的新系统。AdaGRPO 不会让教练 100% 地向助手大声喊指令,而是充当一个聪明的守门员。
它在让教练的建议生效之前,会询问两个简单的问题:
- “助手是否遇到了困难?”(策略难度):如果助手已经熟练掌握了答案,那么教练的建议会被忽略,因为那是多余的。
- “教练现在真的有帮助吗?”(奖励辨别力):如果教练感到困惑或存在偏差(例如,比起正确的独特电影,更偏爱热门电影),它的建议就会被忽略。
类比:“选择性导师”
把这想象成一个学生在辅导老师的指导下备考。
- 旧方法: 导师会对学生的每一个答案都大声指点,无论对错。如果导师累了或者有偏见,学生就会感到困惑,并开始犯错。
- AdaGRPO 方法: 只有当两个条件同时满足时,导师才会开口:
- 学生确实卡住了,不知道答案。
- 导师对自己知道正确答案很有信心,而不是在瞎猜。
如果学生已经知道答案,导师就会保持沉默(让学生依靠自己的知识);如果导师也不确定,他们也会保持沉默。这防止了学生养成坏习惯。
结果
团队在一个大型电子商务平台(京东)上测试了该方法:
- 离线测试: 新方法提高了推荐准确度(找到正确商品)的峰值,从 11.01% 提升至 12.18%,同时保持了极低的“幻觉”(编造虚假商品)率。旧方法由于过度试图讨好有缺陷的教练,最终表现变差。
- 真实世界测试: 当他们将此方法应用于真实用户时,它带来了更多的点击量和更长的用户停留时间。
核心结论
论文得出结论,使用 AI 进行推荐的最大挑战不在于构建一个更“聪明”的教练,而在于知道何时信任教练。通过仅在教练真正有帮助且学生确实遇到困难时才去倾听,系统可以学得更快,也更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。