← 最新论文
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

本文介绍了 PRL-PUTS,这是一个生产就绪、与排序器无关的强化学习框架,它通过帕累托扫描自动化地执行个性化效用权重调整,以动态优化 Pinterest 首页信息流中的多目标权衡,从而在无需增加服务延迟的情况下显著提升用户参与度。

原作者: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,Pinterest 就像一座庞大而繁忙的图书馆,数百万本书(Pin)正不断被推荐给访客。图书馆里有一位非常聪明的图书管理员(排序器),他审视每一本书,并根据不同标准预测特定访客可能喜欢的程度:“他们会点击这本书吗?”“他们会把它保存到图板吗?”“他们会看到相关图片吗?”

旧方法:“一刀切”的规则手册

过去,图书馆管理者必须决定如何将这些预测合并为一个单一分数,以决定优先展示哪些书。他们使用一个简单的公式:

总分 = (点击量 × 权重 A) + (保存量 × 权重 B)

问题在于,权重 A权重 B是手动设定的。如果管理者想要更多的保存量,他们就会手动调高权重 B。但这既缓慢又僵化,并且对所有人都应用完全相同的规则。一个寻找派对创意的青少年和一个寻找家居装饰的专业人士,即使需求截然不同,却得到了完全相同的推荐“配方”。这就像一位厨师,为婴儿准备的汤和为资深美食评论家准备的汤,使用了完全相同分量的盐。

新解决方案:PRL-PUTS(智能、自适应的副厨师)

这篇论文介绍了PRL-PUTS,这是一个新系统,就像一位站在图书管理员身旁的智能、自适应的副厨师。

  1. 它不重写图书管理员:主要的图书管理员(排序器)保持原样。PRL-PUTS 不试图重新训练图书管理员或改变他们阅读书籍的方式。它只是位于他们之上。
  2. 它实时调整配方:对于每一次访客请求,PRL-PUTS 都会查看上下文(这个人是谁?他们此刻在做什么?),并立即决定:“对于这位特定访客,让我们稍微强调‘保存’多一点,”或者“对于这位访客,让我们更强调‘相关图片’。”
  3. 它从经验中学习:PRL-PUTS 不是猜测权重,而是一个强化学习智能体。它以安全、受控的方式尝试不同的“配方”(权重组合),观察结果(用户是否参与了?),并学习哪种配方最适合哪种类型的人。

“帕累托扫描”技巧:选项菜单

管理推荐系统最困难的部分之一是,你无法在所有方面都获胜。如果你过于追求“保存量”,可能会导致“点击量”减少。

这篇论文引入了一种巧妙的治理工具,称为帕累托扫描。想象一下,系统不仅仅选择一个最佳配方,而是生成一整套可能的配方菜单(即“帕累托前沿”)。

  • 配方 A:最大化保存量,略微降低点击量。
  • 配方 B:完美的平衡。
  • 配方 C:最大化点击量,略微降低保存量。

业务领导者(利益相关者)可以查看这份菜单,并说:“今天,我们的目标是获得更多保存量,所以让我们将系统切换到配方 A。”他们可以通过转动一个单一的旋钮(一个称为α\alpha的参数)立即做到这一点,而无需重新训练整个 AI 模型或等待数周的新更新。

在现实世界中的运作方式(Pinterest 首页信息流)

团队在 Pinterest 首页信息流(用户登录时看到的主要信息流)上测试了该系统。

  • 速度:它运行得如此之快,以至于用户感觉不到任何延迟。这就像一位服务员在食物已经摆盘时,向厨师低声提出建议。
  • 安全性:如果系统出现故障,它会立即回退到旧的、安全的手动权重。
  • 结果:当他们将旋钮调至为某些用户偏好“保存量”时,他们观察到“成功会话”(用户实际做出积极行为的会话)增加了0.13%。这听起来可能很小,但在拥有数百万用户的平台上,这是一个巨大的胜利。

关键要点

这篇论文证明,你不需要完全重建推荐引擎就能使其更智能。通过添加一个小型的智能层,为每一位用户个性化“配方”,并为管理者提供权衡选项菜单,你可以获得更好的结果,更快地适应业务变化,并保持系统稳定。

简而言之:PRL-PUTS 将僵化的全球规则手册转变为系统与用户之间灵活、个性化的对话,由业务领导者可以根据需要随时转动以调整优先级的简单旋钮来管理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →