← 最新论文
🤖 machine learning

Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

本文提出了一种统一的、与模型无关的框架,用于通过识别早期预测性会话行为并推导下游奖励信号,来优化大规模推荐系统中的长期用户参与度,该框架已成功部署于 Pinterest 的多个场景中,以提升留存指标。

原作者: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven B
发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven Badani, Yijie Dylan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正漫步在一座宏大且无尽的图书馆中,书架会根据你的注视而重新排列。这就是推荐系统的世界,是 Pinterest、TikTok 和 Netflix 等应用背后的隐形引擎。它们的任务是猜测你下一步会喜欢什么。长期以来,这些系统就像是不耐烦的导游:它们只关心你现在是否停下来看了一眼展品。如果你点击了一张图片,它们会立刻为你展示十张类似的图片。但问题在于:如果只向人们展示他们已经熟悉的东西,他们会感到厌倦并最终停止造访这座图书馆。科学家们试图解决的大问题是:我们该如何推荐那些能让人们在数月甚至数年内都持续回访的内容,而不仅仅是吸引他们度过接下来的五分钟?

为了回答这个问题,研究人员必须应对一个棘手的现实:我们无法轻易预知未来。我们不能通过等待一个月看用户是否回归,来决定今天该向他们展示什么。因此,与其直接预测未来,不如寻找“线索”——即那些通常发生在用户决定留下来之前的微小行为。这篇论文正是关于如何寻找这些线索,并教会图书馆的导游如何遵循这些线索,从而将一次短暂、乏味的访问转变为一场漫长而精彩的冒险。


问题所在:“点击陷阱” (The "Click-Trap")

想象你在参加一场嘉年华。一个游戏摊位提供只要你转动轮盘就能获得免费糖果。你转动了轮盘,得到了糖果,然后离开了。摊主很高兴,因为你转动了轮盘,但你再也不会回来了。这就是当推荐系统只关注短期信号(如快速点击或一秒钟的瞥视)时发生的情况。它们获得了大量的“旋转”,但用户却感到厌倦,并永远离开了嘉年华。

这篇论文的作者(任职于 Pinterest)意识到,优化即时点击实际上正在损害其平台的长期健康。他们想要构建一个不仅会说“这里有你可能感兴趣的东西”,而且会说“这里有能让你留下来、探索并希望明天再次光临的东西”的系统。

解决方案:“兔子洞”侦探 (The "Rabbit Hole" Detective)

团队提出了一个聪明的想法:与其等待看用户下周是否回归(这很难追踪且效率低下),不如寻找下游奖励 (Downstream Rewards)。这就像是一个寻找足迹的侦探。如果用户深入探索了一个相关的“兔子洞”、保存了一张图片,或者花费了很长时间进行探索,这些都是强有力的足迹,表明:“这个人玩得很开心,并且很可能会回来。”

该论文提出了一个模型无关 (model-agnostic) 的框架。“模型无关”是一个高级说法,意思是指“它适用于任何类型的推荐引擎”,无论是一个简单的列表还是复杂的 AI。他们并不只是凭直觉猜测哪些行为是好的;他们运行了一个大规模的离线筛选过程,以找到那些真正能预测长期忠诚度的特定行为。

三个黄金线索

通过分析,他们确定了三种主要的“奖励”(线索),这些线索能带来快乐且会回访的用户:

  1. 深度探索 (更深的会话参与度):
    这不仅仅是关于点击,更是关于你走得有多深。论文发现,如果用户点击一个 Pin 图,然后立即深入到一个“P2P 兔子洞”(一系列相关的 Pin 图链条)中,或者保存它、下载它,这就是一次巨大的成功。

    • 比喻: 这就像是仅仅窥视一个房间与真正搬进去住的区别。系统学会了去奖励那些愿意花时间探索“兔子洞”而非仅仅停留在表面的人。
    • 结果: 他们发现,这些深度行为与用户的回访行为强相关。事实上,拥有这些深度行为的会话显著缩短了用户再次访问应用的时间间隔。
  2. “假装兴趣”惩罚 (负面奖励):
    并非所有的点击都是好事。团队发现,某些“放大查看”(缩放图像)的行为实际上是无聊的信号。如果用户放大查看的时间不到一秒钟就立即离开,这就是一次“浅层放大”。

    • 比喻: 想象有人走进一家商店,拿起一件商品,看了一眼就立刻放下。他们并不感兴趣,只是在消磨时间。
    • 对策: 系统现在将这些瞬间的瞥视视为负面奖励。这就像导游在说:“嘿,别再给这个人展示这个东西了,他们显然并不喜欢。”他们甚至发现不同类型的用户需要不同的规则:“核心”用户需要 1 秒钟的阈值才会被视为浅层行为,而“非核心”用户只需 0.5 秒。
  3. 新的冒险 (用例采纳):
    有时,用户会陷入旧兴趣的循环中。论文引入了用例采纳 (Use Case Adoption) 的奖励。这发生在用户参与了与他们通常模式完全不同的新事物时。

    • 比喻: 如果一个用户平时看“猫咪视频”,而系统向他展示了一个“如何修理自行车”的视频,而他真的观看并保存了它,这就是一次胜利。这意味着系统成功扩展了他的视野。
    • 目标: 这鼓励 AI 向用户展示他们原本不知道自己想要的东西,帮助他们建立新的爱好和兴趣,从而让他们在平台上停留更久。

引擎室:他们是如何实现的

你可能会问:“如何在不减慢应用速度的情况下计算这一切?”作者构建了一个名为 DRv2 的新基础设施。

  • 旧方式: 他们以前使用巨大的批处理来预计算所有这些奖励,这需要数周时间才能更新。如果他们想测试一个新想法,必须等待数周。
  • 新方式: 他们构建了一个可以在数据被读取时实时计算这些奖励的系统。这把测试新想法的时间从 3 周缩短到了 2 天。这就像是从每次想吃一片蛋糕都要从头开始烘焙,变成了拥有一个神奇的机器,每当你想要时,它都能立即组装出一片新鲜的蛋糕。

结果:真的有效吗?

团队通过 A/B 测试(向一组人展示旧系统,向另一组人展示新系统)在现实世界中测试了这些想法。结果是一致且积极的:

  • 更成功的会话: 用户进行有意义行为(如保存或下载)的会话数量全面增长了 +0.36%
  • 更多停留时间: 用户在应用中的停留时间增加了,总时长增加了 +0.10%
  • 更好的留存率: 最重要的是,核心用户的周活跃用户数 (WAU) 增加了 +0.1%。这证明了该系统不仅仅是在诱导点击,它确实让人们想要回来。
  • 跨场景成功: 他们不仅修复了“首页”(主页面),还将同样的逻辑应用于了搜索 (Search)相关 Pin 图 (Related Pins)通知 (Notifications)。在搜索领域,“达成率”(即搜索导致实际行动的频率)上升了 +0.25%

总结

这篇论文表明,保持用户快乐的秘诀不仅仅是向他们展示他们已经喜欢的东西,而是引导他们进入更深层、更有意义的互动。通过奖励“深度探索”、惩罚“假性点击”并鼓励“新的冒险”,系统可以将一次匆匆一瞥转化为一段长期的关系。

作者谨慎地指出,这并不是解决一切问题的万灵药,但它是一个强大且灵活的工具,可以应用于应用的各个部分。通过关注旅程的质量而非点击的速度,他们成功构建了一个让推荐系统感觉不像自动售货机,而更像是一位懂得如何延续话题的贴心好友。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →