Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning
本文提出了一种统一的、与模型无关的框架,用于通过识别早期预测性会话行为并推导下游奖励信号,来优化大规模推荐系统中的长期用户参与度,该框架已成功部署于 Pinterest 的多个场景中,以提升留存指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正漫步在一座宏大且无尽的图书馆中,书架会根据你的注视而重新排列。这就是推荐系统的世界,是 Pinterest、TikTok 和 Netflix 等应用背后的隐形引擎。它们的任务是猜测你下一步会喜欢什么。长期以来,这些系统就像是不耐烦的导游:它们只关心你现在是否停下来看了一眼展品。如果你点击了一张图片,它们会立刻为你展示十张类似的图片。但问题在于:如果只向人们展示他们已经熟悉的东西,他们会感到厌倦并最终停止造访这座图书馆。科学家们试图解决的大问题是:我们该如何推荐那些能让人们在数月甚至数年内都持续回访的内容,而不仅仅是吸引他们度过接下来的五分钟?
为了回答这个问题,研究人员必须应对一个棘手的现实:我们无法轻易预知未来。我们不能通过等待一个月看用户是否回归,来决定今天该向他们展示什么。因此,与其直接预测未来,不如寻找“线索”——即那些通常发生在用户决定留下来之前的微小行为。这篇论文正是关于如何寻找这些线索,并教会图书馆的导游如何遵循这些线索,从而将一次短暂、乏味的访问转变为一场漫长而精彩的冒险。
问题所在:“点击陷阱” (The "Click-Trap")
想象你在参加一场嘉年华。一个游戏摊位提供只要你转动轮盘就能获得免费糖果。你转动了轮盘,得到了糖果,然后离开了。摊主很高兴,因为你转动了轮盘,但你再也不会回来了。这就是当推荐系统只关注短期信号(如快速点击或一秒钟的瞥视)时发生的情况。它们获得了大量的“旋转”,但用户却感到厌倦,并永远离开了嘉年华。
这篇论文的作者(任职于 Pinterest)意识到,优化即时点击实际上正在损害其平台的长期健康。他们想要构建一个不仅会说“这里有你可能感兴趣的东西”,而且会说“这里有能让你留下来、探索并希望明天再次光临的东西”的系统。
解决方案:“兔子洞”侦探 (The "Rabbit Hole" Detective)
团队提出了一个聪明的想法:与其等待看用户下周是否回归(这很难追踪且效率低下),不如寻找下游奖励 (Downstream Rewards)。这就像是一个寻找足迹的侦探。如果用户深入探索了一个相关的“兔子洞”、保存了一张图片,或者花费了很长时间进行探索,这些都是强有力的足迹,表明:“这个人玩得很开心,并且很可能会回来。”
该论文提出了一个模型无关 (model-agnostic) 的框架。“模型无关”是一个高级说法,意思是指“它适用于任何类型的推荐引擎”,无论是一个简单的列表还是复杂的 AI。他们并不只是凭直觉猜测哪些行为是好的;他们运行了一个大规模的离线筛选过程,以找到那些真正能预测长期忠诚度的特定行为。
三个黄金线索
通过分析,他们确定了三种主要的“奖励”(线索),这些线索能带来快乐且会回访的用户:
深度探索 (更深的会话参与度):
这不仅仅是关于点击,更是关于你走得有多深。论文发现,如果用户点击一个 Pin 图,然后立即深入到一个“P2P 兔子洞”(一系列相关的 Pin 图链条)中,或者保存它、下载它,这就是一次巨大的成功。- 比喻: 这就像是仅仅窥视一个房间与真正搬进去住的区别。系统学会了去奖励那些愿意花时间探索“兔子洞”而非仅仅停留在表面的人。
- 结果: 他们发现,这些深度行为与用户的回访行为强相关。事实上,拥有这些深度行为的会话显著缩短了用户再次访问应用的时间间隔。
“假装兴趣”惩罚 (负面奖励):
并非所有的点击都是好事。团队发现,某些“放大查看”(缩放图像)的行为实际上是无聊的信号。如果用户放大查看的时间不到一秒钟就立即离开,这就是一次“浅层放大”。- 比喻: 想象有人走进一家商店,拿起一件商品,看了一眼就立刻放下。他们并不感兴趣,只是在消磨时间。
- 对策: 系统现在将这些瞬间的瞥视视为负面奖励。这就像导游在说:“嘿,别再给这个人展示这个东西了,他们显然并不喜欢。”他们甚至发现不同类型的用户需要不同的规则:“核心”用户需要 1 秒钟的阈值才会被视为浅层行为,而“非核心”用户只需 0.5 秒。
新的冒险 (用例采纳):
有时,用户会陷入旧兴趣的循环中。论文引入了用例采纳 (Use Case Adoption) 的奖励。这发生在用户参与了与他们通常模式完全不同的新事物时。- 比喻: 如果一个用户平时看“猫咪视频”,而系统向他展示了一个“如何修理自行车”的视频,而他真的观看并保存了它,这就是一次胜利。这意味着系统成功扩展了他的视野。
- 目标: 这鼓励 AI 向用户展示他们原本不知道自己想要的东西,帮助他们建立新的爱好和兴趣,从而让他们在平台上停留更久。
引擎室:他们是如何实现的
你可能会问:“如何在不减慢应用速度的情况下计算这一切?”作者构建了一个名为 DRv2 的新基础设施。
- 旧方式: 他们以前使用巨大的批处理来预计算所有这些奖励,这需要数周时间才能更新。如果他们想测试一个新想法,必须等待数周。
- 新方式: 他们构建了一个可以在数据被读取时实时计算这些奖励的系统。这把测试新想法的时间从 3 周缩短到了 2 天。这就像是从每次想吃一片蛋糕都要从头开始烘焙,变成了拥有一个神奇的机器,每当你想要时,它都能立即组装出一片新鲜的蛋糕。
结果:真的有效吗?
团队通过 A/B 测试(向一组人展示旧系统,向另一组人展示新系统)在现实世界中测试了这些想法。结果是一致且积极的:
- 更成功的会话: 用户进行有意义行为(如保存或下载)的会话数量全面增长了 +0.36%。
- 更多停留时间: 用户在应用中的停留时间增加了,总时长增加了 +0.10%。
- 更好的留存率: 最重要的是,核心用户的周活跃用户数 (WAU) 增加了 +0.1%。这证明了该系统不仅仅是在诱导点击,它确实让人们想要回来。
- 跨场景成功: 他们不仅修复了“首页”(主页面),还将同样的逻辑应用于了搜索 (Search)、相关 Pin 图 (Related Pins) 和通知 (Notifications)。在搜索领域,“达成率”(即搜索导致实际行动的频率)上升了 +0.25%。
总结
这篇论文表明,保持用户快乐的秘诀不仅仅是向他们展示他们已经喜欢的东西,而是引导他们进入更深层、更有意义的互动。通过奖励“深度探索”、惩罚“假性点击”并鼓励“新的冒险”,系统可以将一次匆匆一瞥转化为一段长期的关系。
作者谨慎地指出,这并不是解决一切问题的万灵药,但它是一个强大且灵活的工具,可以应用于应用的各个部分。通过关注旅程的质量而非点击的速度,他们成功构建了一个让推荐系统感觉不像自动售货机,而更像是一位懂得如何延续话题的贴心好友。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。