← 最新论文
🤖 machine learning

Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting

本文提出了一种用于直播推荐的可扩展多目标排序系统,该系统通过一个分段感知目标模块和一个参数高效的多门控混合专家(MMoE)架构,有效地平衡了新鲜和延迟的用户信号,从而在不同用户群体中显著提升了日活跃观众数、参与度和营收。

原作者: Xiaoyi Gu, Julia Tavares, Eder Santana, Carlos Mendoza-Cardenas, Nikita Mishra, Saad Ali

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyi Gu, Julia Tavares, Eder Santana, Carlos Mendoza-Cardenas, Nikita Mishra, Saad Ali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一个巨大且繁忙的数字广场上,成千上万的人在那里不断地表演、聊天并分享故事。这就是直播的世界,一个实时发生奇迹的地方。但对于运营这个广场的人来说,有一个棘手的难题:如何决定把哪位表演者展示给哪位访客?这就是“推荐系统”的工作——一个数字媒人,试图猜测你下一步会爱上什么。

在过去,这些媒人就像是热心的图书管理员,只关心你此时此刻拿起的那本书。但在直播领域,故事要复杂得多。有时,一名观众可能会看一位主播几分钟,聊一会儿天,然后离开。他们可能几天后才回来,或者可能在几周后突然决定订阅或打赏。这些行为就像是种在土里的种子;它们不会立即发芽。如果媒人只关注接下来的五分钟内发生了什么,它就会错过那些未来会成长起来的种子。此外,这个广场里充满了不同类型的人:有些人是只想看一场快闪表演的新游客,而另一些人则是想要与表演者建立深厚友谊的老常客。如果对每个人都一视同仁,往往会导致糟糕的推荐。本文探讨了如何构建一个更聪明的媒人,既能理解眼前的兴奋感,也能理解这些关系的长期成长。


挑战:“等待观察”问题

来自 Twitch 的论文作者们面临着一个独特的头痛问题。在网上购物时,如果你点击了一个产品但没有购买,你可能以后也不会买了。但在直播中,一名观众可能会点击一个频道,观看一段时间,然后在三天后回来关注主播,甚至支付订阅费用。

问题在于,这些“大”动作(如关注或消费)非常稀少且发生缓慢。如果计算机试图立即从中学习,它看到的主要是“否”的答案,这会让系统感到困惑。这就像是通过只看制作过程的前五分钟来学习如何烤蛋糕;你永远不会知道这个蛋糕最后是否真的做成功了。此外,系统正在产生偏差。因为“超级粉丝”(他们聊天和消费很多)产生了大量数据,计算机学会了如何极好地取悦他们,以至于忘记了那些只想浅尝辄止的新用户和普通观众。

解决方案:三部分策略

为了解决这个问题,团队构建了一个新的排序系统,使用了三个聪明的技巧,就像一支由专业侦探组成的团队。

1. 时光旅行窗口(延迟信号)
首先,他们意识到需要停止过快地评判观众的兴趣。他们不再问:“他们现在喜欢吗?”,而是问:“他们在接下来的两周内喜欢吗?”他们创建了一个为期 14 天的“延迟窗口”。如果一名观众点击了一个频道,并在两周内决定聊天、关注或消费,系统就会将其计为“是”。这把稀疏、零散的事件转化为了更清晰的图景,帮助计算机理解,缓慢的反应仍然可以是一种积极的反馈。

2. 双队协作法(新鲜 vs. 延迟)
接着,他们意识到并非所有行为都是一样的。有些行为(如点击或观看几分钟)是即时的;而有些行为(如关注或消费)则需要时间。因此,他们将工作进行了拆分。

  • 新鲜团队 (FSM): 这个团队专注于即时反应。他们观察观众此时此刻的行为,以预测他们是否会停留几分钟。
  • 延迟团队 (DSM): 这个团队关注长远目标。他们利用那个 14 天的窗口来预测观众最终是否会关注或消费。
    通过拥有两个独立的团队,系统不会感到困惑。它不会把一次快速的“点击”与一次深度的“订阅”混为一谈。

3. 个性化教练(分层感知目标)
最后,他们注意到新观众和超级粉丝的需求是不同的。新观众需要被充满激情的短内容吸引,以保持留存;而超级粉丝则准备好进行更深层的连接,并可能想要在经济上支持主播。
系统现在扮演着一位了解玩家水平的教练。对于新观众,它优先考虑让他们观看和聊天;对于忠实粉丝,它优先考虑帮助他们找到想要支持的频道。它通过根据观看者的身份调整推荐的“分数”来实现这一点,而无需为每个群体构建一套完全不同的系统。

核心秘诀:MMoE

为了在不减慢计算机速度的情况下实现这一切,他们使用了一种名为多门控混合专家模型 (Multi-gate Mixture-of-Experts, MMoE) 的智能架构。想象一家餐厅,有一位主厨和几位专业的副厨:

  • 一位副厨擅长“快速开胃菜”(即时点击)。
  • 其他副厨则是“复杂主菜”(深度参与和消费)的专家。
    “门控”则是决定在面对特定顾客时听取哪位厨师建议的侍者。这使得系统能够同时学习所有这些不同的目标,同时保持数学计算的高效。事实上,通过使用这种方法,与为每种目标运行单独模型相比,他们减少了 41.9% 的计算机参数(即模型的“脑细胞”),同时获得了更好的结果。

结果:双赢局面

团队用数百万真实用户测试了这个新系统。结果令人振奋:

  • 更多观众: 日活跃观众数 (DAV) 增长了 0.09%。虽然听起来很小,但在拥有数百万用户的世界里,这相当于每年增加了数百万个“观众日”。
  • 快乐的粉丝: 对于忠实粉丝,其“封顶每用户平均收入 (ARPU)”增加了 0.56%,这意味着最活跃的用户在支持他们喜爱的主播方面投入了更多。
  • 新朋友: 系统帮助新观众留了下来,提升了他们的参与度,增幅为 0.15%
  • 更多关注: 新频道的关注数增加了 0.27%

更棒的是,该系统速度极快。它能在不到 110 毫秒(比眨眼还快)的时间内做出这些复杂的决策,证明了你可以既聪明又迅速。他们甚至在移动端 App 上进行了测试,发现点击和点赞等正面互动增加了 1.12%

他们没做的事情

作者谨慎地指出了一些不起作用的方法。他们曾尝试通过在训练过程中增加新观众数据的权重(本质上是在计算机面前对着新用户“大声喊叫”)来消除对新观众的偏见,但这并没有帮助,反而让事情变得复杂。相反,他们发现,在模型训练完成后、在进行推荐的瞬间调整权重才是关键。他们还发现,试图将所有目标放入一个单一的庞大模型中会使系统对即时参与度的预测变差,这证明了将“新鲜”和“延迟”信号分开处理至关重要。

简而言之,这篇论文表明,要构建一个优秀的直播推荐系统,你必须有足够的耐心去等待种子发芽,足够聪明去区别对待新老粉丝,并且足够高效,能在眨眼之间完成这一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →