Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling
本文介绍了一个在十亿级用户规模下生产部署的短视频推荐框架,该框架通过使用紧凑的语义 ID(Semantic IDs)取代稀疏的视频 ID(Video IDs),并引入全局感知压缩 Transformer(Global-Aware Compression Transformer)来高效建模超长用户行为序列,克服了传统的序列建模局限性,从而实现了计算成本的显著降低和用户参与度的实质性提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图向读者推荐完美书籍的图书管理员。但这位读者不是看了几本书,而是观看了成千上万个短视频。你的任务是记住所有的这些视频,从而猜出他们接下来想看什么。
这篇论文描述了谷歌构建的一个新系统,专门用于处理这类短视频(如 TikTok 或 YouTube Shorts)的任务。他们面临了两个让这项任务几乎变得不可能完成的巨大难题,并用两个聪明的技巧解决了它们。
两个大问题
1. “名牌”问题(表示瓶颈 / Representation Bottleneck)
想象一下,世界上每个视频都有一个唯一的、随机的 ID 数字,就像烤面包机上的序列号一样。
- 问题所在: 如果你有十亿个视频,你就需要十亿个不同的 ID 标签。这些标签只是随机数字;它们无法告诉你关于视频的任何信息。一个关于“猫”的视频和一个关于“车”的视频,其 ID 可能看起来完全没有关联。
- 结果: 计算机必须分别记住每一次交互。这就像试图记住十亿个随机电话号码一样。而且,当出现一个新视频(“冷启动”)时,系统完全不知道它是什么,因为它从未见过这个新的随机 ID。
2. “记忆过载”问题(计算瓶果 / Computational Bottleneck)
想象一下,你在读一本每一页都与其他所有页面相连的书。
- 问题所在: 为了理解一个包含 2,000 个视频的历史记录,标准的计算机大脑(Transformer)会尝试将每一个视频与每一个其他视频进行比较。如果你将视频数量增加一倍,工作量不仅仅是翻倍,而是变为原来的四倍。这会让计算变得极其沉重,导致计算机内存耗尽并崩溃,或者处理速度过慢。
解决方案:两个新技巧
作者构建了一个能同时解决这两个问题的系统。
技巧 #1:“智能分类”系统(语义原生 ID / Semantic-Native IDs)
他们不再使用随机的序列号,而是根据视频实际的内容赋予了它们有意义的标签。
- 类比: 想象一下,不再是随机数字,而是每个视频都被贴上了“类别”和“子类别”的标签。
- 旧方式: 视频 #99283(随机)。
- 新方式: 视频 = “游戏” + “射击”。
- 运作方式: 他们使用一种特殊的 AI 将视频分层归类。对于长期的历史记录,他们只使用了这个层级结构中的前两层(例如,仅使用“游戏”和“射击”)。
- 益处:
- 更小的图书馆: 他们不再需要十亿个标签,只需要为这些类别准备标签即可。这缩小了存储“字典”所需的内存。
- 更好的预测: 如果一个用户喜欢“游戏-射击”类的视频,而出现了一个新的“游戏-射击”类视频,系统能立刻知道要推荐它,即使它以前从未见过这个视频。这解决了“冷启动”问题。
技巧 #2:“分组”策略(全局感知压缩 / Global-Aware Compression)
系统不再逐一查看每一个视频,而是将它们组合成“超级块”。
- 类比: 想象你在读一本 2,000 页的日记。
- 旧方式: 你阅读每一个字,并尝试将每一个字与每一个其他字联系起来。太累了!
- 新方式: 你每 4 页一组,将它们粘在一起变成一个“超级页面”。现在你只需要阅读 500 个“超级页面”。
- 运作方式: 他们将 4 个连续的视频堆叠在一起,组成一个大的“超级 Token”。这使计算机需要处理的项目减少了 4 倍。
- 益处:
- 速度更快: 因为需要比较的项目变少了,计算机运行得更快,且使用的内存大幅减少(减少了 92%!)。
- 更聪明的阅读: 通过将页面粘合在一起,计算机可以在看到大局的同时,还能看到该组内的细节(例如,用户对特定视频序列的反应)。
- “全局锚点”: 他们在列表开头添加了一个特殊的“全局问题”Token。可以把它想象成一位图书管理员在问:“这个人生活的整体氛围是怎样的?”这有助于系统平衡近期视频的具体细节与用户的长期个性。
结果
当他们在现实世界中使用数十亿用户进行测试时:
- 它更快了: 该系统使用的计算机内存更少,运行速度更快。
- 它记得更多了: 因为速度更快,他们可以向系统输入 2,000 个视频的历史记录,而不是之前的 800 个。
- 人们更开心了: 用户观看他们喜欢的视频更多了,观看时长增加了,并且发现了更多令他们愉悦的新内容。
总结
这篇论文关于构建一个能够记住用户整个视频历史而不产生“头痛”的推荐引擎。他们通过赋予视频有意义的名字(而非随机数字),以及通过将视频分组成块(从而让计算机不必单独对每一个视频进行数学运算)来实现这一目标。结果是一个运行更快、成本更低且能做出更好推荐的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。