← 最新论文
🤖 AI

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

TokenMinds 是一个工业级系统,它扩展了 PLUM 框架,通过预训练的 LLM 架构生成离散且具有语义对齐的用户 Token 以及稠密嵌入,成功统一了长视频与短视频行为以降低成本,同时在大规模 YouTube 排序系统中展示了互补价值。

原作者: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hon
发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hong, Li Wei, Xinyang Yi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图了解一个人的电影品味。在过去,推荐系统(比如 YouTube 上的系统)试图通过获取一个人观看视频的整个历史记录,将其压缩成一张单一、微小的、稠密的“总结卡”。这就像是试图通过在便利贴上写一句话来描述一整部小说。你会丢失大量的细微差别、具体细节和独特的风味。

其他系统则尝试为用户写一段长而详细的段落。但这些段落往往很笼统,只能捕捉到宽泛的主题(比如“他们喜欢猫”),而不是他们实际观看的内容及其出现时间背后的具体、深层的模式。

TokenMinds 是由 Google DeepMind 和 YouTube 构建的一个新系统,它通过给用户提供一张由离散标记(discrete tokens)(即一组特定的、有意义的代码)组成的“数字身份证”,并保留旧有的“总结卡”(稠密嵌入/dense embeddings)作为备份,从而解决了这个问题。

以下是它的工作原理,通过简单的类比进行拆解:

1. “语义 ID”(神奇的邮政编码)

TokenMinds 不再给每个视频一个随机数字(如“视频 #49201”),而是给每个视频一个语义 ID (Semantic ID, SID)

  • 类比: 想象每个视频都有一个基于其内容的“邮政编码”。一个关于“制作酸种面包”的视频,其代码可能以 食物-烘焙-面包 开头。一个关于“修理水槽”的视频,可能以 家居-管道 开头。
  • 为什么有效: 如果用户观看了一个关于“酸种面包”的视频,系统看到的不仅仅是一个随机数字;它看到了代码中的“食物-烘焙”部分。这有助于系统理解观看行为背后的“含义”,而不仅仅是 ID。

2. “双输出”引擎(两件套工具箱)

TokenMinds 使用了一种特殊的 AI 架构(编码器-解码器),它像一把瑞士军刀一样,能同时产生两种东西:

  • 稠密嵌入(总结卡): 这是现有系统已经熟知的传统连续数值向量。它就像是用户“氛围”的一个快速快照。
  • SID 标记(详细代码): 这是全新的部分。AI 会生成一系列代表用户未来兴趣的具体“邮政编码”。这就像 AI 在说:“根据你刚才看的内容,你可能对以下内容感兴趣:食物-烘焙-面包科技-编程-Python 以及 体育-篮球。”

益处: 该系统兼具了两者的优点。它既能让旧系统保持顺畅运行(使用总结卡),又增加了一个新的、精确的语义理解层(标记)。研究发现,将两者结合使用比单独使用其中之一效果更好。

3. “异步”交付(预订系统)

生成这些详细的标记是一项繁重的工作,就像烹饪一道复杂的菜肴。如果你试图在顾客等在柜台前时才开始烹饪,速度会太慢。

  • 类比: TokenMinds 使用了一个“预订”系统。它在用户只是浏览视频时,就在后台(异步地)生成用户的“身份证”和“标记”。当用户真正点击“推荐”时,系统只需从快速存储柜中取出预先做好的卡片即可。这意味着系统可以处理数十亿用户,而不会导致速度变慢。

4. “通用翻译机”(适用于所有视频的模型)

YouTube 有两类截然不同的视频:长视频(如 20 分钟的纪录片)和短视频(如 15 秒的 Shorts)。通常,你需要两个不同的模型来理解它们,因为人们观看它们的方式不同。

  • 类比: TokenMinds 就像一个通用翻译机。它对长视频和短视频使用相同的“邮政编码”系统。它可以观察一个用户观看 20 分钟烹饪节目和 15 秒烹饪小技巧的历史记录,并意识到:“啊,这个人热爱烹饪!”
  • 结果: 与其训练并运行两个单独且昂贵的模型,它们使用一个模型来完成这两项工作。这使它们的训练计算成本降低了 50%,服务成本降低了 31%,且没有损失任何质量。

5. 结果(证明)

团队在真实的 YouTube 流量(涉及数十亿用户)上进行了测试。

  • 更好的推荐: 当他们将这些新标记添加到排序系统中时,他们观察到用户参与视频的程度以及满意度都有了可衡量的提升。
  • 效率: 通过整合长视频和短视频模型,他们节省了大量的计算能力。
  • 多样性: 系统并不会一遍又一遍地猜测同样的东西;它会生成一个多样化的潜在兴趣列表,就像一个人类朋友向你推荐各种你可能喜欢的东西一样。

简而言之: TokenMinds 是一种更聪明、更高效的方式,用于理解用户的需求。它不再试图将一个人复杂的品味挤压成一个单一的数字,而是为他们提供了一组有意义的“代码”来描述他们的兴趣,同时依靠一个单一且具有成本效益的引擎来处理所有类型的视频内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →