技术摘要:Token 即一切:利用双用途语义 ID 实现推荐系统中 LLM 级别的 I/O 效率
1. 问题陈述
大规模推荐系统面临着由依赖海量、稠密浮点数嵌入表(embedding tables)引起的关键“内存墙”(Memory Wall)瓶颈。虽然大语言模型(LLM)由于其统一的离散 Token 空间和计算密集型特性而能够高效扩展,但推荐系统却受限于在训练和推理过程中摄取、存储和关联高维连续向量(例如用户历史、内容嵌入)所需的 I/O 和内存带宽。
随着系统演进到处理长度可扩展至 104 或更高的序列化用户活动,这一限制变得尤为严重。试图通过稠密嵌入引入丰富内容信号的传统方法,会带来难以承受的数据足迹和推理延迟。此外,虽然“生成式检索”(Generative Retrieval)引入了语义 Token 来替代类别 ID,但现有方法主要将这些 Token 严格视为标识符,未能利用它们来高效重建高维连续内容特征。
2. 方法论:双用途语义 ID
作者提出了一个框架,将高维连续内容嵌入转换为紧凑的离散 Token 序列。该方法借鉴了计算机视觉数据压缩技术(特别是 VQ-VAE 和 VQGAN),证明了连续空间数据可以在不丢失语义含义的情况下被压缩为离散 Token。
核心方法论由生成的语义 ID (Si) 承担两个并发角色:
A. 通过量化生成语义 ID
高维内容嵌入 (ei∈Rd) —— 通常源自预训练的多模态模型 —— 通过层次化量化(例如残差量化或 RQ-VAE)被压缩为 K 个离散 Token 序列。
Si=[ti,1,ti,2,…,ti,K]
这使存储需求从 d×32 位降低到 K×log2(V) 位,实现了 50–100× 的压缩比。
B. 双用途框架
该框架在推荐模型中使用这些 Token 执行两个同步功能:
协同身份(图内学习): Token 序列被视为类别特征。模型学习每个 Token(或 n-gram 组合)的嵌入,以捕捉用户-物品交互模式。策略包括:
- 一元语法(Unigram): 独立的 Token 嵌入。
- 重叠二元语法(Overlapping Bigram): 使用滑动窗口来捕捉局部转换。
- 嵌套 n-gram(Nested N-gram): 使用层次化前缀来强制执行语义聚类(例如,所有“爵士乐”视频都共享一个顶层嵌入)。
- 子词模型(Sentence Piece Model, SPM): 基于数据分布的自适应 Token 组合。
该组件负责处理记忆与泛化,特别是针对冷启动和长尾物品。
内容重建(SiDec): 为了在不产生稠密向量 Join 操作 I/O 开销的情况下恢复“纯净”的内容信号,系统采用了语义解码器 (fθ)。
- 过程: 离散 Token Si 在静态码本 (ϕ) 中进行查找以检索潜在嵌入,随后通过轻量级解码器(MLP 或浅层 Transformer)来重建原始嵌入的近似值 (e^i)。
- 集成: 这种重建是在模型图中*即时(on-the-fly)*进行的。它取代了在训练数据中存储或记录稠密向量的需求。解码器可以是冻结的(使用预训练码本)或可训练的(以对齐特定的下游任务)。
3. 核心贡献
- 创新的双用途框架: 本文引入了一个通过整合标准语义 ID 学习与即时语义 ID 解码(SiDec)来解决“内存墙”问题的系统。这平衡了基于离散 Token 的物品特定记忆与基于重建连续语义的内容感知泛化。
- I/O 效率突破: 通过将大规模向量存储替换为按需重建,该框架极大地减少了数据足迹和系统开销。它将系统的负担从磁盘绑定的稠密向量检索转向了计算绑定的即时重建。
- 生产规模验证: 作者提供了来自主要视频分享平台(YouTube)的广泛实证证据,证明了该框架在排序和检索模型中的有效性。
4. 实验结果
该框架通过离线基准测试和生产环境中的在线 A/B 测试进行了评估。
离线评估(检索模型)
研究对比了五个实验组,以分析表示保真度与训练吞吐量之间的权衡:
- 对照组(Control): 标准 ID,无内容嵌入(吞吐量最高:16.80 steps/s,质量最低)。
- 实验组 1(Raw Dense): 直接摄取 64 维嵌入(质量提升,但由于 I/O 瓶颈,吞吐量下降 28.2% 至 12.07 steps/s)。
- 实验组 2 & 3(SiDec): 使用码本解码器(v0 和 v1)。这些实验组将吞吐量恢复到了 ~15.3 steps/s(接近对照组水平),同时保持或超过了原始稠密方法的质量。
- 实验组 4(SiDec + Scaling): 结合 v1 码本与架构缩放,实现了最佳全局损失(2.681)和 Hit Rate @100(0.2910),且比原始稠密方法实现了 20.4% 的吞吐量加速。
结论: 离散化 Tokenization 成功打破了 I/O 瓶颈,允许同时扩展模型深度和检索精度。
在线部署
该框架被部署在多任务排序和基础 Transformer 检索模型中。
- 排序模型: 在现有语义 ID 特征中加入 SiDec 内容重建流,显著提升了“在线满意度参与度”(Online Satisfied Engagement,一个综合观看时长和交互的指标)。
- 观看页排序(Watchpage Ranking): 提升 +0.80%。
- 首页排序(Homepage Ranking): 提升 +0.22%。
- 检索模型: 首页提升 +0.13%。
- 影响: 这些改进具有统计学显著性,并不成比例地惠及了具有稀疏历史的新兴账号和长尾内容,有效地缓解了流行度偏差(popularity bias)。
5. 意义与主张
本文声称“Token 即一切”,可以实现高效且内容丰富的推荐。这项工作的意义在于其哲学和架构上的转变:
- 与连续 I/O 脱钩: 作者认为,高维连续分布不需要以其原始浮点格式进行处理也能保留预测能力。通过将整个特征空间(包括用户上下文、历史密度和内容嵌入)量化为统一的离散 Token 词表,推荐系统可以从连续浮点数 I/O 中解脱出来。
- 与 LLM 缩放法则对齐: 这种方法使推荐系统向 LLM 所享有的计算密集型硬件扩展法则靠拢,摆脱了传统稠密嵌入所面临的内存绑定约束。
- 双重效用: 该框架证明了离散 Token 可以发挥双重作用:既作为协同过滤的结构化类别特征,又作为用于即时内容重建的压缩表示,从而消除了对独立、沉重嵌入表的需求。
作者总结道,这种范式提供了一条路径,可以用处理超长用户序列和大规模特征空间,而无需承担传统稠密向量存储和检索的巨大成本。