← 最新论文
🤖 AI

HiGR: Industrial-Scale Hierarchical Generative Slate Recommendation Framework in Tencent

本文介绍了 HiGR,一种用于序列推荐(slate recommendation)的工业级层级生成框架,该框架通过利用基于 PCRQ-VAE 的结构化 SID 空间、用于高效规划的粗粒度层级序列解码器(Hierarchical Slate Decoder)以及基于 ORPO 的对齐机制,解决了现有方法的局限性,从而在腾讯平台的推荐质量、推理速度和实际用户参与度方面取得了显著提升。

原作者: Yunsheng Pang, Zijian Liu, Yudong Li, Shaojie Zhu, Zijian Luo, Chenyun Yu, Sikai Wu, Shichen Shen, Cong Xu, Bin Wang, Kai Jiang, Chengxiang Zhuo, Zang Li

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunsheng Pang, Zijian Liu, Yudong Li, Shaojie Zhu, Zijian Luo, Chenyun Yu, Sikai Wu, Shichen Shen, Cong Xu, Bin Wang, Kai Jiang, Chengxiang Zhuo, Zang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位日报编辑。你的工作不仅仅是挑选出单篇最好的新闻放在头版,而是要策划整个头版(即一个“列表”)。

挑战在于:如果你只是单纯挑选出前 10 个最热门的故事,你可能会得到 10 个关于同一个名人的故事,或者 10 个关于同一种类型的犯罪故事。读者会感到厌倦,或者感觉自己陷入了“信息茧房”。你需要一种组合:一点政治,一点体育,一点人文关怀,并进行合理的编排,让读者忍不住不断翻页。

这正是 HiGR 为腾讯新闻和视频平台等应用解决的问题。它是一种全新的“AI 编辑”,它不只是逐个挑选项目,而是同时规划整个页面。

以下是 HiGR 的工作原理,通过三个简单的步骤使用类比进行拆解:

1. 有序书籍的图书馆 (PCRQ-VAE)

在 AI 开始编写列表之前,它需要一种理解每个项目(视频、新闻文章、小说)主题的方法。

  • 旧方法: 想象一个每本书都贴着随机数字标签的图书馆。如果你想找“科幻类”,你必须检查每一本书看数字是否匹配。这既混乱又低效。
  • HiGR 的方式: HiGR 构建了一个智能图书馆。它为每本书分配了一个特殊的代码(“语义 ID”),这个代码就像是一个层级化的地址。
    • 代码的第一部分告诉你是类型(例如:“科幻”)。
    • 第二部分告诉你是子类型(例如:“太空歌剧”)。
    • 最后一部分标识的是具体的书
  • 神奇之处: HiGR 使用一种特殊的训练方法(称为 Prefix-Contrastive RQ-VAE),以确保所有“太空歌剧”类的书都共享其代码的第一部分。这使得 AI 可以轻松实现“我需要一部太空歌剧”的需求,而无需搜索整个图书馆。

2. 两步走的建筑师 (Hierarchical Slate Decoder)

现在,AI 需要构建头版。

  • 旧方法(缓慢的建造者): 想象一个建造者必须一块砖一块砖地铺设,才能盖好一栋房子。如果他在第一块砖上出了错,他就必须拆掉整面墙重新开始。这很慢,而且会让建造者对整体形状感到困惑。
  • HiGR 的方式(建筑师 + 泥瓦匠): HiGR 将工作分成了两个角色:
    1. 建筑师(粗粒度规划者): 首先,建筑师观察用户并说:“好的,对于这个人,头版需要:1. 一个体育故事,2. 一个科技故事,3. 一个烹饪故事。”他们此时还不挑选具体的素材,只是规划页面的基调结构。这很快,且能确保页面的平衡感。
    2. 泥瓦匠(细粒度生成器): 一旦建筑师说“我们需要一个体育故事”,泥瓦匠就会迅速找到最合适的特定体育故事来填补这个位置。
  • 结果: 因为建筑师先规划了整体布局,所以 AI 不会陷入细节中无法自拔。它的构建速度快得多(快了 5 倍!),同时保持了完美的结构。

3. 编辑的评判 (ORPO Preference Alignment)

最后,AI 需要学习如何制作一个“好”的头版,而不只是一个“技术上正确”的头版。

  • 问题所在: 如果你只教 AI 预测“下一个词”,它可能会写出一个语法完美但枯燥乏味的句子。同样,AI 可能会挑选出 10 个虽然都很热门但重复性极高的项目。
  • HiGR 的解决方案: HiGR 使用了一种名为 ORPO(Odds Ratio Preference Optimization,胜率偏好优化)的技术。你可以把它想象成一位严厉的编辑,负责评审两个版本的头版:
    • 版本 A(优胜者): 一个用户真正观看、喜欢并读完的页面。
    • 版本 B(失败者): 一个被随机打乱、内容枯燥或过于重复的页面。
  • 教训: AI 通过对比这两个版本进行学习。它明白一个好的页面不仅仅关乎“流行度”,更关乎排序(把最好的内容放在前面)、真实兴趣(挑选用户真正喜欢的)以及多样性(确保页面不会全是同类内容)。

现实世界的影响力

论文报告显示,该系统已在腾讯平台上线,服务于数亿用户

  • 速度: 它比以往的方法快 5 倍,这意味着用户无需等待信息流加载。
  • 质量: 在现实测试中,它使用户的视频观看时长增加了 1.22%,视频播放量增加了 1.73%
  • 规模: 它能够处理海量数据而不会崩溃,证明了这种“建筑师 + 泥瓦匠”的方法在工业级推荐规模下的有效性。

简而言之: HiGR 停止了尝试逐个挑选项目的做法。相反,它首先为整个列表绘制一个平衡且多样化的蓝图,然后快速填充细节,从而确保用户获得个性化、引人入胜且不重复的体验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →