Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design
本文介绍了 Kunlun,这是一种用于大规模推荐系统的统一架构,通过利用广义点积注意力(Generalized Dot-Product Attention)和分层种子池化(Hierarchical Seed Pooling)等底层优化,以及计算跳过(Computation Skip)等高层创新,解决了扩展效率低下的问题,从而建立了可预测的扩展法则,使扩展效率翻倍,并在 Meta Ads 中取得了显著的生产影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在运营一个规模巨大、高速运转的数字市场(类似于 Meta 用于广告投放的系统)。每一秒钟,都有数百万人正在刷屏,而系统必须预测每个人可能会点击哪条广告。为了做出这些预测,系统使用了一个“大脑”(机器学习模型),它会观察两类线索:
- 故事(序列/Sequence): 用户最近的行为(例如:“我点了一双鞋,然后是一个帽子,接着是一个背包”)。
- 快照(上下文/Context): 用户当下的状态(例如:“正在下雨”、“他们在纽约”、“他们今年 25 岁”)。
长期以来,构建一个既能高效处理“故事”又能处理“快照”的“大脑”,就像是在尝试用方轮子来驾驶赛车。虽然能跑,但速度极慢且极其耗油(计算资源)。研究人员将这个问题称为**“扩展效率低下(poor scaling efficiency)”**。基本上,当我们试图通过扩大“大脑”的规模来让它变得更聪明时,它变聪明的速度跟不上成本增加的速度。
于是有了 Kunlun(昆仑)。昆仑之名取自将多样巅峰连为一体的山脉,它是一种旨在解决这些“方轮子”问题的全新架构。论文声称,Kunлоn 通过在两个层面优化系统解决了这一问题:即“零件与螺栓”(底层)和“交通管理”(高层)。
以下是 Kunlun 的工作原理,我们使用日常类比来解释:
1. 底层修复:修理引擎
旧系统中的某些部件效率低下,导致计算机的“引擎”(GPU)在等待数据时处于闲置状态。Kunlun 用高性能部件替换了这些部件:
- GDPA(个性化翻译官):
- 问题: 旧系统试图基于“快照”来翻译“故事”,其过程笨拙且循序渐进,非常浪费时间。
- 修复: Kunlun 使用了 GDPA(广义点积注意力)。你可以把它想象成一位翻译官,他不仅是逐字翻译,而是能瞬间理解整个句子的语境。它将步骤融合在一起,使计算机无需停顿和重启,让引擎运行得更加顺畅。
- HSP(总结专家):
- 问题: 用户拥有很长的历史记录(数千次点击)。旧系统试图逐一阅读每一次点击,这让人应接不暇。
- 修复: HSP(分层种子池化)就像一位聪明的编辑。它不是去读完一部 500 页的传记,而是读完书后,写出一份 10 页的摘要,再进一步提炼成 1 页的梗概。它将冗长的历史浓缩成一份精简且强大的摘要,使系统可以在不被拖累的情况下有效利用。
- 滑动窗口注意力(局部聚焦):
- 问题: 旧系统试图将用户很久以前做的第一件事与他们现在正在做的事情进行对比。但通常情况下,你上周做的事情比你去年做的事情重要得多。
- 修复: 滑动窗口注意力告诉系统:“不要看整个历史,只看最近的几页。”它专注于近期的交互,在保持预测准确性的同时,节省了大量的计算能力。
2. 高层修复:智能交通控制
即使拥有出色的引擎,如果你走错了路或者在每个红灯前都停下,依然会浪费燃料。Kunlun 改变了资源的分配方式:
- CompSkip(快速通道):
- 问题: 旧系统强迫大脑在每一个步骤都进行同样的繁重工作,即使在并不需要的时候也是如此。
- 修复: CompSkip 就像一个智能红绿灯系统。它意识到有些步骤不需要进行完整的“自我检查”(自注意力),有些步骤也不需要进行完整的“总结”(HSP)。它在交替的层级中跳过不必要的步骤。如果汽车正在直行,它不需要每秒都检查后视镜。这节省了大量的能量。
- 事件级个性化(VIP 待遇):
- 问题: 旧系统将“点击”(强信号)与“曝光”(仅仅是看到广告)视为同等对待。它在低价值事件上浪费了资源。
- 修复: Kun-lun 为重要的事件提供 VIP 待遇。如果用户即将购买某物(高价值事件),系统会分配更多的计算能力和更深层的分析。如果是普通的浏览,则使用更轻量、更快速的方法。这就像一家餐厅为 VIP 客人提供全套品鉴菜单,而对路过的游客只提供一杯快速咖啡。
结果:“规模法则(Scaling Law)”
论文声称,通过结合这些修复措施,Kunlun 实现了一些业界难以攻克的成就:可预测的规模法则(Predictable Scaling Laws)。
过去,增加一倍的计算能力并不总是能带来一倍的智能提升。有了 Kunlun,这种关系变得可预测且高效。
- 效率提升: 在最新的超级计算机(NVIDIA B200 GPU)上,Kunlun 的硬件利用效率是此前方法的两倍(从 17% 的利用率跃升至 37%)。
- 现实世界的影响: 这不仅仅是一个实验室实验。Meta 已将 Kunlun 部署在其主要的广告模型中。结果如何?其核心业务指标提升了 1.2%。在广告领域,每天都要做出数十亿次决策,这微小的百分比其实是一个巨大的胜利。
总结: Kunlun 是一种更聪明、更精简、更有组织的方式来构建推荐系统。它不再在“方轮子”上浪费燃料,跳过了不必要的停顿,并为最重要的线索提供 VIP 待遇,从而让系统在规模扩大的同时,变得显著更加聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。