← 最新论文
🤖 machine learning

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

本文在 NeMo-RL 中引入了一种系统集成的投机解码框架,作为强化学习后训练 rollout 的无损加速原语,在 8B 规模下实现了 1.8 倍的吞吐量提升,并预计在结合异步执行后,在 235B 规模下可实现高达 2.5 倍的端到端训练加速。

原作者: Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Ko
发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Konuk, Ashwath Aithal, Ritika Borkar, Ran Zilberstein, Bita Rouhani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一位才华横溢但思考缓慢的学生(即 AI 模型)来解决复杂的数学问题。为了教导他们,你必须向他们提出一个问题,等待他们将整个思维过程一步步写出来,然后检查他们是否答对了。

问题在于,“检查”部分很快,但“书写”部分却极其缓慢。这位学生写一个字,停顿思考,再写下一个字,再次停顿,如此循环。这种逐字书写的缓慢过程,是训练这些 AI 模型的最大瓶颈。

本文提出了一种名为**推测解码(Speculative Decoding)**的巧妙技巧,旨在加速这一书写过程,同时不改变学生的思考方式或所学内容。

核心理念:“起草助手”

将 AI 模型想象成一位非常精准但动作缓慢的主厨。为了加快速度,你雇佣了一位快速、精力充沛的副厨(即“草稿模型”)。

  1. 旧方法(自回归): 主厨写一个字,停下,思考,再写下一个字,停下,思考。这耗费了漫长时间。
  2. 新方法(推测解码): 副厨快速猜测主厨可能写出的接下来的 3 到 4 个字。副厨迅速将这些字写下来。
  3. 检查: 主厨随后快速扫视副厨的笔记。
    • 如果笔记正确,主厨会说:“太棒了!”并一次性接受全部 4 个字。
    • 如果笔记错误,主厨会划掉它们,写出正确的字,然后重新开始。

神奇之处: 因为副厨动作很快,主厨大多数时候都能一次性接受多个字。最终结果与主厨独自书写完全一致,但发生速度快得多。

论文实际做了什么

研究人员将这一系统构建到了一个名为NeMo-RL的真实训练框架中。他们不仅测试了简单任务,还测试了需要 AI 深入思考的“推理”任务(例如解决数学问题)。

以下是他们的主要发现,已转化为通俗易懂的表述:

  • 无需作弊即可生效: 一些加速方法试图走捷径(例如使用低质量的数学或跳过步骤),这可能会破坏学生的学习效果。这种方法则是“无损”的。它保证 AI 的学习方式与没有助手时完全相同,只是速度更快。
  • 速度提升:
    • 在一个中等规模模型(80 亿参数)上,他们观察到书写过程的速度提升了1.5 到 1.8 倍
    • 由于书写占据了总训练时间的约 70%,因此整个训练过程的速度提升了约1.35 到 1.4 倍
  • “草稿”至关重要: 副厨必须是一个优秀的猜测者。
    • 如果你让副厨在学生正在学习的完全相同类型的数学问题上进行训练,速度提升将非常巨大。
    • 如果你使用一个只懂通用聊天的普通副厨,速度提升则较小。
    • 不要猜得太远: 如果副厨试图一次猜测 7 个字,他们会犯太多错误,导致主厨花费过多时间进行纠正。一次猜测 3 个字是“最佳平衡点”。
  • 未来(大模型): 他们使用了一个超精准的计算机模拟器,来预测在大规模模型(2350 亿参数)以及数千台计算机协同工作时会发生什么。
    • 他们预测,对于这些巨型模型,这项技术可能使整个训练过程的速度提升2.5 倍

为何这很重要

在 AI 领域,时间就是金钱。如果你能将模型训练速度提高 2.5 倍,你就可以在相同的时间内获得更聪明的模型,或者以一小部分成本获得相同的模型。

这篇论文证明,你无需改变 AI 的“大脑”或游戏规则就能获得这种速度。你只需要添加一个聪明、快速的助手来协助起草,并让主模型进行最终验证。这是一项系统升级,它使整个训练流程运行得更加顺畅,而不会破坏任何现有内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →