← 最新论文
💬 NLP

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

本文介绍了 Jet-RL,这是一个统一的 FP8 强化学习框架,它通过在采样(rollout)和训练阶段均应用一致的 FP8 精度,解决了由混合精度策略导致的训练不稳定和精度崩溃问题,从而在保持稳定收敛的同时实现了显著的加速。

原作者: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对 Jet-RL 论文的解释,通过日常类比将其拆解为简单的概念。

核心问题:AI 训练中的“慢行”现象

想象你正在训练一个非常聪明的机器人(大语言模型)来解决复杂的数学问题。为了变得更擅长,这个机器人需要练习“大声思考”(生成长链条的推理过程)然后再给出答案。

在 AI 训练的世界里,这种练习阶段被称为 Rollout(展开/采样)

  • 瓶颈: 论文指出,这种“大声思考”的阶段极其缓慢。它占据了训练总时间的 70%。这就像一个学生为了准备考试学习了 7 个小时,但其中 5 个小时都在盯着空白页发呆,试图想出第一句话该怎么写。
  • 目标: 我们希望在不让机器人变笨的前提下,加速这个“思考”阶段。

失败的捷径:“双重记账错误”

为了提速,工程师们尝试了一个简单的技巧:量化(Quantization)

  • 类比: 想象机器人的大脑通常使用高清晰度的 16 位“高清”(BF16)数字进行工作。为了跑得更快,他们尝试在机器人的“思考”模式中切换到低清晰度的 8 位“标清”(FP8)模式,但在“评分”阶段仍保持高清模式。
  • 想法: “让我们在漫长的思考部分使用快速、低分辨率的模式,但在实际的学习更新时保留高分辨率模式。”
  • 灾难: 论文发现,这种方法对于长任务或难题来说是一场 灾难
    • 不匹配: 这就像要求一名学生用铅笔(低分辨率)写一篇 10 页的论文,但老师却按照用钢笔(高分辨率)写的标准来评分。铅笔草稿中的微小误差会不断累积。当论文变得很长(例如 16,000 字)时,“铅笔”版本与“钢笔”版本已经完全不同了。
    • 结果: 机器人变得混乱。它开始产生幻觉,训练崩溃,机器人的性能也随之崩塌。论文称之为“灾难性的准确度崩溃”。

解决方案:Jet-RL(“统一语言”方案)

作者提出了一个名为 Jet-RL 的新系统。他们不再在练习和评分之间切换语言,而是让机器人对 所有环节 都说同一种语言(FP8)。

  • 类比: 想象机器人现在用铅笔写练习论文,而老师 使用基于铅笔的评分标准来批改论文。
    • 一致性: 因为“思考”和“学习”都发生在完全相同的低分辨率格式下,所以不会产生混乱。机器人学到的正是它所练习的内容。
    • 稳定性: 即使面对非常长的论文(长 Rollout)或非常难的主题,由于整个过程中的“铅笔”误差是前后一致的,机器人依然能保持稳定。

技术原理(技术层面的魔力)

为了实现这一点,团队在处理数学逻辑时表现得非常聪明:

  1. 统一流(Unified Flow): 他们确保数据在计算机芯片中流动时,从思考的第一步到大脑更新的最后一步,始终被视为 FP16(低分辨率)。
  2. 智能分组(Smart Grouping): 他们并没有盲目地缩小所有数值。他们将数字进行分组(就像把书整齐地摆放在书架上),使得“低分辨率”版本依然足够精确,足以支撑学习。
  3. 无需校准(No Calibration): 通常当你切换格式时,你需要花费时间进行“校准”(测试和调整)以确保效果。Jet-RL 完全跳过了这一步,因为该系统从设计之初就是高度一致的。

结果:快速且准确

论文在多个模型上进行了测试,发现:

  • 速度: 它使“思考”阶段快了 33%,整个训练过程快了 16%
  • 准确度: 与导致失败的那个错误捷径不同,Jet-RL 使机器人的智能几乎保持不变。性能下降微乎其微(小于 1%)。
  • 可靠性: 即使在机器人需要写超长回答(16,000 字)或解决极难数学题的情况下,它依然有效,而旧方法在这些情况下会崩溃。

总结

Jet-RL 是一种全新的 AI 训练方式,它解决了机器人因在“快速模式”和“智能模式”之间切换而产生混乱的问题。通过在“思考”和“学习”中使用相同的“快速语言”,它让 AI 训练变得 更快,同时不会让 AI 变 。它将一条破碎、不稳定的捷径变成了一条可靠的高速公路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →