← 最新论文
🤖 machine learning

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

本文通过证明将强化学习(RL)更早地整合进预训练阶段、优化数据构成以及将强化学习与监督微调(SFT)目标相结合,可以有效增强推理能力并扩大模型分布,同时保留通用能力,从而挑战了仅在监督微调之后才应用强化学习的标准做法。

原作者: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在训练一名才华横溢但尚显稚嫩的学生(AI 模型)来解决数学问题。多年来,标准的配方一直分为三步:

  1. 预训练(Pre-training): 学生阅读数百万本书籍,以学习通用的语言和知识。
  2. 监督微调(SFT): 老师给学生一本教科书,上面有问题的精确正确答案,强迫学生记忆解题路径。
  3. 强化学习(RL): 学生被投入到一个游戏中,只有在得到最终正确答案时才会获得积分,这鼓励他们去探索解决问题的全新方法。

这篇论文提出了一个疑问:我们真的必须等到学生读完所有的书、背熟了整本教科书之后,才能让他们开始玩游戏吗?

以下是研究人员的发现,通过简单的语言进行了解释:

1. 你可以提早开始游戏

标准规则说:“在给学生游戏之前,先等学生完成充分训练。”研究人员尝试在学生还在阅读前几章时(预训练早期阶段),就将游戏(RL)交给他们。

  • 结果: 效果出奇地好!即使学生只读了一小部分书,通过玩游戏也能让他们比单纯多读书更好地解决数学问题。事实上,早期进行游戏往往与等待全部完成后再执行“阅读 \rightarrow 记忆 \rightarrow 游戏”的完整流程一样有效。

2. 当没有教科书时,“游戏”表现更好

通常情况下,“记忆”步骤(SFT)需要一本带有正确答案的教科书。但如果你没有足够的教科书怎么办?

  • 发现: 如果你只有一个或两个解题示例,那么“记忆”步骤会失败。但“游戏”(RL)却能蓬勃发展。学生学会了如何在不需要完美答案解析的情况下,自主探索并寻找解决方案。当你缺乏范例时,游戏是一个更强大的老师。

3. 秘密武器是“书的类型”,而非“学生的大小”

人们常认为:“如果学生更大(更强大),他们就会学得更好。”研究人员通过增大学生的规模来测试这一点。

  • 转折: 增大规模并没有帮助学生更快地学会游戏。然而,在他们的早期阅读阶段提供更多的数学书籍,却起到了作用。
  • 教训: 如果你想让学生擅长数学,就在早期阶段喂给他们数学故事。你读的内容(内容)比你的大脑有多大(规模)更重要。

4. “磨练”之谜 vs. “扩张”之谜

最近有一个争论:这个“游戏”(RL)只是让学生现有的答案变得更锐利、更自信,还是真的教会了他们新的思考方式?

  • 旧观点: 许多人认为 RL 只是在“磨练”学生,让他们变得更有信心,但不一定变得更聪明。
  • 新发现: 研究人员发现,“磨练”效应实际上是由“记忆”步骤(SFT)引起的。当你强迫学生先记忆教科书时,他们就停止了探索。
  • 真正的魔力: 如果你让学生在不先记忆教科书的情况下直接玩游戏,他们实际上会扩张他们的思维。他们会尝试许多不同的路径,并发现以前从未知道过的全新解法。正是“记忆”步骤限制了他们的创造力,而不是游戏本身。

5. “超级学生”配方

研究人员结合了两者的优点。他们没有采用“先记忆再游戏”的模式,而是让学生同时进行这两者。

  • 运作方式: 想象学生正在解决一个问题。他们大脑的一个部分在检查教科书(SFT),而另一个部分在尝试新的想法(RL)。他们综合这两个部分的建议来更新自己的大脑。
  • 结果: 这个“超级学生”(并行平均法)成为了解决问题的佼佼者。他们得到正确答案的频率比任何人都高,而且不像那些仅仅靠记忆教科书的学生那样,他们不会忘记如何做其他事情(比如日常对话)。

核心要点总结

  • 不要等待: 你可以在模型生命的非常早期就开始使用强化学习(游戏),甚至在它完成“阅读”阶段之前。
  • 数据重于规模: 在预训练期间喂给模型特定类型的数据(如数学)比单纯扩大模型规模更重要。
  • RL 不是反派: RL 不会破坏模型的通用技能,也不会仅仅是“磨练”它。那些负面影响来自于“记忆”(SFT)步骤。RL 实际上有助于模型进行探索并找到新的解决方案。
  • 协同进行: 最好的结果来自于将“记忆”和“游戏”步骤同时进行,而不是先后顺序执行。

简而言之,这篇论文建议我们不应将强化学习视为最后阶段的润色。相反,我们应该将其编织进训练过程中,并在更早阶段就将其与其它方法结合起来,从而创造出更聪明、更强大的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →