想象你正在训练一名才华横溢但尚显稚嫩的学生(AI 模型)来解决数学问题。多年来,标准的配方一直分为三步:
- 预训练(Pre-training): 学生阅读数百万本书籍,以学习通用的语言和知识。
- 监督微调(SFT): 老师给学生一本教科书,上面有问题的精确正确答案,强迫学生记忆解题路径。
- 强化学习(RL): 学生被投入到一个游戏中,只有在得到最终正确答案时才会获得积分,这鼓励他们去探索解决问题的全新方法。
这篇论文提出了一个疑问:我们真的必须等到学生读完所有的书、背熟了整本教科书之后,才能让他们开始玩游戏吗?
以下是研究人员的发现,通过简单的语言进行了解释:
1. 你可以提早开始游戏
标准规则说:“在给学生游戏之前,先等学生完成充分训练。”研究人员尝试在学生还在阅读前几章时(预训练早期阶段),就将游戏(RL)交给他们。
- 结果: 效果出奇地好!即使学生只读了一小部分书,通过玩游戏也能让他们比单纯多读书更好地解决数学问题。事实上,早期进行游戏往往与等待全部完成后再执行“阅读 → 记忆 → 游戏”的完整流程一样有效。
2. 当没有教科书时,“游戏”表现更好
通常情况下,“记忆”步骤(SFT)需要一本带有正确答案的教科书。但如果你没有足够的教科书怎么办?
- 发现: 如果你只有一个或两个解题示例,那么“记忆”步骤会失败。但“游戏”(RL)却能蓬勃发展。学生学会了如何在不需要完美答案解析的情况下,自主探索并寻找解决方案。当你缺乏范例时,游戏是一个更强大的老师。
3. 秘密武器是“书的类型”,而非“学生的大小”
人们常认为:“如果学生更大(更强大),他们就会学得更好。”研究人员通过增大学生的规模来测试这一点。
- 转折: 增大规模并没有帮助学生更快地学会游戏。然而,在他们的早期阅读阶段提供更多的数学书籍,却起到了作用。
- 教训: 如果你想让学生擅长数学,就在早期阶段喂给他们数学故事。你读的内容(内容)比你的大脑有多大(规模)更重要。
4. “磨练”之谜 vs. “扩张”之谜
最近有一个争论:这个“游戏”(RL)只是让学生现有的答案变得更锐利、更自信,还是真的教会了他们新的思考方式?
- 旧观点: 许多人认为 RL 只是在“磨练”学生,让他们变得更有信心,但不一定变得更聪明。
- 新发现: 研究人员发现,“磨练”效应实际上是由“记忆”步骤(SFT)引起的。当你强迫学生先记忆教科书时,他们就停止了探索。
- 真正的魔力: 如果你让学生在不先记忆教科书的情况下直接玩游戏,他们实际上会扩张他们的思维。他们会尝试许多不同的路径,并发现以前从未知道过的全新解法。正是“记忆”步骤限制了他们的创造力,而不是游戏本身。
5. “超级学生”配方
研究人员结合了两者的优点。他们没有采用“先记忆再游戏”的模式,而是让学生同时进行这两者。
- 运作方式: 想象学生正在解决一个问题。他们大脑的一个部分在检查教科书(SFT),而另一个部分在尝试新的想法(RL)。他们综合这两个部分的建议来更新自己的大脑。
- 结果: 这个“超级学生”(并行平均法)成为了解决问题的佼佼者。他们得到正确答案的频率比任何人都高,而且不像那些仅仅靠记忆教科书的学生那样,他们不会忘记如何做其他事情(比如日常对话)。
核心要点总结
- 不要等待: 你可以在模型生命的非常早期就开始使用强化学习(游戏),甚至在它完成“阅读”阶段之前。
- 数据重于规模: 在预训练期间喂给模型特定类型的数据(如数学)比单纯扩大模型规模更重要。
- RL 不是反派: RL 不会破坏模型的通用技能,也不会仅仅是“磨练”它。那些负面影响来自于“记忆”(SFT)步骤。RL 实际上有助于模型进行探索并找到新的解决方案。
- 协同进行: 最好的结果来自于将“记忆”和“游戏”步骤同时进行,而不是先后顺序执行。
简而言之,这篇论文建议我们不应将强化学习视为最后阶段的润色。相反,我们应该将其编织进训练过程中,并在更早阶段就将其与其它方法结合起来,从而创造出更聪明、更强大的模型。
技术摘要:预训练期间的 RL 介入(RL Excursions)
问题陈述
大型语言模型(LLM)的标准训练流程通常将强化学习(RL)限制在后训练阶段,仅在经过广泛的下一标记预测(NTP)预训练和监督微调(SFT)之后才进行应用。这种顺序化的方法提出了两个基本问题:
- 时机: 是否从根本上有必要等到预训练结束才应用 RL,或者 RL 在更早阶段也能有效?
- 机制: RL 本质上是在“锐化”模型现有的输出分布(限制探索),还是在扩展能力?近期的文献表明 RL 主要起到锐化分布的作用,但目前尚不清楚这是标准 SFT → RL 流派导致的伪影,还是 RL 目标函数本身的特性。
此外,关于 RL 是否会侵蚀从预训练中继承的通用能力也存在争议。
方法论
作者进行了一项大规模、受控的研究,旨在将 RL 从标准的训练方案中分离出来。
- 模型与数据: 他们从头开始在一个高质量、重推理的语料库(DOLMino 混合数据集,50B token)上预训练一个 1B 参数的模型(基于 OLMo2 架构)。他们还实验了一个 4B 模型以及一个在 60B token(增加了数学数据)上训练的 1B 模型。
- 检查点(Checkpoints): 他们没有等待最终模型的生成,而是在整个预训练过程中保存了检查点(从 4B 到 50B tokens)。
- 训练流水线: 对于每个检查点 Mt,他们应用了四种不同的后训练策略:
- 直接 RL (MtR): 直接对基础检查点应用 RL(具体使用带有可验证奖励的 GRPO),无需先进行 SFT。
- SFT (MtSFT): 使用每个问题的单个标准答案进行监督微调。
- SFT-Gold (MtSFT−Gold): 使用每个问题中所有可用的标准答案进行 SFT(这在现实中通常是不切实际的设置)。
- 标准流水线 (MtSFT→RL): 先进行 SFT 后进行 RL,代表了目前的行业标准。
- 并行平均法 (MtParallel): 一种提出的方法,其中从同一个参数快照计算 RL 和 SFT 的梯度,并将它们平均以更新权重。
- 评估: 性能通过 GSM8K(小学水平)和 MATH(竞赛水平)在 pass@k 指标(k=1,8,32)上进行衡量。通用能力则通过六个非数学基准测试(如 LAMBADA, HellaSwag)进行评估。
核心贡献与结果
1. RL 在预训练早期即有效
与“RL 需要高度成熟的基础模型”这一假设相反,作者发现 RL 在极早期就非常有效。
- 早期收益: 直接 RL 在早在 4B 预训练 token 时就开始提升 GSM8K 的性能,远早于 Chinchilla 最优的 token 数。
- 竞争力: 到 10B tokens 时,尽管从未见过标准答案的推理轨迹,直接 RL 在 pass@1 和 pass@32 上的表现已能媲美标准的 SFT → RL 流派。
- 数据稀缺性: 当标准演示(ground-truth demonstrations)稀缺时(每个提示词仅有一个解),RL 的表现显著优于 SFT。只有当提供多个高质量解时(SFT-Gold),SFT 才会超越 RL,而这种情况在实践中很少见。
2. 预训练数据构成 > 模型规模
对于更难的推理任务(MATH 数据集),RL 的有效性更多取决于预训练数据的构成,而非模型规模。
- 缩放数据: 在预训练混合数据中加入针对性的数学重型数据(将 token 从 50B 增加到 60B)会显著提升直接 RL 所能带来的收益。
- 缩放模型: 将模型大小从 1B 增加到 4B 虽然提高了基础模型的绝对性能,但并未实质性地提高 RL 提供的相对增益。
- 诊断指标: 基础模型在测试集上的 pass@k 准确率可以作为预测 RL 训练是否会产生下游收益的轻量级指标。
3. RL 是扩展还是锐化分布
本文挑战了“RL 本质上会锐化分布”的说法。
- 扩展: 当直接应用于基础检查点时,RL 扩展了模型的分布,同时提升了 pass@1 和 pass@32。模型通过在策略内(on-policy)学习发现了新的推理路径。
- 锐化伪影: 近期研究中观察到的“锐化”效应(pass@1 提升但 pass@32 退化)仅在 RL 紧随 SFT 之后时才会出现。作者假设 SFT 通过暴露标准答案限制了探索,导致随后的 RL 仅仅是在优化现有的路径,而不是发现新路径。
4. 通用能力的保留
- SFT 退化: SFT 在各个基准测试中一致地导致通用(非数学)能力下降 4–8 个百分点。
- RL 保留: 直接 RL 基本不会改变通用能力。
- 并行平均法: 作者提出的并行平均法 (MtParallel) 结合了两者的优势:它实现了最强的 pass@32 分数(超越了标准流水线),同时保留了通用能力,避免了 SFT 机制中出现的性能退化。
意义
本文认为,许多关于 RL 的假设(例如,它需要成熟的基础模型、它本质上会锐化分布,或它会侵蚀通用能力)是当前 SFT → RL 训练范式的产物,而非 RL 目标函数本身的固有属性。
作者得出结论:
- 可行性: 在预训练流程中更早地引入 RL 是可行的,且通常是更优的选择。
- 数据杠杆: 相比于模型缩放,针对性的预训练数据构成是提升 RL 有效性的更强杠杆。
- 目标协同: RL 和 SFT 目标是互补的。并行平均法证明了结合两者可以获得更强的推理能力(pass@32),且不会牺牲通用智能。
这项工作表明,应当进行范式转变,将 RL 视为一种一等公民的训练目标,贯穿于整个预训练和微调过程,而不仅仅是作为最后的后训练步骤。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。