SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
本文指出近期宣称“混合策略优化”优于“先SFT后RL”的研究结论存在错误,原因是由于DeepSpeed优化器和OpenRLHF损失聚合中的两个关键Bug导致SFT基准表现被低估,而在修复这些Bug后,传统的“先SFT后RL”流程在数学推理任务上的表现显著优于现有的所有混合策略方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章的研究发现非常有趣,它揭示了人工智能领域一个“看似高手过招,实则裁判判错”的尴尬局面。
为了让你轻松理解,我们可以把大语言模型(LLM)的训练过程想象成**“培养一名数学天才少年”**。
1. 背景知识:两种培养天才的方法
目前,科学家们在教 AI 做数学题时,主要有两种流派:
流派 A:循序渐进法(SFT RL)
- 第一步(SFT,监督微调): 先给孩子看大量的“标准答案和解题步骤”。孩子通过模仿,学会了基本的解题套路和知识。
- 第二步(RL,强化学习): 孩子学会套路后,我们不再给他看答案,而是让他自己做题。做对了就奖励,做错了就惩罚。他在不断的“试错”中变得更加聪明。
- 特点: 先打基础,再练实战。
流派 B:混合训练法(Mixed-Policy Methods)
- 做法: 不分先后,一边让孩子看标准答案,一边让他自己去试错。
- 逻辑: 科学家们认为,如果孩子自己做不出题(奖励太稀疏),就赶紧塞点标准答案给他;如果他做出来了,就让他多自己练。
- 特点: 边学边练,试图“一步到位”。
2. 论文的核心发现:一场“假象”的胜利
最近有很多研究论文声称:“混合训练法(流派 B)比循序渐进法(流派 A)更厉害!”
但这篇文章的作者们通过“硬核排查”,发现了一个惊人的事实:流派 B 看起来赢了,其实是因为流派 A 的“训练工具”坏了。
这里的“工具坏了”有两个隐蔽的 Bug:
Bug 1:漏掉的“笔记”(优化器 Bug)
- 比喻: 想象孩子在做练习册,每做完一页,老师应该把这一页的知识点总结到笔记本上。但因为工具的 Bug,老师只记下了第一页的内容,后面几百页的知识点全都丢了!
- 结果: 孩子(AI)的基础知识极其薄弱,看起来像个“半吊子”。
Bug 2:错误的“评分标准”(损失聚合 Bug)
- 比喻: 老师在批改作业时,如果第一页有 10 道题,第二页只有 2 道题,老师却认为这两页的分量是一样的。这导致评分权重完全乱了。
- 结果: 学习过程变得混乱且不稳定。
结论是: 之前的研究者们是在拿一个**“由于工具故障而导致基础极差”**的 AI,去跟“混合训练法”比。这就像是在拿一个“没吃饱饭、没记笔记”的学生,去跟一个“边吃边学”的学生比赛,最后得出“边吃边学更好”的结论——这显然是不公平的。
3. 修正后的真相:老办法依然是王者
作者们把这两个 Bug 修好了,重新训练了“循序渐进法(流派 A)”。结果发现:
- 老办法更强: 修正后的“先打基础、再练实战”的方法,在数学考试中的成绩全面碾压了那些所谓的“混合训练法”。
- 老办法更省钱(更高效): 混合训练法需要花很长时间去摸索,而“循序渐进法”因为有了扎实的基础,只需要极短的强化学习时间(甚至只要 50 步),就能达到极高的水平。
- 通用性更好: 不仅在数学题上强,在科学知识和常识考试中也表现出色。
4. 总结:这篇论文告诉了我们什么?
这篇论文就像是一位**“硬核纠错官”**,它告诉了 AI 研究界两个重要的道理:
- 不要迷信“新招式”: 有时候,看似更先进、更复杂的算法,可能只是因为你把最基础的工具用错了。
- 基础决定高度: 在培养 AI 这种“逻辑天才”时,先把知识(SFT)喂扎实,再让它去探索(RL),比试图同时完成这两件事要高效得多。
一句话总结: 别被花哨的新方法骗了,把基础打牢,按部就班地练,才是通往真天才的最短路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。