← 最新论文
🤖 AI

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

本文提出了一种新颖框架,在轨迹和步骤层面分析推理路径,揭示出基于可验证奖励的强化学习(RLVR)会压缩错误轨迹并将推理集中于更少的步骤,而监督微调(SFT)则扩展正确轨迹并将推理分散到更多步骤中,从而解释了当前两阶段训练范式的互补性成功。

原作者: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《RL 挤压,SFT 扩展:推理大语言模型的比较研究》的通俗解释,辅以创意类比。

宏观图景:教导机器人思考的两种途径

想象你有一个擅长交谈但不太擅长解决复杂数学或编程谜题的机器人。为了让它变得更聪明,研究人员主要使用两种训练方法:

  1. SFT(监督微调): 这就像模仿。你向机器人展示人类专家一步步解决问题的完美示例,并说:“完全照这样做。”
  2. RL(强化学习): 这就像带着记分卡的试错。你让机器人自己尝试解决问题。如果它得出正确答案,它就获得一颗“金星”(奖励);如果错了,就一无所获。久而久之,它学会避开那些导致失败的路径。

这篇论文问道:当我们使用这两种不同的方法时,机器人“大脑”内部究竟发生了什么? 它们是改变了机器人“如何”思考,还是仅仅改变了它“回答”了什么?

作者发现,这两种方法对机器人的“思维过程”产生了截然相反的作用。


类比一:“推理轨迹”(轨迹层面)

想象机器人的思考过程就像一名徒步者穿过一片巨大的迷雾森林,去寻找隐藏的宝藏(正确答案)。这里有无数条路径:有些通向宝藏,而许多则通向死胡同或悬崖。

  • SFT(模仿者)“扩展”了好的路径:
    当你向机器人展示专家的地图(SFT)时,它学会了走在正确的路径上。但这里有个陷阱:它也开始走在该正确路径的许多不同变体上。它在寻找宝藏的方式上变得非常有创造力和多样性。

    • 陷阱: 它并没有停止走在坏路上。如果机器人原本就在沼泽中徘徊(犯错),SFT 教会了它新的行走方式,但它可能偶尔仍会误入沼泽。它“扩展”了正确路线的数量,但不一定清除那些坏路。
  • RL(评分者)“挤压”了坏的路径:
    当你让机器人带着奖励玩游戏(RL)时,它很快意识到沼泽路径会导致零分。因此,它停止走那里。它将所有不正确、令人困惑或死胡同的路径“挤压”得消失不见。

    • 陷阱: 它也倾向于“挤压”好的路径。它可能停止探索正确答案的创造性变体,而只是坚持那条它知道最有效的一条路。它变得非常专注,但多样性降低。
  • 制胜组合(SFT + RL):
    论文解释了为什么目前的最佳实践是先进行 SFT,然后进行 RL

    1. 首先,使用 SFT 教导机器人新的寻找宝藏的方法(扩展正确路径)。
    2. 然后,使用 RL 惩罚机器人误入沼泽的行为(挤压错误路径)。
    • 结果: 你得到了一个既知道多种解决问题方法,又非常自律以避免错误的机器人。

类比二:“思维之城”(步骤层面)

现在,让我们不再将机器人的思考视为单一路径,而是将其视为一张城市地图。推理中的每一个“步骤”(如“计算面积”或“检查公式”)都是这座城市中的一座建筑。步骤之间的连接就是道路。

  • RL 创造了一个“枢纽 - 辐条”式城市:
    经过 RL 训练后,城市发生了变化。机器人开始严重依赖少数几个特定的、超级重要的建筑(枢纽)。它反复访问这些关键步骤。

    • 效果: 这座城市变得非常高效,但在这些少数地点周围变得拥挤。机器人将其“思考能力”集中在少数几个关键步骤上。这就像一名通勤者只使用三座特定的桥梁过河,而忽略了所有其他桥梁。
  • SFT 创造了一个“分布式”城市:
    经过 SFT 训练后,城市看起来不同。机器人将其思考分散开来。它访问许多不同的建筑,没有任何一座建筑像 RL 城市那样被压倒性地频繁访问。

    • 效果: 思考变得“同质化”或均匀分布。这就像一座城市,人们使用各种各样的街道,没有任何一条街道出现交通堵塞。

关键发现:

  • RL 使机器人的思考强烈且集中在少数关键步骤上(挤压)。
  • SFT 使机器人的思考广泛且分布在许多步骤上(扩展)。

城市的形状(拓扑结构)

研究人员还利用几何学观察了这些“思维城市”的“形状”。

  • 基础模型(训练前): 城市被分割成孤立的社区。很难从一个社区到达另一个社区。机器人容易陷入局部循环。
  • RL: 它打破了社区之间的墙壁。它创造了一个由少数巨大的“枢纽”主导的城市,这些枢纽将一切连接起来。这使得机器人如果击中正确的枢纽,就能非常快速地找到答案,但它依赖于这些特定的枢纽。
  • SFT: 它也打破了墙壁,但它不是创建枢纽,而是构建了一个万物互联的网络。这使得城市非常稳健,从任何一点到另一点都易于导航。

论文主张总结

  1. RL 是“挤压者”: 它粉碎了错误的思维路径,并将机器人的推理集中在少数几个高效、高流量的步骤上。通过消除糟糕的选项,它使机器人非常擅长第一次尝试就获得正确答案(Pass@1)。
  2. SFT 是“扩展者”: 它教导机器人新的、正确的思考方式,并将推理负荷分散到许多步骤上。然而,它不会自动消除机器人之前可能一直在使用的坏路径。
  3. 为什么 SFT + RL 有效: 最佳结果来自于使用 SFT 教导机器人如何正确思考(扩展好路径),然后使用 RL 迫使其停止犯错(挤压坏路径)。
  4. 结构至关重要: RL 创建了一种“枢纽重型”的推理结构,而 SFT 创建了一种“分布式”结构。这两者都与未训练模型的“碎片化”结构不同。

该论文得出结论,理解这些机械差异有助于解释为什么当前的“两阶段”训练配方(先 SFT 后 RL)在创造智能推理人工智能方面如此成功。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →