← 最新论文
💻 computer science

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

本文表明,过度的监督微调(SFT)会压缩采样分布,导致熵塌缩,进而引发秩逆转并降低后续群体相对策略优化(GRPO)训练的性能,而这种失效模式可以通过监测强化学习前的熵以及早期的 GRPO 动态来进行预测和缓解。

原作者: Siddharth Aphale, Kelly Liu

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddharth Aphale, Kelly Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对该论文进行的解释。

大局观:“过于完美”的陷阱

想象你正在训练一个机器人写代码。标准的配方有两个步骤:

  1. 监督微调 (SFT): 你向机器人展示数千个正确代码的示例,让它学习其中的模式。
  2. 强化学习 (RL): 你让机器人尝试独立解决新问题。如果它做对了,它会得到奖励(甜头);如果失败了,它什么也得不到。

问题在于: 论文发现,如果你在第一步中训练得“太过了”(即第一步过度训练),它在第二步的表现反而会变差

通常我们认为:“在第一步中,机器人记住的示例越多,它的表现就会越好。” 但作者发现事实恰恰相反:在第一步中记忆最深刻的机器人,在第二步的表现其实是最差的。 事实上,在第一步中记忆最少的机器人,最终成为了冠军。

比喻:僵硬的舞者 vs. 灵活的舞者

为了理解为什么会发生这种情况,想象两名正在准备比赛的舞者,比赛要求他们根据随机音乐进行即兴表演。

  • “过度训练”的舞者 (深度 SFT): 这名舞者把同样的 10 段完美舞步练习了数千遍。他们极其精准,但当音乐变化时,他们就僵住了。他们只知道那 10 个动作,对于任何其他方式的移动都一无所知。
  • “恰到好处”的舞者 (浅层 SFT): 这名舞者练习了基础动作,但保持了身体的松弛与灵活。他们了解规则,但当音乐变化时,他们仍然可以扭动、旋转并尝试新的动作。

比赛 (RL):
比赛要求舞者同时尝试许多不同的动作,以观察哪一个效果最好。

  • “过度训练”的舞者每次都试图做出完全相同的完美动作。由于这些动作看起来都一样,评委(算法)无法分辨哪个动作更好。舞者陷入了停滞,无法学习任何新东西。
  • **“灵活的舞者”**尝试各种各样的动作。评委可以看到:“啊,这个动作奏效了,那个不行!”于是舞者就能快速学习。

技术层面的“为什么”:熵坍缩 (Entropy Collapse)

论文使用了一个高级词汇来表示“多样性”或“灵活性”:熵 (Entropy)

  1. 熵坍缩: 当机器人过度训练时,它的“思维”变得过于狭窄。它停止了探索不同的可能性,转而重复相同的几个答案。用论文中的话来说,它的熵坍缩了
  2. 信号消失: 学习算法(称为 GRPO)通过比较不同的答案来工作。如果机器人连续 8 次给出相同的答案,算法就会感到困惑。它无法计算出“梯度”(改进的方向),因为没有差异可以进行比较。这就像试图驾驶一辆方向盘被锁死在正前方的汽车。
  3. 排名倒置 (Rank Inversion): 这导致了一个奇怪的结果,称为排名倒置
    • 在第二阶段训练之前,过度训练的机器人看起来像个天才(它在练习测试中 100% 答对)。
    • 在第二阶段训练之后,它变成了一个灾难。
    • 与此同时,那个起初看起来稍逊一筹的“不太完美”的机器人,却成为了超级明星。

两个模型:两个城市的故事

作者在两个不同的机器人大脑(模型)上测试了这一点:

  1. Qwen (受害者): 这个模型掉入了陷阱。他们在第一步中训练得越多,它就变得越僵硬。那个看起来“最好”的检查点(得分最高)反而是下一阶段最差的起点。
  2. DeepSeek (幸存者): 这个模型天生更具灵活性。即使经过重度训练,它也没有变得僵硬。它保持在可以继续学习的“安全区”。这证明了问题不在于第二个训练阶段本身,而在于第一阶段是如何破坏了 Qwen 的灵活性。

解决方案:两步检查法

作者不仅发现了问题,还构建了一个诊断工具,以便在浪费时间和金钱之前识别出它。

  • 第一步:“拉伸”测试 (预 RL 熵): 在开始第二阶段训练之前,他们会检查机器人的思维有多“松弛”。如果机器人过于僵硬(低熵),他们会将其标记为高风险。
  • 第二步:“早期预警”监控: 如果他们开始第二阶段,他们会观察最初的几分钟。如果机器人立即停止尝试新事物并开始重复自己,他们会提前停止训练以节省资源。

什么方法没起作用?

作者尝试用标准的技巧来修复这个“坏掉”的机器人,例如:

  • 添加惩罚: “不要偏离你原始训练太远。”(这反而让情况变得更糟)。
  • 平滑标签: “对你的答案表现得不那么确定。”(这让机器人看起来重新变得自信,但它在比赛中依然失败了)。

结论: 你不能通过在比赛期间告诉一个僵硬的舞者要“更努力”来修复他。你必须在第一阶段不要训练得如此僵化。论文证明了,当你想要一个模型保持持续学习的能力时,多样性(熵)比完美更重要

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →