以下是使用简单语言和日常类比对该论文进行的解释。
大局观:“过于完美”的陷阱
想象你正在训练一个机器人写代码。标准的配方有两个步骤:
- 监督微调 (SFT): 你向机器人展示数千个正确代码的示例,让它学习其中的模式。
- 强化学习 (RL): 你让机器人尝试独立解决新问题。如果它做对了,它会得到奖励(甜头);如果失败了,它什么也得不到。
问题在于: 论文发现,如果你在第一步中训练得“太过了”(即第一步过度训练),它在第二步的表现反而会变差。
通常我们认为:“在第一步中,机器人记住的示例越多,它的表现就会越好。” 但作者发现事实恰恰相反:在第一步中记忆最深刻的机器人,在第二步的表现其实是最差的。 事实上,在第一步中记忆最少的机器人,最终成为了冠军。
比喻:僵硬的舞者 vs. 灵活的舞者
为了理解为什么会发生这种情况,想象两名正在准备比赛的舞者,比赛要求他们根据随机音乐进行即兴表演。
- “过度训练”的舞者 (深度 SFT): 这名舞者把同样的 10 段完美舞步练习了数千遍。他们极其精准,但当音乐变化时,他们就僵住了。他们只知道那 10 个动作,对于任何其他方式的移动都一无所知。
- “恰到好处”的舞者 (浅层 SFT): 这名舞者练习了基础动作,但保持了身体的松弛与灵活。他们了解规则,但当音乐变化时,他们仍然可以扭动、旋转并尝试新的动作。
比赛 (RL):
比赛要求舞者同时尝试许多不同的动作,以观察哪一个效果最好。
- “过度训练”的舞者每次都试图做出完全相同的完美动作。由于这些动作看起来都一样,评委(算法)无法分辨哪个动作更好。舞者陷入了停滞,无法学习任何新东西。
- **“灵活的舞者”**尝试各种各样的动作。评委可以看到:“啊,这个动作奏效了,那个不行!”于是舞者就能快速学习。
技术层面的“为什么”:熵坍缩 (Entropy Collapse)
论文使用了一个高级词汇来表示“多样性”或“灵活性”:熵 (Entropy)。
- 熵坍缩: 当机器人过度训练时,它的“思维”变得过于狭窄。它停止了探索不同的可能性,转而重复相同的几个答案。用论文中的话来说,它的熵坍缩了。
- 信号消失: 学习算法(称为 GRPO)通过比较不同的答案来工作。如果机器人连续 8 次给出相同的答案,算法就会感到困惑。它无法计算出“梯度”(改进的方向),因为没有差异可以进行比较。这就像试图驾驶一辆方向盘被锁死在正前方的汽车。
- 排名倒置 (Rank Inversion): 这导致了一个奇怪的结果,称为排名倒置。
- 在第二阶段训练之前,过度训练的机器人看起来像个天才(它在练习测试中 100% 答对)。
- 在第二阶段训练之后,它变成了一个灾难。
- 与此同时,那个起初看起来稍逊一筹的“不太完美”的机器人,却成为了超级明星。
两个模型:两个城市的故事
作者在两个不同的机器人大脑(模型)上测试了这一点:
- Qwen (受害者): 这个模型掉入了陷阱。他们在第一步中训练得越多,它就变得越僵硬。那个看起来“最好”的检查点(得分最高)反而是下一阶段最差的起点。
- DeepSeek (幸存者): 这个模型天生更具灵活性。即使经过重度训练,它也没有变得僵硬。它保持在可以继续学习的“安全区”。这证明了问题不在于第二个训练阶段本身,而在于第一阶段是如何破坏了 Qwen 的灵活性。
解决方案:两步检查法
作者不仅发现了问题,还构建了一个诊断工具,以便在浪费时间和金钱之前识别出它。
- 第一步:“拉伸”测试 (预 RL 熵): 在开始第二阶段训练之前,他们会检查机器人的思维有多“松弛”。如果机器人过于僵硬(低熵),他们会将其标记为高风险。
- 第二步:“早期预警”监控: 如果他们开始第二阶段,他们会观察最初的几分钟。如果机器人立即停止尝试新事物并开始重复自己,他们会提前停止训练以节省资源。
什么方法没起作用?
作者尝试用标准的技巧来修复这个“坏掉”的机器人,例如:
- 添加惩罚: “不要偏离你原始训练太远。”(这反而让情况变得更糟)。
- 平滑标签: “对你的答案表现得不那么确定。”(这让机器人看起来重新变得自信,但它在比赛中依然失败了)。
结论: 你不能通过在比赛期间告诉一个僵硬的舞者要“更努力”来修复他。你必须在第一阶段不要训练得如此僵化。论文证明了,当你想要一个模型保持持续学习的能力时,多样性(熵)比完美更重要。
技术摘要:SFT 过拟合通过 RLVR 下的熵崩塌预测排名反转
问题陈述
强化学习结合可验证奖励(RLVR)在代码生成中的标准启发式方法是选择具有最高 pass@1 分数的监督微调(SFT)检查点来初始化 RL 阶段(例如 GRPO)。本文证明,当 SFT 过拟合压缩模型的展开分布(rollout distribution)时,该启发式方法会失效。具体而言,长期的 SFT 会导致“熵崩塌”(entropy collapse),即模型的输出多样性降低到使 RL 算法无法生成有意义的梯度信号的程度。在这种机制下,选择最高 pass@1 的检查点系统性地识别出了表现最差的 RL 初始化器,从而导致了“排名反转”(rank inversion):即更深的 SFT 检查点在经过 RL 训练后,其表现反而不如较浅的 SFT 检查点。
研究方法
本研究在两个模型家族上隔离了 SFT 时长作为唯一的自变量:Qwen2.5-Coder-3B-Base 和 DeepSeek-Coder-6.7B-Base。
- 实验设置: 两个模型均在 5,000 个中等难度的 KodCode-V1 问题上进行微调。检查点在不同的 SFT 深度下被选取(Qwen 为 1.0 至 5.8 epoch;DeepSeek 为 1.0 至 9.6 epoch)。
- RL 训练: 所有检查点都经历了相同的 GRPO 训练(400 步,组大小 g=8,二元正确性奖励)作用于一个留出数据集(held-out dataset)。
- 指标: 通过
pass@1 和 pass@10(使用无偏估计量)在冻结的 40 个 HumanEval+ 子集上衡量性能。至关重要的是,作者追踪了 预 RL 熵(T=1.0 时的平均下一 token 熵)和 训练中熵,以诊断分布崩塌。
- 干预措施: 为了测试这是否为超参数的人为产物,作者在 GRPO 期间对参考策略应用了 KL 惩罚,并在 SFT 期间应用了标签平滑,以人工恢复熵。
核心贡献
- 梯度崩塌的理论阈值: 作者推导出,对于二元奖励,组内期望优势方差为 E[σG2]=p(1−p)(g−1)/g。他们确定了一个临界阈值 p∗(g),如果正确展开的概率(p)低于该值,组相对信号将在结构上发生崩塌(大多数组收到相同的奖励),导致梯度消失。
- 排名反转案例研究: 在 Qwen2.5-Coder-3B 上,本文记录了一个清晰的排名反转现象:随着 SFT 深度的增加,预 RL
pass@1 上升,但峰值后 RL pass@10 单调下降(从 0.806 降至 0.481)。最高的 pass@1 检查点(5.8 epoch)在 RL 下表现最差。
- 对比验证: 在 DeepSeek-Coder-6.7B 上,由于预 RL
pass@1 显著高于理论崩塌阈值 p∗(8),并未发生排名反转。相反,排名发生了压缩,所有检查点都在提升,这验证了阈值假设。
- 两阶段诊断法: 作者提出了一种诊断协议,用于在 RL 前或 RL 初期识别高风险检查点:
- 第一阶段(预 RL): 标记平均下一 token 熵低于阈值(τH=0.18 nats)的检查点。
- 第二阶段(早期 RL): 监测 GRPO 第 10 步到第 150 步之间最差 token 熵的相对下降。若下降超过 50%,则表明发生崩塌。
- 失效定位: 研究表明,简单的干预措施(KL 惩罚或标签平滑)无法挽救崩塌的检查点,这表明失效根源在于 SFT 阶段对塑性的消耗和熵的耗尽,而非可调的 GRPO 超参数问题。
结果
- Qwen2.5-Coder-3B: 预 RL
pass@1 与峰值后 RL pass@10 之间存在强负相关(ρ=−0.75)。尽管 5.8-epoch 检查点具有最高的预 RL pass@1 (0.187),但其在 RL 后崩塌至 0.481 的峰值 pass@10,而 1.0-epoch 检查点达到了 0.806。5.8-epoch 模型的熵在训练期间下降了 78%,而 1.0-epoch 模型仅下降了 37%。
- DeepSeek-Coder-6.7B: 所有检查点的预 RL
pass@1 均保持在崩塌阈值之上(p≥4.2×p∗(8))。因此,所有分支在 GRPO 下均有所提升,且预 RL 排名在 RL 后被完美保留(ρ=+1.00)。
- 干预措施: 添加 KL 惩罚(β=0.01)降低了两个检查点的性能,但并未逆转排名反转。在 5.8-epoch 检查点上使用标签平滑虽然将预 RL
pass@1 提高到了 0.600,但导致了最低的后 RL pass@10 (0.214),表明在没有恢复底层解的多样性的情况下,仅仅人工平滑分布是不够的。
意义与主张
本文声称,在 SFT 过拟合导致熵崩塌的机制下,选择最高 pass@1 的 SFT 检查点进行 RL 的做法是具有误导性的。作者认为,pass@1 测量的是错误温度(贪婪,T=0)下的能力,无法捕捉 RL 在 T=1.0 时所需的多样性。
其重要性在于将 熵崩塌 识别为 SFT 过拟合与 RL 失效之间的机械联系。本文指出,失效并非 GRPO 超参数的平凡人工产物,而是 SFT 过程中塑性丧失的一个基本问题。所提出的两阶段诊断法提供了一种实用的、与模型无关的方法(基于排序和风险信号而非通用阈值),用于过滤掉那些在消耗 RL 计算资源之前就已经耗尽学习信号的检查点。作者得出结论,保持 SFT 期间的熵是成功进行 RLVR 的先决条件,且一旦熵发生崩塌,标准的 RL 变体无法恢复策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。