← 最新论文
🤖 machine learning

Stage-1 Controls the Entropy Regime, Not the Outcome

本研究表明,虽然第一阶段热启动方法(SFT 与 OPD)显著影响视觉语言模型的初始熵机制和回答多样性,但它们并不会实质性地改变第二阶段强化学习后的最终领域内性能,也不提供明确的下游优势。

原作者: Jianxiong Shen

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianxiong Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个智能机器人(一种视觉语言模型)来解决复杂的几何谜题。这篇论文研究了在将这个机器人送入名为“强化学习(RL)”的高强度训练营之前,最好的“热身”方式是什么。

有两种主要的预热方式:

  1. SFT(监督微调): 你给机器人展示一本由超级聪明的老师编写的完美答案教科书,并对它说:“完全照着这些内容背下来。”
  2. OPD(在策略蒸馏): 你让机器人尝试自己解决问题,但每当它卡住或犯错时,超级聪明的老师就会在旁边低声提示正确的下一步。机器人通过模仿老师的“过程”,而不仅仅是最终答案来学习。

研究人员想知道:我们热身的方式会改变最终结果吗?

以下是他们的发现,使用了简单的类比:

1. “最终得分”出奇地相似

把最终考试(解决几何问题)想象成一场比赛。研究人员尝试了三种不同的热身方法。

  • 发现: 无论使用哪种热身方式,机器人在比赛结束时的成绩几乎完全一样(大约在 53–54% 的准确率)。
  • 类比: 这就像三个跑步者从赛道上略微不同的起点出发。当他们到达终点线时,他们都挤在一起,形成了一个微小的集群。热身并没有给任何人带来那种能持续到最后的巨大领先优势。

2. 关于“遗忘”的迷思

有些人担心,如果你教了机器人太多特定的数学知识(SFT),它会忘记如何做其他事情(比如通用的数学谜题)。

  • 发现: 只有当你训练得太久或者使用了错误的指令时,这种情况才会发生。如果你在正确的时间停止训练,机器人并不会遗忘任何东西。
  • 类比: 这就像为一场特定的历史考试而学习。如果你死记硬背了 10 个小时,你可能会连自己的名字都忘了。但如果你只学习了 1 个小时,你既能记住考试内容,也能记得自己的名字。问题不在于学习方法,而在于学习时间太长了。

3. 真正的区别:“熵”(机器人的情绪)

这是本论文最大的发现。虽然最终得分相同,但机器人的“内部状态”却非常不同。

  • SFT 机器人: 它们变得非常自信且僵化。它们知道答案并坚持自己的观点。它们的“熵”(衡量随机性或多样性的指标)非常低。它们就像一个会说:“我知道答案是 4,我绝不会说是 5”的机器人。
  • OPD 机器人: 它们保持着好奇心和多样性。它们会同时考虑几种不同的可能性。它们的“熵”要高得多。它们就像一个会说:“答案很可能是 4,但也可能是 5 或 6”的机器人。
  • 类比: 想象一位厨师。
    • SFT 厨师是一个只能完美烹饪一种特定食谱的机器人。
    • OPD 厨师是在掌握主食谱的同时,还记得老师曾说过的“也许可以加一点盐”或“也许可以多加点香料”。OPD 厨师拥有更广泛的创意菜单。

4. “好奇心”会有帮助吗?

研究人员问道:“拥有这种额外的多样性(高熵)是否能帮助机器人解决更多问题?”

  • 初期阶段(在最终训练之前): 是的!OPD 机器人(那个好奇的机器人)如果你给它 16 次尝试机会,它可以生成许多不同的正确答案。它更擅长探索各种选项。
  • 最终训练后(RL 之后): 不。一旦机器人经历了高强度的训练营,最初的那种好奇心就消失了。无论是僵化的 SFT 机器人还是好奇的 OPD 机器人,最终解决的问题数量都是一样的。
  • 面对新谜题(领域外问题): 这种好奇心也无法帮助机器人解决新型的数学问题。这种优势完全消失了。

总结

论文的结论是,选择热身方式(SFT 与 OPD)就像是在选择一个严厉的教官还是一个灵活的教练

  • 它控制了什么: 它控制了机器人在早期阶段的“个性”(它是思维僵化还是思维灵活)。
  • 它没能控制什么:并不能保证更高的最终得分,也不能保证在面对未见过的全新问题时表现更好。

核心启示: 如果你希望现在的机器人拥有更多元化的思维,请使用灵活的教练(OPD)。但不要指望这种多样性在机器人完成训练后会自动转化为更高的最终得分。热身设定了“情绪”,但“训练营”(RL)才是决定最终结果的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →