Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road
本文研究了微调推理模型中的“推理萎缩”现象,指出训练数据中模糊决策点场景的普遍存在是其主要成因,并证明有针对性的数据合成与多样性感知解码能够有效缓解这种覆盖度损失。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一名学生如何解迷宫。你希望他们无论选择哪条路径都能找到出口,同时也希望他们既快速又准确。
本文探讨了一个奇怪的问题:当我们训练高级 AI 模型(例如那些擅长复杂数学或逻辑的模型)成为“推理”专家时,会出现一种现象。我们将此问题称为“覆盖度收缩”(Coverage Shrinkage)。
以下是作者发现内容的简明拆解,并辅以日常类比:
问题所在:“收缩”的地图
当这些 AI 模型接受训练时,它们会变得非常擅长找到通往答案的唯一最佳路径。如果你只问它们一次问题,它们很可能答对(这被称为pass@1)。
然而,如果你将同一个问题问它们 10 次或 100 次,以观察它们可能采取的所有不同解法,它们就不再提供多样性了。它们开始给出完全相同的答案,或者更糟的是,它们都陷入了同一条错误的路径。它们的“可能解法地图”收缩了。它们失去了探索不同路线的能力。
罪魁祸首:“分岔路口”
作者认为,这并非因为 AI 的学习算法出了故障。相反,问题出在训练数据上。
想象一本故事书,书中的角色来到了一个分岔路口。
- 现实世界: 角色可能向左走,也可能向右走。两条路径看起来都合理,但只有一条能通向宝藏。
- 训练数据: 故事书只展示了角色走了右路。它从未解释为什么他们选择了右路而非左路,甚至根本没有提及左路是一个选项。
作者将这些时刻称为“分岔路口”(Forks in the Road)。这是模型必须在多个有效选项之间做出选择的决策点,但数据中只展示了其中一种。
由于模型从未见过其他路径被采用,它养成了一种坏习惯:“我必须选择第一个看起来正确的东西,并且我必须 100% 确信我是对的,即使我其实并不对。”它停止了探索。它不再考虑“左”路,因为故事书从未展示过它。
实验:验证理论
研究人员通过两个巧妙的设置测试了这一理论:
星形图(迷宫):
他们创建了一个简单的数学谜题,形状像星形迷宫。在起点处有两条路径,只有一条通向答案。- A 组的训练数据展示了模型向前穿过迷宫,并在分岔路口做出选择。
- B 组的训练数据展示了模型从答案向后回溯到起点(无需做出选择)。
- 结果: A 组(那些必须做出选择的组)失去了寻找替代路径的能力。B 组则保留了完整的地图。这证明了在信息不足的情况下做出选择的动作导致了收缩。
风格切换(代码与文字):
他们观察了那些既可以通过编写代码解决,也可以通过用纯英语书写来解决的数学问题。- 场景 1: 他们给模型提供了一组混合问题,但每个问题只有一种解决方案风格(有些是代码,有些是文字)。
- 场景 2: 他们给模型提供了相同的混合问题,但对于每一个问题,他们同时展示了代码解决方案和文字解决方案。
- 结果: 在场景 1 中,模型变得困惑,并开始根据微小的、无关的线索(例如单词的顺序)来选择风格,从而收缩了其选项。在场景 2 中,由于模型看到了同一个问题的两种选项,它保持了灵活性,并维持了其“地图”的宽广度。
“虚假线索”(坏习惯)
由于模型被迫在这些“分岔路口”做出选择,却不知正确答案,它开始抓住虚假线索(spurious cues,即假信号)。
- 示例: 如果问题以单词"Let"开头,模型可能会决定:“好吧,我将使用‘回溯’思维风格。”如果它以"To"开头,它可能会决定:“好吧,我将使用‘线性’风格。”
- 模型实际上并没有在思考数学;它只是在根据第一个单词做出反应。这使其变得脆弱。如果你改变第一个单词,模型可能会切换到一种完全不同的(且更差的)思维方式。
解决方案:微调第一步
本文提出了两种无需重新训练整个模型即可解决此问题的方法:
- 更好的数据设计: 在创建训练数据时,不要仅仅混合不同类型的问题。对于每一个具体问题,向模型展示多种有效的解决方法。这教会了模型:“在这个分岔路口,两条路径都是可能的。”
- “第一个词”技巧: 由于模型会卡在它生成的第一个词上,研究人员发现他们可以“抖动”开头。通过强制模型尝试以不同的常见单词开头(如"Okay"、"Let's"或"To"),他们可以解锁那些被锁定的不同思维风格。
- 类比: 这就像一扇卡住的门。模型认为门是锁着的,但如果你稍微改变推把手的方向(改变第一个词),门就会打开,模型就会记起它曾经知道的所有路径。
结论
本文总结道,AI 模型并没有“忘记”如何保持多样性。它们只是被锁定在单一路径上,因为它们的训练数据迫使它们在“分岔路口”做出盲目选择,而没有向它们展示替代方案。通过改变我们在数据中呈现这些选择的方式,或者在模型回答的最开始对其加以引导,我们可以找回那种丢失的多样性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。