← 最新论文
🤖 machine learning

Verifier-Induced Support Reshaping in On-Policy Optimization

本文揭示了带有可验证奖励(RLVR)的在策略强化学习可以在提高即时任务性能的同时,在无意中导致“验证器诱导的支持重塑”,即策略会收窄其输出分布,使得面向未来目标的成功轨迹变得过于稀少而无法被采样,从而损害长期可训练性和综合能力。

原作者: Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何成为一名得力的助手。你不仅希望它了解事实,还希望它能遵循规则、解决复杂的数学问题并编写代码。为了实现这一目标,科学家们使用了一种叫做“强化学习”的方法,这就像一场游戏:机器人尝试不同的答案,从一个“验证器”(一个严格的裁判)那里获得分数,并学习重复那些得分高的动作。人们最大的希望是,我们可以教机器人一项接一项的技能——先是数学,然后是写作,最后是编程——而不会让它忘记旧知识或产生混乱。这就是“持续学习”的梦想:构建一个能够一步步变得越来越全能的机器人。但如果教机器人完美掌握一项技能的行为,无意中锁上了学习下一项技能的大门呢?如果机器人学会了如此出色地遵循指令,以至于它忘记了如何进行逐步思考,或者反之亦然呢?

这篇论文研究了一个被称为“验证器诱导的支持集重塑”(verifier-induced support reshaping)的隐蔽问题。研究人员发现,当你使用一个严格的裁判来训练一个 AI 擅长某项特定任务时,AI 不仅仅是在该任务上变得更好,它实际上改变了自己的“性格”,使得日后学习其他任务变得困难得多。这就像如果你训练一只狗在你说“坐下”时只能坐下,在此过程中,你可能无意中教会了它“坐下”是唯一重要的词。随后,当你试图教它“待着不动”时,它可能会感到困惑,因为它的思维已经被重塑,以至于忽略了其他一切。论文表明,这不仅仅是关于机器人忘记旧技巧(一个被称为“灾难性遗忘”的已知问题)的问题;而是关于机器人让“正确”答案变得如此稀缺,以至于训练过程再也无法找到它们。即使机器人仍然具备解决某个数学问题的能力,它也可能不再尝试以正确的方式去解决,因为它已经习惯了另一种回答风格。

研究人员通过在两种截然不同的任务上训练两类 AI 模型来测试这一点:解决数学问题和遵循严格的写作指令(例如“恰好写 50 个字”或“使用项目符号”)。他们将一组模型训练成数学天才,另一组训练成指令遵循专家。然后,他们交换了裁判,以观察会发生什么。

以下是他们的发现:

数学到指令的陷阱
当他们先训练 AI 成为数学天才时,AI 在平均意义上确实变得更擅长遵循指令了。然而,发生了一件奇怪的事情:AI 变得非常“两极分化”。它要么完美地执行指令,要么完全失败,几乎没有“中间地带”的尝试。此前,AI 可能会尝试许多种不同的回答方式,其中一些接近正确。但在数学训练之后,它停止了尝试这些中间路径。这意味着,如果你尝试采样许多个答案(比如要求 AI 尝试 32 次),你很难找到任何一个成功的指令遵循答案。数学训练极大地缩小了 AI 的关注范围,使其停止了探索学习新指令遵循技巧所需的“支持集”(即尝试的多样性)。

指令到数学的陷阱
反向的过程更有趣。当他们先训练 AI 成为指令遵循者时,AI 开始改变它回答数学问题的方式。它不再展示其解题步骤(例如“首先,我把 2 加 2……”),而是开始直接跳到答案(“答案是 4”)。研究人员称这种转变是从“审慎推理启动”(Deliberate Reasoning Initiation, DRI)到“直接答案启动”(Direct Answer Initiation, DAI)的转变。
这种转变影响巨大。当 AI 开始跳过步骤时,即使 AI 仍然知道数学,寻找正确答案也会变得更加困难。事实上,AI 跳向直接答案的倾向越强,当他们尝试多次采样时,成功率就越低。寻找正确数学答案的“支持集”萎缩了。

“首个 Token”的秘密
研究人员深入挖掘,试图找出为什么会发生这种情况。他们发现,这种变化并不是关于 AI 在句子后半部分是否忘记了数学,而是发生在 AI 打出的第一个词上!
事实证明,数学的“裁判”(验证器)鼓励 AI 以“好的”、“让我们逐步推导”等词汇开头,而指令的“裁判”则鼓励以“答案是”、“这里是”等词汇开头。一旦 AI 学会了以“答案是”开头,它就会陷入一种路径,从而跳过推理步骤。研究人员通过强制 AI 即使在接受过指令遵循训练后也要使用“数学式”的开头词,证明了这一点。当他们这样做时,AI 寻找数学解的能力神奇地提高了。这表明 AI 并没有失去它的“数学大脑”,它只是卡在了一个糟糕的“开场白”习惯里。

我们能修复它吗?
团队尝试修复这个问题。他们尝试让 AI 始终以正确的词汇开头进行“预训练”(一种 DRI 先验),但这只是延迟了问题;最终,AI 仍然会转向直接回答的风格。他们还尝试了一种名为“策略内蒸馏”(on-policy distillation)的技术,即让一个学生 AI 尝试模仿老师 AI。但只有在非常仔细地挑选老师的情况下,这种方法才有效;如果老师已经学会了那种“坏习惯”,学生也会模仿它。

底线
论文总结道,仅仅让一个 AI 在某项任务上表现出色,并不保证它已经为学习下一项任务做好了准备。事实上,在一项领域的进步有时会使下一项任务的“搜索空间”变得如此狭窄,以至于 AI 根本找不到正确答案。数学或指令遵循能力的提升,并不总是能转化为既正确又符合规则的答案。这对 AI 开发人员提出了警告:仅仅因为一个模型在今天的测试中得分很高,并不意味着它没有为自己的未来学习锁上大门。为了保持 AI 的灵活性,我们需要确保它保留多种“开场白”的可能性,而不仅仅是那些目前得分最高的动作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →