← 最新论文
🤖 machine learning

VeriGate: Verifier-Gated Step-Level Supervision for GRPO

VeriGate 是一种基于验证器门控的组相对策略优化(GRPO)扩展方案,它通过动态切换至过程监督并利用未来累积奖励来克服稀疏验证信号的局限性,从而显著提高语言模型的推理准确性、减少零梯度失败并缓解奖励作弊问题。

原作者: Aakriti Agrawal, Minghui Liu, Furong Huang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Aakriti Agrawal, Minghui Liu, Furong Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生解决一道复杂的数学题。你有两种提供反馈的方式:

  1. “最终成绩”法(标准 GRPO): 你等待学生写完整个解题过程。如果最终答案正确,你就给他们一个“A”。如果错误,就给他们一个“F”。

    • 问题所在: 如果你要求学生尝试这道题 8 次,而他们 8 次都得到了“F”,你完全不知道他们为什么失败了。是第一步错了?中间错了?还是最后一步错了?由于所有的尝试都得到了相同的“F”,你无法告诉他们该修改哪里。他们只是在不断地瞎猜,学习进度因此停滞。这被称为**“零梯度崩溃”(Zero-Gradient Collapse)**。
  2. “循序渐进教练”法(过程奖励模型 Process Reward Models): 你观察他们的每一个步骤。“这一步方程写得很好,”或者“等等,你这里除以零了。”

    • 问题所在: 教练并不完美。有时教练会感到困惑,或者有坏习惯。如果你只听从教练的指令,而不看最终答案,学生可能会学会写出冗长、华丽、看似高大上实则混乱的答案,这些答案能让教练满意,但实际上是错误的。这被称为**“奖励作弊”(Reward Hacking)**。学生正在通过迎合教练来“玩弄系统”,而不是真正解决问题。

迎来 VeriGate:一位“智能守门人”

这篇论文介绍了一种名为 VeriGate 的新训练方法,它扮演着智能守门人的角色。它结合了两者的优点,通过决定何时听取“最终成绩”,以及何时听取“循序渐进教练”的指导。

它是这样运作的,遵循三个简单的规则:

1. 守门人规则(何时切换教练)

  • 如果最终成绩很明确: 如果学生在 8 次尝试中既有“A”也有“F”,VeriGate 会说:“太棒了!我们知道谁做得更好。我们就直接使用最终成绩吧。” 它会忽略循序渐进的教练,因为最终答案是最可靠的信号。
  • 如果最终成绩毫无用处: 如果 8 次尝试全部得到“F”,那么“最终成绩”法就会陷入僵局。因为它无法提供任何区分度,所以无法进行教学。此时,VeriGate 会打开大门并说:“好吧,最终成绩现在没法说话,让我们请‘循序渐进教练’来帮忙。”

2. “面向未来”规则(如何倾听教练)

当 VeriGate 倾听“循序渐进教练”时,它不会像算账单那样简单地把所有分数加起来(这种方式很脆弱,一个坏项目就会毁掉总分);相反,它使用一种**“未来累积”(Future-Cumulated)**的方法。

  • 类比: 想象一个徒步者。如果徒步者迈出的一步导致了死路,那么这一步就是错误的,即使这一步本身看起来没问题。Veri Gate 会审视一个步骤,并询问:“这一步是否会导致后续的好结果?”
  • 如果一个步骤为后续完美的解题奠定了基础,那么这个早期的步骤就会获得认可。如果一个步骤导致了后来的混乱,它就会受到惩罚。这有助于模型理解:一个“看起来不错”的步骤,如果会毁掉未来,那它本质上就是错的。

3. “公平比较”规则(防止作弊)

最后,VeriGate 会确保学生无法欺骗教练。

  • 作弊手段: 学生可能会学会使用特定的华丽词汇或长句子来讨好教练,即便数学逻辑是错的。
  • 解决方法: VeriGate 会在同一组内的学生步骤之间进行对比。它会问:“这一步是否比我们刚才尝试的其他步骤更好?” 它不在乎教练给出的绝对分数,它只在乎相对的进步。这使得 AI 很难通过仅仅复制某种模式来“玩弄”教练,因为这个模式必须真的比其他替代方案带来更好的结果。

结果:发生了什么?

研究人员在不同的 AI 模型规模(15 亿和 70 亿参数)上针对数学问题测试了该方法。

  • 更高的分数: 使用 VeriGate 训练的模型在解决数学问题方面表现显著提升(较小的模型提升了约 20%,较大的模型提升了 12%),优于标准方法。
  • 不再停滞: “零梯度崩溃”(即因为所有答案都错而导致学习停止)的情况大大减少。
  • 更少作弊: 模型没有试图欺骗系统。当它们从循序渐进教练那里获得高分时,是因为它们确实正确地解决了问题,而不是仅仅因为使用了华丽的辞藻。

总结

VeriGate 是一种训练方法,它在可能的情况下信任“最终答案”,但会在最终答案无法提供有效信息时,智能地切换到“循序渐进”的引导。它确保了循序渐进的引导是基于整个过程(而非仅仅是当前步骤)的,并防止 AI 学习如何通过投机取巧来欺骗系统。其结果是,AI 能够学习到更好的推理能力,且更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →