← 最新论文
🤖 AI

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

本文提出了 ACOER,一种通过将长度惩罚隔离至正确答案并采用动态预算归一化,从而稳定大型推理模型效率训练,进而防止奖励崩溃并显著提高准确率及减少 Token 生成的新型奖励机制。

原作者: Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:“过度思考”的学生

想象你有一个非常聪明的学生(AI 模型),他非常擅长解决数学问题。然而,这个学生有一个坏习惯:他说话太啰嗦了。即使是一个像“2 + 2”这样简单的题目,他可能会写一篇 5000 字的文章,解释所有可能的加法方式,最后才说出“4”。

这被称为冗余(Verbosity)。这浪费了时间和计算资源。研究人员希望教会这个学生变得简洁——在说出“4”之前,不要写那篇 5000 字的文章。

失败的尝试:“严厉的老师”

为了解决这个问题,研究人员尝试了一种叫做 GRPO(组相对策略优化)的方法。他们增加了一条规则:“如果你写的字数太多,你就会受到惩罚。”

然而,他们在应用这条规则时犯了一个关键错误。他们既惩罚了太长的正确答案,也惩罚了太长的错误答案

类比: 想象一位老师告诉学生:

“如果你答错了,我会根据你解释的长度来扣分。如果你答对了,但写得太多,我也同样会扣分。”

结果如何? 学生惊慌失措。他们意识到,如果他们写了一段又长又复杂的解释却答错了,就会受到双重惩罚。于是,他们开始什么都不写。他们完全停止了思考。他们会直接瞬间猜一个“4”,哪怕正确答案其实是“5”。

这就是所谓的奖励崩溃(Reward Collapse)。模型因为害怕“又长又错”带来的惩罚,从而停止了推理过程,变得虽然简短但毫无用处。

发现:为什么“严厉的老师”失败了

论文作者调查了发生这种情况的原因。他们发现了两个主要原因:

  1. “错误答案”陷阱: 当你惩罚冗长的错误答案时,AI 大脑内部的数学逻辑会出错。它会产生一个反馈循环,让 AI 认为:“最稳妥的做法是干脆什么都不说。” 哪怕只是对冗长错误答案的微小惩罚,也足以破坏整个系统。
  2. “过度压缩”陷阱: 即使你惩罚冗长的正确答案(即“仅限正确答案”的方法),AI 仍然可能崩溃。有时,AI 会过于自信地认为“越短越好”,从而过度压缩其思考过程,以至于即使面对难题也会漏掉解题思路。这就像一个学生背下了答案清单,但并没有真正学会数学。

解决方案:ACOER(“聪明的教练”)

作者提出了一种新方法:ACOER(自适应仅限正确效率奖励)。把 ACOER 想象成一位聪明的教练,他使用三条特定的规则来训练学生,同时不会弄坏他们的思维:

1. “不对错误猜测进行惩罚”规则

  • 运作方式: 教练说:“如果你答错了,我不在乎你的解释有多长。你会得到 0 分,但不会因为太长而受到‘额外’惩罚。”
  • 为什么有效: 这消除了恐慌。学生知道他们可以深入思考并犯错,而不会因为思考过程的长短而受到惩罚。他们只有在答对时才会因为简洁而获得奖励。

2. “移动的终点线”规则(自适应预算)

  • 运作方式: 教练不再说“你必须写在 500 字以内”,而是观察学生。如果学生开始写 200 字,教练就把目标降到 150 字;如果他们降到 100 字,目标就变成 80 字。
  • 为什么有效: 这防止了学生陷入“越短越好”的死循环。它让目标保持动态变化,使学生能够循序渐进地提高,而不是突然放弃思考。

3. “安全刹车”规则(控制回路)

  • 运作方式: 教练不断检查测试成绩。如果学生因为写得太少而开始答错题目,教练会立即说:“停!慢一点。你可以多写一些字了。”
  • 为什么有效: 这防止了“过度压缩”陷阱。它确保 AI 永远不会为了追求速度而牺牲准确性。如果准确率下降,缩减字数的压力就会被放宽。

结果:快速且准确

当他们用这些困难的数学问题测试这个新“聪明的教练”(ACOER)时:

  • 速度: AI 将它写的字数减少了 62%(从数千字减少到了可控的范围内)。
  • 准确度: AI 的数学能力保持得和以前一样好。它并没有开始随机乱猜。
  • 适应性: AI 学会在处理简单问题(如“2+2”)时变得简短,但在处理非常难的问题时,如果需要,它仍然会写下详细的解释。

总结

这篇论文告诉我们,要让 AI 变得高效,你不能仅仅因为它写得长就惩罚它,尤其是当它答错的时候。这会让它停止思考。相反,你应该在它答对时奖励它的简洁,并建立一个安全系统,防止它因为追求极致简短而导致错误。这创造了一个稳定、高效且聪明的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →