All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training
本文介绍了一种名为全象限有界裁剪 GRPO(ABC-GRPO)的新型强化学习算法,该算法通过应用无条件裁剪,解决了标准 GRPO 在负优势象限中的结构性无界问题,从而确保了稳定的高熵训练,并在数学和编程基准测试中实现了卓越的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个聪明但有点混乱的机器人如何解决数学问题。你不想仅仅告诉它正确答案;你希望它学会“如何思考”。这就是强化学习的世界,在这里,AI 通过尝试、获得评分并根据评分调整行为来学习。目前该领域的明星方法叫做“群体相对策略优化”(Group Relative Policy Optimization,简称 GRPO)。可以将 GRPO 想象成一位严厉的教练,他会审视学生写的整篇论文(一连串的词句),并为整篇作品给出一个总分。如果论文得了高分,教练会说:“做得好,保持现在的状态!”如果得了低分,教练会说:“做得不好,撤销你刚才做的一切。”
问题在于,这种“整篇论文”的处理方式可能有点不公平。有时,学生在一段糟糕的论文中写出了一个完美的句子。在旧规则下,这个完美的句子会随着糟糕的部分一起受到惩罚;反之,一个优秀论文中的胡言乱语也可能因此获得免费通行证。这造成了一个盲点,让 AI 感到困惑,导致它停止尝试新想法,最终陷入僵局,甚至忘记了如何发挥创造力。你即将阅读的这篇论文正是针对这一特定的困惑,提出了一套新的规则,以保持 AI 学习的稳定性并激发其想象力。
不公平的教练与错误的四个象限
来自 PayPal.AI 的作者 Chi Liu 和 Xin Chen 注意到了 GRPO 在训练这些 AI 模型时存在的一个隐藏缺陷。为了理解他们的解决方法,请将 AI 的学习过程想象成在一张巨大的地图上玩游戏,这张地图被划分为四个角落,即“象限”。在这张地图上,一个轴追踪 AI 改变想法的程度(它是让一个词出现的概率变高还是变低?),另一个轴则追踪教练认为这个举动是好是坏。
在其中三个象限中,规则运行良好。但在一个特定的角落——我们称之为“危险区”——旧规则完全失效了。这种情况发生在 AI 让一个词变得更可能出现(它很有信心),但教练却因为整篇论文的表现而给了它一个差评时。在旧系统中,如果 AI 对那个词非常有信心,这种惩罚可能是无限大的。这就像一位老师告诉学生:“你 99% 确定这个答案是正确的,但既然整篇论文失败了,你就必须彻底忘掉这个词,哪怕这个词本身其实是正确的!”
这种“无界限”的惩罚是危险的。它会导致 AI 陷入恐慌。与其探索解决问题的不同方式,它会坍缩到大脑中一个极小的、安全的角落,反复重复同样的几种模式。作者称之为“熵坍缩”(entropy collapse),这是一种高级说法,意思是指 AI 停止了创造力,变成了一个乏味、僵化的机器人。他们发现,正是这个特定的“危险区”是导致 AI 模型在处理难题时表现变差的主要原因,尽管它们在处理简单问题时表现得越来越好。
新规则手册:ABC-GRPO
为了解决这个问题,团队发明了一种名为全象限有界裁剪 GRPO(All-Quadrant Bounded Clipping GRPO,简称 ABC-GRPO)的新方法。你可以将其想象为给教练换了一本更公平的新规则手册。
在旧系统中,教练在某些情况下只能对 AI 进行有限的惩罚,但在“危险区”,惩罚是没有上限的。ABC-GRPO 在地图的所有四个象限中都设置了一个“速度限制”。在教练将分数应用到 AI 的大脑之前,他们会检查:“这个惩罚是否过大?”如果 AI 处于危险区且惩罚巨大,新规则会说:“停!把它限制在这里。”
至关重要的是,这条新规则为变化设定了一个“底线”和“天花板”。它确保即使 AI 在一篇糟糕的论文中犯了错,也不会被彻底抹除。它能防止 AI 的信心产生剧烈波动。作者描述这并非一种让 AI 瞬间变聪明的魔法,而是一种“稳定性机制”——就像给自行车安装了辅助轮,防止骑手摔倒,从而让他们能持续向前蹬踏。
他们的发现:拯救推理能力
团队在 Qwen3(一款强大的数学求解 AI)上测试了这种新方法。他们将 ABC-GRPO 与传统的 GRPO 以及其他几种流行的方法进行了对比。结果令人瞩目。
在使用旧有的 GRPO 时,AI 寻找不同解法的能力(其“推理边界”)随着训练的进行反而变差了。它开始放弃创造性的路径。但使用 ABC-GRPO 后,AI 不仅在获得正确答案方面变得更好,还保持了探索的能力。
在困难的数学挑战(如 AIME 2024)测试中,ABC-GRPO 在准确性和多样性方面都取得了最高分。例如,对于一个 40 亿参数的模型,ABC-GRGB 平均能正确解决约 38.3% 的问题,而标准 GRPO 为 34.5%。更重要的是,在观察从 64 次尝试中找到任何正确解的能力(Pass@64)时,ABC-GRPO 达到了 70.3%,而标准 GRPO 则降至 59.4%。
作者还检查了这种技巧是否适用于 AI 未曾见过的任务,比如编程谜题(HumanEval)和更难的数学集(MATH-500)。结果依然成立:经过 ABC-GRPO 训练的 AI 在这些新任务上也表现得更好,这证明了该修复方案不仅仅是针对特定测试的运气。
“危险区”才是真正的元凶
这项研究中最有趣的环节之一是对问题的“解剖”。研究人员问道:“是整个新规则手册解决了问题,还是仅仅是停止无限惩罚的那部分起到了作用?”
他们进行了实验,仅修复了“危险区”(第四象限)而保持其他象限不变。他们发现,仅修复这一个角落就恢复了约 72% 的总提升。这证实了他们的理论:那个特定角落里的无界限惩罚是导致 AI 坍缩的主因。其他象限也需要一点帮助,但“危险区”才是那个让整艘船沉没的大洞。
为什么这很重要
作者谨慎地指出,他们并没有解决“完美”AI 推理的问题。他们并没有找到如何为 AI 写的每一个词都给出完美评分的方法。相反,他们建立了一个安全网。通过限制惩罚,他们防止了 AI 因为害怕而放弃自己的创造力。
论文表明,通过仅仅为 AI 在特定情况下因过度自信而受到的惩罚设定一个“速度限制”,我们就能保持 AI 的思维开放、多样且稳定。这提醒我们,有时教导一个超智能机器人最好的方式,不是逼它更努力,而是确保它在尝试新事物时不会崩溃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。