← 最新论文
🤖 machine learning

Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

本文指出优势坍缩是组相对策略优化(GRPO)中导致训练停滞的关键失效模式,并提出自适应虚拟样本策略优化(AVSPO),这是一种利用虚拟奖励样本缓解该问题并在多种模型规模下显著提升推理性能的轻量级方法。

原作者: Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Group Relative Policy Optimization 中的优势崩溃:诊断与缓解》的通俗解读,辅以生动的类比。

宏观图景:教机器人解数学题

想象你正在教一个机器人(AI 模型)如何解答高难度的数学题。你没有人类老师站在它肩后指导,而是使用一套严格的“答案密钥”(验证器)。如果机器人答对了,它就获得一颗金星(奖励 = 1);如果答错了,就没有星星(奖励 = 0)。

这篇论文聚焦于一种特定的教学方法,称为GRPO(Group Relative Policy Optimization,组相对策略优化)。GRPO 不是让机器人一次只解决一个问题,而是给它同一道题的 8 个不同解答尝试。随后,它将这 8 个尝试相互比较,以此判断哪些表现“更好”并值得重复。

问题所在:“静默停滞”(优势崩溃)

论文揭示了这种教学方法中存在一个隐蔽的陷阱,称为优势崩溃(Advantage Collapse)。

类比:班级合影
想象你是一位老师,正在给一个由 8 名学生组成的班级批改数学测验。

  • 场景 A(良好): 4 名学生得 A,4 名得 F。你可以轻松告诉优等生保持现状,告诉后进生改变策略。此时的“梯度”(学习信号)非常强烈。
  • 场景 B(崩溃):
    • 情况 1: 所有 8 名学生都得 A。
    • 情况 2: 所有 8 名学生都得 F。

在这两种情况下,班级都是同质化的。每个人都做了完全相同的事。

  • 如果所有人都得 A,老师会想:“好吧,他们都做了同样的事,所以没人值得学习。”
  • 如果所有人都得 F,老师会想:“他们都以同样的方式失败了,所以也没人值得学习。”

在 AI 世界中,当所有 8 次尝试获得相同的奖励(全对或全错)时,学习算法背后的数学逻辑就会失效。“学习信号”降至零。AI 停止学习,尽管它仍在运行并消耗电力。论文将这种现象称为优势崩溃。这就像汽车引擎轰鸣作响,但车轮却纹丝不动。

诊断: "ACR" 仪表

作者意识到,标准指标(如查看最终得分)反应太慢。当你看到分数下降时,AI 已经在这种“静默停滞”中浪费了数小时的训练时间。

他们发明了一种新工具,称为ACR(优势崩溃率)

  • 类比: 将 ACR 想象为你汽车仪表盘上的“停滞警报”。
  • 与其等待看你是否到达目的地,ACR 会立即检查:“我当前的尝试中有多少是相同的?”
  • 如果 ACR 很高,意味着 AI 陷入了相同答案(全对或全错)的循环中,没有在学习。
  • 发现: 他们发现,如果在训练早期检查这个警报,可以以 62% 的准确率预测 AI 最终是会失败还是成功。它是训练效率的“水晶球”。

解决方案:AVSPO(“虚拟样本”技巧)

一旦知道了 AI 何时陷入停滞,他们就需要一种方法让它重新动起来,而无需浪费时间生成新的答案(这既昂贵又缓慢)。

他们提出了一种名为**AVSPO(Adaptive Virtual Sample Policy Optimization,自适应虚拟样本策略优化)**的方法。

类比:虚拟观众
想象 AI 是一位在舞台上的喜剧演员。

  • 问题: 观众(8 次尝试)要么对所有内容都大笑(全对),要么对所有内容都喝倒彩(全错)。喜剧演员不知道该如何改变,因为反应是单一的。
  • AVSPO 的修复: 培训师不要求喜剧演员重新尝试(这需要时间),而是秘密引入几位虚拟观众
    • 如果真实观众对一切都在大笑,虚拟成员会对几个笑话喝倒彩。
    • 如果真实观众对一切都在喝倒彩,虚拟成员会对几个笑话大笑。
  • 结果: 现在,“房间”里再次有了混合的反应。喜剧演员可以看到:“哦,这个笑话逗乐了,但那个笑话被喝倒彩了。”学习信号恢复了!

关键在于,这些“虚拟样本”只是注入数学中的数字;AI 实际上不需要生成新的文本。这是一种廉价、快速的技巧,用于打破僵局。

结果

该论文在数学问题上进行了测试,使用的 AI 模型范围从非常小(05 亿参数)到非常大(140 亿参数)。

  1. 减少停滞: AVSPO 将 AI 处于“静默停滞”的时间减少了约60%
  2. 更聪明的 AI: 由于 AI 花在停滞上的时间更少,而学习时间更多,其在数学测试上的准确率整体提高了4–6 个百分点
  3. 无额外成本: 由于他们不需要生成新的答案,该方法的速度和成本与原始方法一样,只是更聪明。

总结

论文发现,在教 AI 解决数学问题时,它经常陷入所有猜测都相同的循环,导致其停止学习。他们构建了一个仪表(ACR)来立即发现这种情况,并设计了一个修复方案(AVSPO),通过向混合体中注入“虚假”的多样性来保持 AI 的学习状态,从而在不增加额外计算成本的情况下,造就了一个显著更聪明的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →