← 最新论文
🤖 AI

GRPO is Secretly a Process Reward Model

本文从理论上证明了带有结果奖励模型的组相对策略优化(GRPO)等价于过程奖励模型,指出了其在处理不平衡步骤时存在的缺陷,并提出了一种简单的改进方法(λ\lambda-GRPO),该方法无需显式过程奖励模型即可显著提升推理性能和训练效率。

原作者: Michael Sullivan, Alexander Koller

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Sullivan, Alexander Koller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《GRPO 实为隐式过程奖励模型》的解读,通过简单概念和日常类比进行拆解。

核心理念:食谱中的“秘密配方”

想象一下,你正在教一个机器人解决复杂的数学问题。你给机器人一个提示,它尝试一步步写出解题过程。

通常,有两种给机器人打分的方式:

  1. 最终成绩(结果奖励):你只看最后一步。它是否得出了正确答案?如果是,得 10 分;如果不是,得 0 分。这就像老师只看期末考试成绩,而忽略了学生是如何解题的。
  2. 步骤评分(过程奖励):你对每一个步骤进行评分。“方程列得很好”,“哎呀,这里符号错了”。这更难实现,因为需要人类(或智能 AI)检查每一行。

论文的发现:
作者发现,一种流行的训练方法 GRPO(Group Relative Policy Optimization,组相对策略优化)实际上是在“意外”地做第二件事(步骤评分),尽管它本应只做第一件事(最终成绩)。

他们将其称为“过程奖励模型”(PRM),但称 GRPO 是“隐式”的过程奖励模型。这就像一位厨师以为自己在单纯地烤蛋糕,但实际上使用了一种秘密配料让蛋糕完美膨胀,而他甚至不知道这种配料的存在。


“秘密”如何运作:群聊类比

要理解 GRPO 如何隐式地对步骤进行评分,想象一个教室里的学生(一个“组”)都在尝试解决同一个谜题。

  1. 设置:老师提出一个问题。五名学生写下他们的答案。

  2. 重叠

    • 学生 A 写道:“首先,我加 2……"
    • 学生 B 写道:“首先,我加 2……"
    • 学生 C 写道:“首先,我加 2……"
    • 学生 D 写道:“首先,我乘以 5……"
    • 学生 E 写道:“首先,我乘以 5……"

    注意,学生 A、B 和 C 共享相同的第一个步骤(“加 2")。学生 D 和 E 共享另一个不同的第一个步骤。

  3. 隐式评分

    • 如果该组的最终答案很好,老师会给整个组打高分。
    • 因为 A、B 和 C 共享了相同的第一个步骤,算法意识到:“嘿,这个特定步骤(‘加 2')似乎为这三个人带来了好的结果。”
    • 然后,它会给所有使用过该步骤的人在该特定步骤上给予“奖励”。
    • 相反,如果该组失败了,且 D 和 E 都以“乘以 5"开始,算法就会意识到该步骤有风险,并对其进行惩罚。

结果:尽管老师只看最终答案,但算法通过观察哪些步骤在成功的组中共同出现,有效地推断出了哪些步骤是好的,哪些是坏的。


问题:“不公正的群体”

作者发现了这一隐式机制的一个缺陷。当群体平衡时,它运作良好,但当群体不平衡时,它就会失效。

类比
想象一个投票系统,你统计有多少人支持某个特定想法。

  • 场景:90% 的班级以“加 2"开始,只有 10% 以“乘以 5"开始。
  • 缺陷:如果“加 2"组的成绩略低于平均水平,算法对“加 2"步骤的惩罚力度将是“乘以 5"步骤的90 倍,仅仅因为做这件事的人太多了。
  • 后果:机器人可能会完全停止尝试“加 2"这条路径,即使它实际上是一条好路径,仅仅因为“人群”太大且得分略低。如果数字出现偏差,它就会害怕探索新路径或坚持好路径。

解决方案:λ\lambda-GRPO(“公平过滤器”)

作者提出了一种简单的修复方案,称为 λ\lambda-GRPO

类比
他们添加了一个“公平过滤器”,而不是同等地计算每一票。

  • 如果一个步骤非常流行(许多学生都做了),过滤器会说:“好吧,让我们将分数除以人数。”
  • 如果一个步骤很罕见,过滤器会说:“好吧,让我们给这个步骤赋予更多权重。”

这确保了每个步骤都根据其自身价值受到评判,而不是取决于在该特定组中恰好有多少人做了它。它防止算法被群体规模所“胁迫”。

结果:更快、更智能

作者在真实的数学问题上测试了这一修复方案:

  1. 性能提升:使用修复方案(λ\lambda-GRPO)的模型在数学推理任务上的得分高于标准模型。
  2. 学习加速:它们在一半的时间内(更少的训练步数)达到了峰值性能。
  3. 无额外成本:他们不需要雇佣昂贵的人类来对每个步骤进行评分。他们只是调整了现有算法的数学逻辑。

总结

该论文揭示,一种流行的 AI 训练方法(GRPO)一直以来都在隐式地充当步骤评分器。然而,它存在一个缺陷,即在面对不平衡的群体时会感到困惑。作者通过一个简单的数学调整(λ\lambda-GRPO)修复了这个缺陷,使 AI 能够更快、更好地学习推理任务,而无需任何额外的昂贵工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →