GRPO is Secretly a Process Reward Model
本文从理论上证明了带有结果奖励模型的组相对策略优化(GRPO)等价于过程奖励模型,指出了其在处理不平衡步骤时存在的缺陷,并提出了一种简单的改进方法(-GRPO),该方法无需显式过程奖励模型即可显著提升推理性能和训练效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《GRPO 实为隐式过程奖励模型》的解读,通过简单概念和日常类比进行拆解。
核心理念:食谱中的“秘密配方”
想象一下,你正在教一个机器人解决复杂的数学问题。你给机器人一个提示,它尝试一步步写出解题过程。
通常,有两种给机器人打分的方式:
- 最终成绩(结果奖励):你只看最后一步。它是否得出了正确答案?如果是,得 10 分;如果不是,得 0 分。这就像老师只看期末考试成绩,而忽略了学生是如何解题的。
- 步骤评分(过程奖励):你对每一个步骤进行评分。“方程列得很好”,“哎呀,这里符号错了”。这更难实现,因为需要人类(或智能 AI)检查每一行。
论文的发现:
作者发现,一种流行的训练方法 GRPO(Group Relative Policy Optimization,组相对策略优化)实际上是在“意外”地做第二件事(步骤评分),尽管它本应只做第一件事(最终成绩)。
他们将其称为“过程奖励模型”(PRM),但称 GRPO 是“隐式”的过程奖励模型。这就像一位厨师以为自己在单纯地烤蛋糕,但实际上使用了一种秘密配料让蛋糕完美膨胀,而他甚至不知道这种配料的存在。
“秘密”如何运作:群聊类比
要理解 GRPO 如何隐式地对步骤进行评分,想象一个教室里的学生(一个“组”)都在尝试解决同一个谜题。
设置:老师提出一个问题。五名学生写下他们的答案。
重叠:
- 学生 A 写道:“首先,我加 2……"
- 学生 B 写道:“首先,我加 2……"
- 学生 C 写道:“首先,我加 2……"
- 学生 D 写道:“首先,我乘以 5……"
- 学生 E 写道:“首先,我乘以 5……"
注意,学生 A、B 和 C 共享相同的第一个步骤(“加 2")。学生 D 和 E 共享另一个不同的第一个步骤。
隐式评分:
- 如果该组的最终答案很好,老师会给整个组打高分。
- 因为 A、B 和 C 共享了相同的第一个步骤,算法意识到:“嘿,这个特定步骤(‘加 2')似乎为这三个人带来了好的结果。”
- 然后,它会给所有使用过该步骤的人在该特定步骤上给予“奖励”。
- 相反,如果该组失败了,且 D 和 E 都以“乘以 5"开始,算法就会意识到该步骤有风险,并对其进行惩罚。
结果:尽管老师只看最终答案,但算法通过观察哪些步骤在成功的组中共同出现,有效地推断出了哪些步骤是好的,哪些是坏的。
问题:“不公正的群体”
作者发现了这一隐式机制的一个缺陷。当群体平衡时,它运作良好,但当群体不平衡时,它就会失效。
类比:
想象一个投票系统,你统计有多少人支持某个特定想法。
- 场景:90% 的班级以“加 2"开始,只有 10% 以“乘以 5"开始。
- 缺陷:如果“加 2"组的成绩略低于平均水平,算法对“加 2"步骤的惩罚力度将是“乘以 5"步骤的90 倍,仅仅因为做这件事的人太多了。
- 后果:机器人可能会完全停止尝试“加 2"这条路径,即使它实际上是一条好路径,仅仅因为“人群”太大且得分略低。如果数字出现偏差,它就会害怕探索新路径或坚持好路径。
解决方案:-GRPO(“公平过滤器”)
作者提出了一种简单的修复方案,称为 -GRPO。
类比:
他们添加了一个“公平过滤器”,而不是同等地计算每一票。
- 如果一个步骤非常流行(许多学生都做了),过滤器会说:“好吧,让我们将分数除以人数。”
- 如果一个步骤很罕见,过滤器会说:“好吧,让我们给这个步骤赋予更多权重。”
这确保了每个步骤都根据其自身价值受到评判,而不是取决于在该特定组中恰好有多少人做了它。它防止算法被群体规模所“胁迫”。
结果:更快、更智能
作者在真实的数学问题上测试了这一修复方案:
- 性能提升:使用修复方案(-GRPO)的模型在数学推理任务上的得分高于标准模型。
- 学习加速:它们在一半的时间内(更少的训练步数)达到了峰值性能。
- 无额外成本:他们不需要雇佣昂贵的人类来对每个步骤进行评分。他们只是调整了现有算法的数学逻辑。
总结
该论文揭示,一种流行的 AI 训练方法(GRPO)一直以来都在隐式地充当步骤评分器。然而,它存在一个缺陷,即在面对不平衡的群体时会感到困惑。作者通过一个简单的数学调整(-GRPO)修复了这个缺陷,使 AI 能够更快、更好地学习推理任务,而无需任何额外的昂贵工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。