Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
本文提出了锐度引导的 GRPO(GRPO-SG),这是一种基于组相对策略优化的令牌加权变体,通过降低导致大梯度的令牌的权重来减少锐度并稳定训练,从而提升可验证奖励强化学习中的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位非常聪明的学生(一个大语言模型)如何解决难题,比如数学问题或逻辑谜题。你并不安排一位老师去批改每一个步骤,而是在最后提供一份“检查清单”。如果最终答案正确,他们就会获得一颗金星(奖励);如果错误,则一无所获。这被称为可验证奖励强化学习(RLVR)。
目前,教导这位学生最流行的方法是一种名为GRPO的技术。将 GRPO 想象成一位教练,他说:“好吧,让我们尝试五种不同的解题方法。那些获得金星的是好的;那些失败的是坏的。让我们调整学生的大脑,使其更像获胜者,而少像失败者。”
问题:“过度兴奋”的学生
该论文指出,虽然 GRPO 效果良好,但有时可能过于激进。想象一下学生正在学习。当他们在某个特定单词或步骤上犯错时,教练可能会非常大声地吼叫以纠正他们。用数学术语来说,这会产生一个“尖锐”的更新——对学生大脑造成巨大且突兀的改变。
虽然这可能会纠正眼前的错误,但会导致学生不稳定。他们可能会忘记如何解答过去曾掌握的类似题目,或者对无关紧要的细枝末节反应过度。用论文的语言来说,这被称为高尖锐度(high sharpness),会导致泛化能力(generalization)(即处理新、未见问题的能力的)变差。
解决方案:“置信度计”(GRPO-SG)
作者提出了一种名为GRPO-SG(尖锐度引导的 GRPO)的新方法。
这里有一个简单的类比:
想象学生正在写一个故事。
- 高置信度单词:这些是学生 100% 确定的单词,比如“的”或“和”,或者是关键的数学符号如"+"或"="。学生知道这些对于句子通顺至关重要。
- 低置信度单词:这些是学生猜测的单词,比如一个华丽的形容词或一个他们不确定的具体数字。
在旧方法(GRPO)中,如果学生猜错了一个低置信度单词,教练会大喊:“不!改变你的整个大脑!”这会导致巨大的、尖锐的更新,可能会破坏其他方面。
GRPO-SG 则像一位明智的教练,在吼叫之前会先查看学生的“置信度计”。
- 如果学生不确定(低置信度)并犯了错,教练会低声说:“好吧,下次让我们更小心一点”,但不会做出巨大的改变。这防止了学生惊慌失措和过度纠正。
- 如果学生确定(高置信度)并且答对了,教练会给予强有力的正面推动,以强化这种好习惯。
工作原理(“概率整形”)
该论文使用了一种名为**概率整形(Probability Shaping)**的数学技巧。
- 系统检查模型对其刚刚选择的单词的置信度(基于"logit",即该单词可能性的分数)。
- 如果分数低(模型在猜测),系统会降低该教训的权重。它表示:“不要让这一个错误动摇你的整个基础。”
- 如果分数高(模型很自信),系统会提高该教训的权重。它表示:“这是一个稳健的举动;让我们确保继续保持。”
结果:更平稳的旅程
该论文在三种类型的挑战上测试了这种新方法:
- 数学:解决奥林匹克级别的数学问题。
- 逻辑:解决“骑士与无赖”谜题(其中有些人总是撒谎,有些人总是说真话)。
- 工具使用:要求 AI 使用搜索引擎查找答案。
发生了什么?
- 更高的分数:在所有这些测试中,新方法(GRPO-SG)的得分始终高于旧方法(GRPO)。例如,在逻辑谜题上,成功率显著提升。
- 更平稳的学习:如果你观察“梯度范数”(衡量学生大脑变化剧烈程度的指标),新方法要平稳得多。它没有那些过度纠正的剧烈尖峰。这是一段通往顶峰的平稳、冷静的旅程。
总结
该论文声称,通过简单地告诉 AI忽略低置信度猜测的“恐慌”,并专注于强化高置信度的举动,我们可以训练出更智能、更稳定且泛化能力更强的推理模型。这就像教导学生信任自己对已知事物的直觉,而不要对仍在猜测的事物大惊小怪。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。