Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
本文提出了 ProGRPO,这是一种新颖的强化学习方法,它采用了一种优势重加权机制(Advantage Re-weighting Mechanism),通过动态重塑奖励信号以平衡不同正确解法之间的置信度,从而缓解模式崩溃并增强大语言模型在推理中的探索能力,进而显著提升了在数学和编程基准测试上的准确性与生成多样性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大背景:那个“过度自信”的学生
想象一下,你正在训练一名天才学生(AI)来解决复杂的数学问题或编写代码。你使用一种叫做**带有可验证奖励的强化学习(RLVR)*的系统。你可以把它想象成一位严厉的老师,只有当学生给出完全正确*的答案时,才会给予一颗金星。
问题所在:
目前的方法(称为 GRPO)就像一位只表扬学生最自信猜测的老师。
- 如果学生说:“答案是 42”,并且他们有 99% 的把握,他们会得到一颗金星。
- 如果学生说:“答案是 42”,但他们只有 60% 的把握,他们什么也得不到。
随着时间的推移,学生学会了只用最大的信心去说“42”。他们不再尝试其他解决问题的方法。如果“42”是错的,这个学生就没有备选方案。在 AI 术语中,这被称为熵崩溃(entropy collapse)或模式崩溃(mode collapse)。AI 变成了一个无聊的机器人,只会重复同样的几个答案,即使这些答案是错误的,或者即使存在许多其他有效的解题方法。
解决方案:ProGRPO(一位“公平”的老师)
作者提出了一种名为 ProGRPO 的新方法。这位新老师不再仅仅奖励声音最大的那个人,而是观察学生思考的全貌。
他们引入了一种名为**优势重加权(Advantage Re-weighting, ARM)**的机制。以下是使用简单类比进行的解释:
1. “信心检查”
想象学生正在解一个谜题。
- 场景 A: 学生看到一个非常简单的谜题,并立即以 100% 的信心大声喊出答案。
- 场景 B: 学生看到一个很难的谜题,思考了很久,得出了正确的答案,但他们对此有点紧张(信心较低)。
旧的老师(GRPO)会大力奖励场景 A,而忽略场景 B。
新的老师(ProGRPO)则说:“等等,场景 B 实际上更令人印象深刻,因为它很难!即使这个学生不是 100% 确定,我们也应该因为他们的努力给他们一点额外的加分。”
这防止了学生仅仅固守那些“简单、自信”的答案,并鼓励他们探索不同的、有效的解题路径。
2. 忽略“无聊”的部分
当学生写下一长段解释(“思维链”)时,大部分词汇都是显而易见的。
- 例子: “首先,我把 2 加 2。然后,我乘以 2……”
- “首先”、“然后”和“乘以”这些词很无聊;学生对它们了如指掌。
论文指出,统计这些无聊的、高置信度的词汇会稀释奖励。这就像是在批改试卷时,竟然因为学生正确写出了“的”这个字而给分一样。
ProGRPO 使用了低概率 Token 长度归一化(Low-Probability Token Length Normalization)。它忽略了答案中那些无聊、容易的部分,只关注那些学生真正需要思考并做出选择的难点部分。这能提供一个关于推理过程好坏的更清晰信号。
结果:更多多样性,同样的准确度
作者在 Qwen 和 DeepSeek 等模型上,针对数学和编程任务测试了这种新方法。
- 旧方法 (GRPO): AI 在第一次尝试时正确率为 37.6%。但如果你让它尝试 32 次,它大多只是重复同样的 3 到 4 个答案。
- 新方法 (ProGRPO):
- 准确度: 它在第一次尝试时的正确率为 43.3%(大幅提升)。
- 多样性: 当被要求尝试 32 次时,它能找到正确的答案,成功率达 68.5%。至关重要的是,这些答案彼此之间是不同的。
隐喻:
如果说旧的 AI 是一位因为觉得那是稳妥之选而只做一种类型意面的厨师,那么新的 AI 则是一位既能做意面,也能做烩饭和汤,且每样都美味可口的厨师。它不仅仅是运气好,它学会了更有效地探索厨房。
结论摘要
论文声称,通过调整 AI 计算“信心”的方式,并忽略其自身思考中的无聊部分,ProGRPO 实现了以下目标:
- 阻止 AI 陷入循环,即重复同样的几个答案。
- 提高准确度,特别是在困难的数学和编程问题上。
- 生成更广泛的多样化正确解法(这对于可能存在多种正确路径的复杂任务至关重要)。
作者总结道,这在探索(尝试新事物)与利用(使用已知有效的方法)之间取得了更好的平衡,使 AI 的推理更加稳健且可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。