← 最新论文
🤖 machine learning

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

该论文介绍了 SoftmaxGRPO,这是一种通过使用温度缩放的 Softmax 优势函数取代 z-score 归一化,以防止在简单提示词上出现发散权重,从而更有效地重新分配梯度预算,并在 DeepMath 和 Poetry 等任务上相比标准 GRPO 显著提升推理性能的强化学习方法。

原作者: Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何解谜。你给它一叠题目,每当它尝试解决一个问题时,它都会得到一个简单的“是”或“否”的评分。如果它做对了,它会得到一个击掌;如果它做错了,它会得到一声温柔的“再试一次”。这就是**强化学习(Reinforcement Learning)**的世界,即人工智能通过试错来学习。但棘手的部分在于:你如何告诉机器人,哪些特定的尝试是最值得学习的?

过去,研究人员使用一种叫做 GRPO(组相对策略优化)的方法。把 GRPO 想象成一位观察十个学生答案的老师。如果九个学生答对了,一个答错了,老师会重点关注那个失败的学生。但如果十个学生都答对了(一个“简单”的问题),老师就会感到困惑。因为 GRPO 使用的数学方法试图寻找“平均”差异,它会不小心对着那些学生已经掌握的问题大声尖叫,而对难题却只是低声细语。这就像一名教练对着一名明星球员投丢了一个简单的上篮大声责骂,却忽略了一个连运球都做不好的新手。这浪费了机器人的脑力去处理它已经知道的事情,导致它在真正需要学习新知识时陷入停滞。

这篇论文介绍了一种名为 SoftmaxGRPO 的新方法。与其使用那种令人困惑的“平均值”数学,作者建议使用一种“温度缩放的 Softmax”方法。想象一张热力图,机器人的注意力会被自然地吸引到最有趣的部分。如果一个问题很简单且机器人做对了,该方法会说:“做得好,但我们不需要过度研究这个。”如果一个问题很难且机器人挣扎着解决,该方法会说:“这才是我们需要关注的!”它就像一个智能过滤器,能自动将机器人的注意力从简单问题转向真正可以学习的问题。研究人员在数学问题、创意写作和会议总结任务上测试了这种方法,发现即使在“评分”只是粗略估计而非完美分数的情况下,这种新方法也能让机器人学习得更快、更好。


问题所在:对着明星尖叫的老师

让我们深入了解一下 AI 及其老师的故事。在 AI 的世界中,我们经常使用一种叫做**基于组的强化学习(Group-Based Reinforcement Learning)**的技术。想象一下,你要求 AI 解决一个数学问题。你不仅让它尝试一次,还让它尝试十种不同的方式(这些被称为“展开/rollouts”)。然后,你将这十个答案放在一起观察。

旧的方法 GRPO 运作起来就像一位计算小组“平均”表现的老师。如果 AI 解出了一个问题,GRPO 会给予奖励。如果它做错了,则给予较低的奖励。问题出现在简单问题上。如果 AI 已经非常擅长某种特定类型的数学题,它几乎会在十次尝试中全部答对。在旧的 GRPO 数学逻辑下,这会产生一个奇怪的情况:由于“平均值”非常高,完美答案与“接近完美”答案之间的微小差异会被放大。数学逻辑最终会对着 AI 大声尖叫,要求它改变在已掌握问题上的行为。这就像教练对着一名职业篮球运动员因为差之毫厘的罚球失误而大声责骂,却忽略了一个连球都拿不稳的新手。AI 浪费了精力去“修复”那些并没有坏掉的东西,从而导致没有精力去学习难点。

解决方案:更智能的热力图

来自莱斯大学(Rice University)的论文作者提出了一个名为 SoftmaxGRPO 的修正方案。他们意识到,与其使用“z-score”(衡量一个数值偏离平均值多少),不如使用 softmax 函数。

把 softmax 想象成一张用于注意力的“热力图”。它通过一个涉及“温度”设置(称为 τ\tau)的特殊公式,将奖励(评分)转化为权重。

  • 高温度: 热力图是平坦的。每一次尝试获得的关注度大致相同。这就像旧的 REINFORCE 方法,AI 学习缓慢且具有随机性。
  • 低温度: 热力图变得非常尖锐。AI 会高度集中注意力于最好的尝试并忽略其他尝试。这就像 MaxRL 方法,它擅长寻找单一最佳答案,但可能不够稳定。

SoftmaxGRP0 处于两者之间。它使用温度设置来创造一条平滑的曲线。如果 AI 做对了一个简单问题,热力图保持凉爽,告诉 AI:“做得好,继续前进。”如果 AI 在难题上失败了,热力图会保持温暖,告诉 AI:“这很重要,好好研究!”

神奇之处在于,这种方法保持了权重的有界性。无论问题多么简单,其“尖叫声”永远不会变成无穷大。它防止了 AI 在已掌握的问题上浪费脑力。

研究发现:事实胜于雄辩

作者不仅是凭直觉猜测,他们还进行了数学推导并运行了测试。

1. 数学逻辑是严密的(针对二元奖励)
对于只有“对”或“错”两种结果的问题(二元奖励),他们证明了 SoftmaxGRPO 创建了一个完美的、平滑的目标函数。他们展示了随着温度降低,该方法会自然转化为 MaxRL(一种专注于最佳结果的方法);而当组规模变得极大时,它的表现趋向于 最大似然估计(Maximum Likelihood)(学习领域的金标准)。至关重要的是,他们证明了与 GRPO 不同,SoftmaxGRPO 在面对简单问题时永远不会崩溃。

2. 魔法的局限性
他们也发现了局限。如果奖励不仅仅是“对/错”,而是有多个等级(例如 1 到 100 分之间的多个阶梯),数学逻辑就会变得复杂。他们表明,对于拥有三个或更多奖励等级的组,并不总能找到一个适用于所有组规模的单一、完美的“标量目标”(简单的公式)。这意味着该方法在理论上对于简单的“对/错”场景最为完美,但在实践中处理更复杂的评分时依然表现良好。

3. 现实世界的成果
他们在 15 亿参数规模的模型(中型 AI)上进行了多项任务测试:

  • 数学 (GSM8K, Countdown, DeepMath): 当使用完美的“验证器”奖励(由计算机精确检查答案)时,Soft%,在 DeepMath 上达到了 51.8% 的准确率,超过了旧的 GRPO 方法。在 Countdown 任务上,它达到了 58.1%
  • 创意写作 (诗歌): 这是最有趣的地方。对于诗歌,没有“正确答案”。你只能使用“相似度得分”(即诗歌看起来有多像优秀的范例)。这些是“弱”且带有噪声的奖励。旧的 GRPO 在这里表现挣扎。然而,SoftmaxGRPO 将一个起始水平为 35.0% 的模型提升到了 68.0%。这是一个巨大的飞跃,证明了即使在“老师”并不完美的情况下,该方法依然有效。
  • 摘要生成 (MeetingBank): 它将摘要得分从 35% 提升到了 70%

4. 注意力流向何处
最显着的证据来自于观察 AI 将其“梯度预算”(学习能量)花在了哪里。

  • 旧 GRPO:36.4% 的能量消耗在了“接近解决”的提示词上(即 AI 已经有 90% 以上概率做对的问题)。它在简单问题上浪费了时间。
  • SoftmaxGRPO: 在这些简单提示词上仅消耗了 10.0% 的能量。它将这些能量转移到了 AI 感到挣扎的更难的问题上(处于 20% 到 90% 难度区间的问题)。

核心启示

论文指出,通过简单地将计算“重要性”的方式从标准的平均值切换为温度缩放的 Softmax,我们可以修复 AI 学习中的一个重大缺陷。它阻止了 AI 执着于它已经知道的事情,并迫使它专注于那些能真正让它变得更聪明的挑战。

虽然该方法的数学逻辑在简单的“对/错”奖励下最为严密,但实验表明,即使在处理诗歌创作或会议总结这类模糊、弱相关的奖励时,它依然效果显著。它是一种“即插即用”的替代方案,意味着只需对代码进行微小的改动,就能显著提升 AI 的推理学习能力。作者总结道,这是一种鲁棒的方法,能够重新分配学习信号,确保 AI 将时间花在真正重要的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →