← 最新论文
💬 NLP

Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients

本文介绍了仅正策略优化(POPO),这是一种新颖的强化学习价值回归框架,它通过利用有界重要性采样和隐式负梯度来消除对负向轨迹的需求,从而在数学推理性能上优于 GRPO。

原作者: Mingwei Xu, Hao Fang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingwei Xu, Hao Fang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决高难度的数学问题。通常,当我们使用强化学习来训练机器人(或人工智能)时,会采用一种“红脸白脸”的策略。

  • 白脸(好警察): 当机器人答对时,我们给它奖励(一种奖赏)。
  • 红脸(坏警察): 当机器人答错时,我们斥责它(一种惩罚)。

目前流行的方法(称为 GRPO)严重依赖“坏警察”。它会生成许多答案,保留正确的答案,并主动惩罚错误的答案,以此教导机器人不要做什么。

问题所在:
本文作者发现了这种“坏警察”策略的一个缺陷。在数学中,得出错误答案的方式有无数种。你可以犯一个微小的计算错误、一个逻辑错误,或者完全胡乱猜测。由于失败的方式如此之多,仅仅随机惩罚几个错误答案,就像试图通过向干草堆扔飞镖来寻找一根特定的针。你可能会错过机器人失败的真实原因。

解决方案:POPO(仅正向策略优化)
作者提出了一种名为 POPO 的新方法。他们决定只使用“好警察”,而不是用“坏警察”来斥责机器人。他们完全忽略错误的答案,100% 专注于强化正确的答案。

以下是他们如何让这种“仅正向”的方法在不让机器人感到困惑或陷入停滞的情况下发挥作用:

1. “自我竞争”技巧(隐式负梯度)

你可能会问:“如果你从不告诉机器人哪里错了,它如何停止犯错?”

作者解释说,机器人只需被强迫去选择最佳的正确答案,就能学会不要做什么。

  • 类比: 想象一个教室,老师只表扬答对的学生。老师不对答错的学生大喊大叫。然而,由于老师只给正确的答案发放有限数量的“表扬代币”,“错误”答案的概率自然会缩小。
  • 工作原理: 在数学中,所有可能答案的总概率必须加起来等于 100%。如果你提高了正确答案的概率,错误答案的概率就会自动下降。论文从数学上证明,这种“强化好的”做法会为“坏的”创造一种无形的“惩罚”,即使没有明确地斥责它们。

2. “移动目标”锚点(孪生网络)

当你只强化正确答案时,机器人可能会变得过于自信,开始反复重复同样的几个答案(这被称为“模式崩溃”)。它会停止探索解决问题的新方法。

  • 类比: 想象机器人是一个舞者。如果它只看自己,可能会陷入循环。为了解决这个问题,作者给机器人配备了一个“影子伙伴”(一个孪生网络)。
  • 工作原理: 这个影子伙伴是机器人稍早、移动较慢的版本。机器人试图紧跟它的影子伙伴,但影子伙伴移动得非常缓慢(使用一种称为指数移动平均的技术)。这既能防止机器人跑偏太远,又能让它继续学习和进步。

3. “相似度”安全网

通常,AI 训练会使用一个名为"KL 散度”的严格规则,以防止机器人改变过大。作者发现这个规则过于僵化。

  • 类比: 与其强迫机器人遵循一张严格的地图,他们使用了一种“相似度”检查。他们观察机器人“大脑”内部的想法(表示)。只要机器人的新想法与影子伙伴的想法“相似”,就允许它改变。这是一种更柔和、更灵活的方式,能在不扼杀其创造力的情况下保持机器人的稳定性。

他们发现了什么?

作者使用不同的 AI 模型(如 Qwen)在几个著名的数学基准测试(如 AIME 和奥林匹克竞赛问题)上测试了这种新方法(POPO)。

  • 结果: POPO 的表现与目前使用好坏示例的最佳方法(如 GRPO)一样好,甚至更好。
  • 亮点: 在一个名为 AIME 2025 的极难测试中,POPO 方法取得了 36.67% 的分数,击败了标准方法的 30.00%

总结

这篇论文认为,在数学推理的世界里,你不需要因为每一个错误而不断斥责学生。如果你专注于强化正确的步骤,并利用巧妙的数学技巧确保“错误”的步骤自然消退,那么学生(或 AI)就能学得更快、更有效。他们称这种方法为仅正向策略优化

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →