← 最新论文
💬 NLP

On Advantage Estimates for Max@K Policy Gradients

本文介绍了 MaxPO,一种用于在具有可验证奖励的强化学习中优化 max@K 目标的全新策略梯度方法,该方法利用一种新颖的留一减二(Leave-Two-Out)基线来确保优势函数的中心化、降低梯度方差,并统一现有估计量,从而实现更有效的 LLM 后训练。

原作者: Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在试图训练一名学生解决极其困难数学题的老师。这个学生是一个人工智能(AI),而这个问题是一个“推理任务”。

在过去训练这些 AI 的方式中(强化学习),老师会要求学生尝试解决问题一次。如果答案错了,学生得不到任何反馈(奖励为零);如果对了,他们会得到一颗小星星。问题在于,学生必须在巨大的可能性迷宫中猜中正确的路径,而获得小星星的机会非常渺茫,这导致学生经常陷入困境,不知道哪些猜测是“接近正确”的,哪些是“完全错误”的。

为了解决这个问题,研究人员开始了一种新的策略:“多次尝试”法。

老师不再要求学生只解决一次问题,而是要求他们在同一时间生成 K 个不同的解法。目标不仅仅是得到 一个 正确答案,而是要确保这 K 次尝试中至少有一个是正确的。这被称为优化 Max@K(或 Pass@K)。

旧有“多次尝试”法的问题

论文指出,虽然这种“多次尝试”的方法很棒,但用于教导 AI 如何改进的数学方法存在轻微的缺陷。

想象一下,你有一组 8 名学生(一个“批次”)正在尝试解决一个谜题。你想告诉每位学生他们表现得如何。

  • 旧方法 (EI-only): 它观察一个学生的答案,并将其与另外 7 名学生中的最佳答案进行比较。如果这个学生表现得比其他人好,他就会得到一个巨大的“做得好!”信号。如果表现得比其他人差,他就会得到一个“0”信号。
  • 缺陷: 因为这个“做得好!”的信号始终是正向的(或为零),从未是负向的,所以老师实际上是在说:“你总是做得比平均水平更好!”这具有误导性。这就像一位教练,他只会说“太棒了!”而从不指出某个选手实际上低于团队的真实潜力。这创造了大量的“噪声”(方差),使得 AI 的学习过程变得不稳定且缓慢。

解决方案:“留一去二”基准线 (Leave-Two-Out Baseline)

论文作者提出了一种更聪明的评分方式,称之为 MaxPO (Max@K 策略优化)。

他们引入了一种新的评分规则,称为 “留一去二” (Leave-Two-Out, L2O) 基准线。它是这样运作的,让我们用一个简单的类比来说明:

想象你正在评判一场拥有 8 名选手的才艺表演。

  1. 旧方法: 为了评判选手 A,你将他与另外 7 人中的佼佼者进行比较。如果 A 是最优秀的,他会得到高分。如果不是,他会得到零分。这是有偏见的,因为“另外 7 人中的最佳”是一个随着房间里的人员变化而变化的移动目标。
  2. 新方法 (L2O): 为了评判选手 A,你暂时将选手 A 选手 B 从房间里移走。然后,你观察剩下的 6 个人,看看什么样的表现才是“公平”的平均水平。
    • 你计算选手 A 相对于这个“公平”群体表现如何。
    • 至关重要的是,通过移除两个人,你确保了“公平”的群体不会意外地包含你正在评判的对象(选手 A)或可能扭曲比较结果的特定“对手”(选手 B)。

为什么这更好?
这种方法确保了整个群体的“平均”得分正好为零。一些学生会得到正分(他们表现得比公平的平均水平好),而另一些人会得到负分(他们表现得比平均水平差)。

  • 结果: AI 得到了一个更加清晰、噪声更小的信号。它确切地知道自己相对于一个公平的基准线处于什么位置,而不是仅仅被告知“你很棒”或“你不行”。

这篇论文的发现

研究人员通过两种方式测试了这种新的“留一去二”方法:

  1. 在简单游戏(多臂老虎机和迷宫)中: 他们展示了这种新方法在极大程度上降低了学习信号中的“噪声”(在某些情况下减少了高达 77% 的噪声)。这意味着 AI 的学习更加稳定,不会被随机波动所迷惑。
  2. 在真实的 AI 模型(大语言模型)中: 他们在大型语言模型(如 Llama 和 Qwen)尝试解决数学问题时测试了该方法。
    • 结果: 使用这种新方法训练的 AI (MaxPO) 在允许尝试多次(例如 Pass@256)时,解决问题的成功率显著提高。
    • 在 Qwen 模型上,成功率提升了 5.2%
    • 在 Llama 模型上,成功率提升了 2.4%

大局观

把旧方法想象成一位过度乐观的教练,即使学生在挣扎,他也会给每个人发“做得好”贴纸。而新方法 (MaxPO) 则是一位使用严格、公平且平衡的评分系统的教练。通过消除“噪声”并确保得分以零为中心,AI 可以学习得更快、更有效,尤其是当目标是寻找多次尝试中的至少一个正确答案时。

论文得出结论,这种“留一去二”的方法是训练这类“多次尝试”任务的在数学上正确的做法,为未来的改进提供了一个统一且稳定的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →