← 最新论文
📊 statistics

Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

本文指出,标准的可验证奖励强化学习(RLVR)目标因对正确解之间的概率质量分布漠不关心而导致多样性崩溃,并提出了均匀正确策略优化(UCPO)以在有效输出上强制实现均匀性,从而在保持单次尝试准确性的同时显著提升了多采样的多样性与覆盖率。

原作者: Anamika Lochab, Bolian Li, Ruqi Zhang

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Anamika Lochab, Bolian Li, Ruqi Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《Uniform-Correct Policy Optimization》(统一正确策略优化)的解释。

核心问题:“一刀切”的陷阱

想象你正在训练一位天才学生解决数学题。你告诉他:“你的目标是得出正确答案。”

在人工智能领域,这被称为RLVR(可验证奖励强化学习)。AI 尝试解决问题,如果答案正确,它就会获得一枚“金星星”。

问题所在:
论文指出,标准的训练方法(如 GRPO)过于专注于“获得”金星星,而不在乎学生是“如何”获得它的。

想象一道数学题有三种不同的有效解法(方法 A、方法 B 和方法 C)。

  • 旧方法(GRPO): AI 尝试了所有三种方法。纯粹靠运气,它用方法 A 解出了一道题。它得到了一枚金星星。因为得到了星星,AI 心想:“方法 A 是最好的!下次我就用这个。”于是它不再尝试方法 B 和 C。
  • 结果: AI 成为了方法 A 的大师。只要它尝试一次,几乎总能得到正确答案(Pass@1)。但如果你让它尝试 64 次,看看它能否找到任何解法,它就会失败。为什么?因为它已经忘记了方法 B 和 C。它坍缩成了一种单一、狭隘的习惯。

论文将这种现象称为**“多样性坍缩”**。AI 变成了一只会一种把戏的猴子。

诊断:为什么会发生这种情况?

作者发现了导致这种情况发生的两个主要原因:

  1. 目标过于模糊: 训练规则只说“最大化正确答案的数量”。它没有说“最大化正确答案的数量,同时尝试使用所有可能的方法”。因此,AI 对此漠不关心。它不知道它本应该保持多样性。
  2. “富者愈富”的循环:
    • 想象 AI 仅仅因为偶然,就稍微更倾向于选择方法 A。
    • 因为它更频繁地选择方法 A,它也就更多地练习该方法。
    • 训练更新使得方法 A 变得更强。
    • 现在它选择方法 A 的频率更高了。
    • 最终,方法 B 和 C 再也未被选中,AI 再也没有机会重新学习它们。它们逐渐消亡。

解决方案:“统一正确”策略

作者问道:“当存在多个正确答案时,AI 的完美行为方式是什么?”

他们得出的结论是,AI 应当是**统一正确(Uniform-Correct)**的。

  • 统一(Uniform): 它应当同等对待每一个有效解法(方法 A、B 和 C)。它应当给予它们均等的机会(各占 33%)。
  • 正确(Correct): 它不应在错误的答案上浪费时间。

这就像一位厨师知道三种制作完美煎蛋卷的不同方法。“统一正确”的厨师不会只坚持他最先做的那种;他会均衡地轮换使用这三种方法,这样他就永远不会忘记如何制作其他两种。

新工具:UCPO

为了打破“一刀切”的陷阱,作者创造了一种新的训练方法,称为UCPO(统一正确策略优化)。

它是如何工作的(类比):
想象 AI 是一位正在给全班学生(即不同的解法)打分的老师。

  • 旧方法(GRPO): 老师只表扬第一个举手的学生。其他学生保持沉默,最终不再举手。
  • 新方法(UCPO): 老师观察全班。如果学生 A 举手很多次,老师会说:“干得好,但让我们给那些还没怎么举手的学生 B 和学生 C 一个特别奖励。”

UCPO 在训练中增加了一种“惩罚”。如果 AI 开始过度偏爱某一种解法,训练机制就会予以回击,并说:“不,你需要更均匀地将注意力分散到所有正确答案上。”

结果:发生了什么?

该团队在三个不同规模的 AI 模型(从小型到大型)上,使用高难度的数学基准测试(如 AIME 数学竞赛)对此进行了测试。

  1. 准确率保持高位: AI 在第一次尝试就得出正确答案的能力(Pass@1)与旧方法一样出色。
  2. 多样性飙升: 当他们要求 AI 生成 64 次不同的尝试时,它找到了多得多的独特且正确的解法。
    • 在最难的测试(AIME24)中,新方法将 AI 在 64 次尝试中找到任何正确答案的能力提高了10%
    • 答案中所使用的数学方程的多样性增加了45%

总结

该论文表明,标准的 AI 训练会使模型变得过于僵化——它们找到一种正确的方式就固守不放,忘记了所有其他有效的途径。新方法UCPO迫使 AI 保持所有选项的开放性,将每一条正确的路径视为同等有价值。这使得 AI 更加稳健且富有创造力,同时又不牺牲其准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →