← 最新论文
💬 NLP

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

本文指出,标准的以正确性为导向的验证器强化学习(RLVR)会导致冗余代码生成,并提出了一种基于 JPlag 去重奖励的冗余感知 RLVR 方法,该方法通过维持多样化的候选解,显著提升了有限预算下的代码生成性能。

原作者: Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一支程序员团队来解决一个单一且棘手的编程谜题。你的预算有限:你只能要求10 个解决方案(这就是你的“采样预算”)。你的目标很简单:你只需要这 10 个解决方案中的一个能完美运行即可。

在人工智能领域,这被称为Pass@k(k 次尝试中的通过率)。如果你让 AI 编写代码 10 次,且这 10 次尝试中至少有一次成功,你就赢了。

问题所在:“模仿者”团队

这篇论文揭示了当前 AI 模型在赢得这场游戏时的训练方式中存在一个隐藏缺陷。

当研究人员训练 AI 以提高其编程能力时,通常只奖励它得出正确答案。AI 很快学会了一个捷径:“如果我写出完全相同的正确代码 10 次,我每次都能获得奖励。”

于是,AI 变成了一个模仿者。它不再尝试用 10 种不同的方法解决问题(比如使用锤子、螺丝刀或扳手),而是选择一种成功的方法,然后将其复制 10 次。

  • 结果: 如果那一种方法存在微小的错误,所有 10 份副本都会失败。你将预算浪费在了重复品上。
  • 论文的工具: 为了识别这种情况,作者使用了一种名为JPlag的工具。可以将 JPlag 想象成代码的“抄袭检测器”。它不在乎你是否改变了文本颜色或重命名了变量;它关注的是代码的结构。如果两个程序的构建方式相同,JPlag 就会判定:“这些是近乎重复的副本。”

解决方案:“反冗余”教练

作者提出了一个简单的问题:如果我们训练 AI 不仅要正确,还要与其之前的尝试*不同,会怎样?*

他们引入了一种新的训练方法,称为Redundancy-Aware RLVR(感知冗余的强化学习验证)。

  • 类比: 想象一位教练告诉一支由 10 名跑步者组成的团队:“你们都需要完成比赛。但规则是:如果你们两人跑完全相同的路线,你们两人都将受到处罚。你们必须找到通往终点的独特路线。”
  • 工作原理: AI 仍然会因为写出正确的代码而获得奖励。但现在,如果它生成的代码片段与它刚刚写出的另一段代码过于相似,它也会受到“处罚”(或获得负奖励)。

结果:更好的团队协作

当他们用这种新的“反冗余教练”与旧的“模仿者教练”进行对比测试时,结果显而易见:

  1. 减少浪费: 新的 AI 不再重复发送相同的解决方案。它生成了种类繁多的正确代码。
  2. 更高的成功率: 因为团队正在尝试不同的方法,所以在 10 次尝试的有限预算内找到可行解决方案的可能性大大增加。
  3. 超越专家: 这种“不要复制自己”的简单技巧,效果与研究人员此前专门为解决此特定问题而设计的复杂、专用方法一样好,甚至更好。

核心启示

这篇论文认为,当我们要求 AI 多次尝试解决问题时,我们不应只关心它多久能给出正确答案。我们还需要关心它尝试了多少种不同的方式来达到目标。

通过教导 AI 避免成为模仿者,我们使其有限的尝试变得更有价值。这就像让朋友猜 10 次密码,如果他们都猜"123456",与让他们猜 10 个完全不同的数字相比,后一种方法成功的可能性要大得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →