← 最新论文
💬 NLP

Scaling Agentic Verifier for Competitive Coding

该论文介绍了 Agentic Verifier,这是一种基于执行的智能体,它通过多轮推理和强化学习主动生成具有判别性的测试输入,通过有效地识别并过滤掉错误的候选解,从而显著提高大语言模型在竞争性编程中的准确性。

原作者: Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenting Zhao, Junyang Lin, Binyuan Hui

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenting Zhao, Junyang Lin, Binyuan Hui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“一发入魂”的猜谜游戏

想象你是一位天才厨师(大语言模型),正试图根据一份食谱描述来复刻一道复杂的菜肴。有时,你第一次尝试就能完美复刻;但通常情况下,你可能会忽略一个细微的细节,比如把盐当成了糖,或者漏掉了一个步骤。

在程序设计竞赛(用代码解决高难度逻辑谜题)的世界里,即使是最聪明的 AI 厨师,也很难在单次尝试中做到 100% 正确。

为了解决这个问题,研究人员通常会让 AI 尝试“烹饪”这道菜 64 次(生成 64 个不同的解决方案),然后从中选出最好的一个。但如果你手头没有“官方标准答案”,你又该如何判断哪一个才是真正好的呢?

旧方法:盲目投掷飞镖

检查这 64 个解决方案的传统方法被称为基于执行的验证(Execution-Based Verification)。你会拿着这 64 个代码食谱,针对一些测试食材(输入数据)进行运行。

  • 缺陷: 旧方法就像是在一面巨大的食材墙上盲目投掷飞镖,试图看看哪些食材能暴露错误。它只是随机挑选食材(例如:“如果数字是 5 呢?”“如果数字是 100 呢?”)。
  • 结果: 大多数随机挑选的食材都太简单了。它们无法捕捉到那些细微的错误。你可能运行了 64 次测试,而那 64 个错误的解决方案看起来依然完美无缺,因为没有任何一个测试足够刁钻,能够揭示它们的错误。这就像是用羽毛去敲击钻石,试图寻找裂纹一样;你需要的是一把铁锤。

新方案:“侦探厨师”(智能体验证器)

论文的作者构建了一个名为智能体验证器(Agentic Verifier)的新工具。不要把它看作是一个随机投掷飞镖的人,而要把它看作是一个超级聪明的侦探或一位严苛的美食评论家

这个侦探不再是瞎猜随机食材,而是会:

  1. 将两个不同的解决方案并排对比观察
  2. 深入思考它们的工作原理。
  3. 主动搜寻那个能让这两个解决方案表现出差异的特定食材

如果方案 A 说“答案是 10”,而方案 B 说“答案是 12”,侦探不会只随便选一个数字。它会追问:“什么样的特定输入能迫使方案 A 崩溃或给出错误答案,同时让方案 B 保持正确?”它会不断地提问和测试,直到找到那个“冒烟的枪口”(关键证据)般的输入。

他们是如何训练这位侦探的

你不能只告诉计算机“要变聪明”,你必须进行训练。作者使用了三个步骤的“训练营”:

  1. 数据合成(练习厨房): 他们创建了数千个虚假的烹is烹饪问题,以及成对的“好”与“坏”的解决方案。
  2. 拒绝微调(淘汰赛): 他们让 AI 尝试寻找那些刁钻的食材。如果 AI 没能找到差异,那么这次尝试就会被扔进垃圾桶。只有成功的尝试才会被保留下来,用来教导 AI 什么是“优秀的侦探工作”。
  3. 智能体强化学习(冠军赛): 他们为 AI 建立了一套奖励机制。如果它找到了一个能暴露两个方案之间差异的输入,它就会得到 1 分;如果失败了,则会受到惩罚。随着时间的推移,AI 学会了如何极其高效地寻找这些“关键证据”输入。

结果:更聪明的测试,更强的胜者

当他们用这个新的“侦探厨师”与旧的“随机投掷飞镖者”进行对比测试时:

  • 效率: 侦探发现错误的速度更快。它不需要运行数百次测试,而是直接找到了正确的测试方法。
  • 准确率: 在处理高难度谜题(如 USACO 或 ICPC 竞赛题目)时,这种新方法将 AI 的成功率提升了 10–15%。在这一领域,这是一个巨大的飞跃。
  • 扩展性: 给予侦探越多的“思考时间”和测试输入,它的表现就越好。它不像旧方法那样会遇到瓶颈。

额外发现:“不完美的裁判”

论文还发现了一个关于竞赛本身的有趣现象。这些竞赛使用的官方测试用例实际上是不完美的

有时,某个解决方案在技术上是“错误”的(它在竞赛未测试到的输入下会失败),但它通过了官方测试并获得了金牌。智能体验证器充当了一个**“真相讲述者”**的角色,它可以通过生成新的、更刁钻的测试来找出这些“伪冠军”。这表明,即使是这些竞赛中的“标准答案”也不一定是完美的,而这个新工具可以帮助找到真正正确的代码。

总结

简而言之,这篇论文的核心观点是:“停止通过随机猜测测试用例来检查 AI 代码。相反,应该训练一个 AI 侦探,让它主动搜寻那些能揭示真相的特定、刁钻的测试。这使得寻找最佳代码的过程变得更快、更准确。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →