← 最新论文
💻 computer science

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolver 是一个以解决方案为中心的演化框架,它通过演化参考解法,自动将现有的编程问题转化为更难且可验证的变体,从而创建出像 LiveCodeBench-Plus 这样能够恢复模型判别力并为自我提升提供有效训练信号的高质量基准测试。

原作者: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一款电子游戏:玩家(AI 模型)已经变得极其强大,以至于他们能以 100% 的准确率通关每一个关卡。游戏设计师(人类研究员)陷入了困境,因为他们无法创造出足够快的新关卡来挑战这些“超级玩家”。旧的关卡太简单了,游戏也失去了乐趣。

这篇论文介绍了 BenchEvolver,它是一个全新的工具,充当了这些 AI 游戏的“升级引擎”。BenchEvolver 并不需要人类从头开始发明新的难题,而是通过将一个现有的、简单的题目进行自动变异,将其转化为一个难度更高、同时又能确保依然公平且可解的任务。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“简单模式”陷阱

目前,AI 模型非常先进,几乎可以解决所有的编程谜题。这就像一个背下了教科书里所有问题的学生。当他们参加考试时,每项得分都是满分。这会导致两个问题:

  • 我们无法判断哪个 AI 真正更聪明,因为它们都拿到了完美的分数。
  • AI 停止了学习,因为它从未遇到过自己无法解决的挑战。

2. 解决方案:先进化“答案解析”

以往尝试创建新问题的做法通常是:“让我们写一个关于数学题的新故事,然后希望 AI 能解开它。”这往往会导致逻辑破碎的谜题或定义模糊的问题。

BenchEvolver 颠覆了这个逻辑。 它不是从故事(问题本身)开始,而是从答案解析(解决方案代码)开始。

  • 比喻: 想象一位大师级厨师(AI)知道如何烤出一个完美的巧克力蛋糕(解决方案)。
  • 变异: BenchEvolver 告诉这位厨师:“好,现在请烤一个蛋糕,但你必须使用一种会改变化学性质的秘密配料,而且不能使用同样的烤箱设置。”
  • 结果: 厨师写出了一个新的、复杂的食谱(进化的解决方案)。
  • 逆向步骤: 一旦厨师有了这个新的、复杂的食谱,BenchEvolver 就会反向运作,为顾客编写说明书(问题陈述),并创建一个品鉴测试(测试用例),以验证蛋糕是否符合要求。

因为问题是围绕着一个正在运行的、复杂的解决方案构建出来的,所以我们确信这个谜题是可解的,并且有一个明确的答案。

3. “自我挑战”循环

最酷的部分在于,BenchEvolver 不需要一个“超级聪明的老师”来制造难题。它利用 AI 本身来测试新关卡。

  • AI 尝试解决这个变异后的新问题。
  • 如果 AI 解对了,说明关卡太简单了。BenchEvolver 会说:“再试一次,把它变得更难!”
  • 如果 AI 解错了,但谜题本身依然有效,那么成功了! 我们找到了一个能暴露 AI 弱点的关卡。

这形成了一个循环:AI 生成挑战,尝试解决挑战,在失败中学习,然后生成一个更难的挑战。这就像一个陪练,你每打一次,它就会变得更强。

4. 结果:一个新的“困难模式”联赛

研究人员在两个大型编程题库上测试了该方法:

  1. LiveCodeBench:竞争性编程谜题(类似于 Codeforces)。
  2. SciCode:科学研究相关的编程谜题。

发生了什么?

  • 难度飙升: 他们拿到了 AI 模型原本正确率在 90–99% 的题目。经过进化后,同样的模型正确率下降到了 27–62%。他们成功地将“简单模式”转换成了“困难模式”。
  • 新基准: 他们创建了 LIVECODEBENCH-PLUS,这是一个包含 91 个超难问题的集合。这个新的测试集终于可以再次区分顶尖的 AI 模型了。
  • 训练能力: 当他们使用这些新的、困难的问题来训练 AI(使用一种称为强化学习的方法)时,AI 在解决其他从未见过的难题时表现得显著更好。

总结

把 BenchEvolver 看作是 AI 的健身房。与其等待人类去制造新的、沉重的杠铃,不如让 AI 举起现有的杠铃,给它们增加更多配重片,然后尝试举起那个更重的版本。如果它举不起来,它就会学习如何变得更强。

这篇论文证明了,通过先进化“解决方案”再反向构建“问题”,我们可以自动创造出源源不断的、高质量且具有挑战性的任务,从而保持 AI 的敏锐度,并让我们能够衡量它们的真实进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →