← 最新论文
💻 computer science

SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark

本文提出了 SWE-ABS 对抗性基准强化框架,通过覆盖驱动增强和变异驱动测试揭示 SWE-Bench Verified 中因测试套件薄弱导致的性能虚高问题,成功将顶尖代理的得分从 78.80% 修正至 62.20% 并引发排行榜剧烈洗牌。

原作者: Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shing-Chi Cheung, Pinjia He, Lionel Briand

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shing-Chi Cheung, Pinjia He, Lionel Briand

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲了一个关于**"AI 写代码能力评估”的有趣故事。简单来说,它发现了一个大秘密:目前用来测试 AI 写代码能力的“考试”(基准测试),题目出得太简单了,导致很多 AI 的分数被虚高**了。

为了让你更容易理解,我们可以用**“驾校路考”“防作弊教练”**来打比方。

1. 现状:一场“水”的考试

想象一下,现在有一个著名的**“金牌驾校”**(SWE-Bench),用来测试 AI 司机(代码智能体)能不能修好一辆坏车(解决软件问题)。

  • 原来的考试规则:考官(测试用例)只检查车能不能发动,或者能不能开上某条特定的路
  • 结果:很多 AI 司机得了高分(比如 78.8% 的通过率),大家都觉得它们已经是“老司机”了,甚至觉得考试快“饱和”了,没什么新题可出了。

但是,论文作者发现了一个大问题:
这些 AI 司机虽然能发动,但可能刹车是软的,或者转弯时会撞墙。原来的考官太“仁慈”了,只看了表面,没看深层。

  • 比喻:就像你考驾照,考官只让你直走,没让你过减速带或急转弯。你通过了,但上了高速可能就会出事故。
  • 数据:作者重新检查了排名前 30 的 AI 司机,发现每 5 个被判定为“修好”的案例中,就有 1 个其实是“假修好”(代码逻辑有错,只是没被原来的测试发现)。

2. 解决方案:SWE-ABS(“魔鬼教练”系统)

为了解决这个问题,作者发明了一个叫 SWE-ABS 的系统。你可以把它想象成一个**“魔鬼教练”**,专门负责给原来的考试“加难度”和“设陷阱”。

这个系统分两步走:

第一步:覆盖盲区(“把没开过的路都开一遍”)

  • 原来的问题:原来的考试只考了直路,没考过桥、没考过泥地。
  • SWE-ABS 的做法:它像侦探一样,拿着放大镜看代码,找出那些**“从来没被测试过”**的角落(比如某个函数里的特殊分支)。然后,它自动生成新的题目,强迫 AI 去跑这些路。
  • 比喻:以前只考“直行”,现在加考“倒车入库”和“侧方停车”。

第二步:对抗性攻击(“故意制造假动作”)

  • 原来的问题:有些 AI 很聪明,它知道考官只看“能不能发动”,于是它把发动机修好了,但把刹车拆了。因为考官不查刹车,它就过了。
  • SWE-ABS 的做法:它先故意制造一个“看起来很像对的,但其实是错的”代码(比如刹车是软的)。然后,它问考官:“这个代码能过吗?”如果考官说“能”,说明考官太水了!于是,SWE-ABS 就专门针对这个假动作,设计一个新的测试题,把这种“假修好”的 AI 揪出来。
  • 比喻:就像教练故意在路中间放个假人,看 AI 会不会撞上去。如果 AI 撞了,说明它虽然通过了原来的考试,但实际驾驶能力不行。

3. 结果:排名大洗牌

当作者用这套“魔鬼教练”系统重新测试那些 AI 后,结果非常惊人:

  • 分数暴跌:原本排名第一的 AI,分数从 78.8% 直接掉到了 62.2%
  • 排名大变:那个原本拿第一的 AI,直接掉到了第 5 名!而原本排第 2 的 AI,反而因为更稳健,冲到了第 1 名
  • 真相大白:原来大家以为的“顶尖高手”,其实很多都是“偏科生”或者“投机取巧者”。

4. 核心发现:难不等于好

论文还发现了一个反直觉的现象:

  • 有些考试题目本身很难(比如 SWE-Bench Pro),大家得分都很低。
  • 有些题目看起来简单(SWE-Bench Verified),大家得分都很高。
  • 但是:用 SWE-ABS 去“加难度”后,无论题目原本难不难,都能挖出很多隐藏的错误
  • 结论题目难,不代表题目出得好。 哪怕是很难的题,如果测试设计得不好,依然会漏掉很多错误。

总结

这篇论文就像给 AI 代码界做了一次**“体检”**。它告诉我们:

别光看分数高就高兴,那可能是题目太简单、考官太温柔造成的“虚胖”。我们需要更严厉、更全面的“魔鬼教练”(SWE-ABS),去挖掘那些藏在表面之下的真实能力,这样才能选出真正靠谱的 AI 程序员。

一句话概括:以前的考试让 AI 蒙混过关了,现在作者造了一套“防作弊 + 加难度”的考试系统,把那些只会“刷题”不会“真干”的 AI 给揪出来了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →