← 最新论文
💻 computer science

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

本文对 SWE-bench Lite 和 Verified 排行榜进行了首次全面分析,揭示了利用专有大语言模型(尤其是 Claude 系列)的工业界提交目前在基准测试中占据主导地位,而学术界的贡献依然保持着竞争力。

原作者: Matias Martinez, Xavier Franch

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Matias Martinez, Xavier Franch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,修复计算机代码的世界就像是一场规模宏大、高风险的软件工程师奥林匹克运动会。多年来,研究人员一直试图制造机器人(AI),使其能够自动发现代码中的漏洞并进行修复。为了看看到底谁在领先,他们需要一条标准的赛道。

本论文深入探讨了目前用于这场比赛的两条主要赛道:SWE-Bench LiteSWE-Bench Verified。作者 Matias Martinez 和 Xavier Franch 扮演了体育分析师的角色,通过观察计分板、运动员和他们使用的装备,来观察这个领域究竟发生了什么。

以下是他们的发现,通过简单的形式进行拆解:

1. 赛道(基准测试)

SWE-Bench 想象成一个巨大的健身房,里面充满了从真实世界项目中提取的 2,294 个损坏的软件部件(漏洞)。

  • SWE-Bench Lite: 这是“资格赛”。它包含 300 个最常见的漏洞。它出现得较早,且拥有大量的参赛记录。
  • SWE-Bench Verified: 这是“冠军赛”。它包含 500 个经过一家主要 AI 公司(OpenAI)仔细检查和清理的漏洞,以确保它们是可解的。它更新,且这里的竞争更加激烈。

2. 谁在跑步?(提交者)

作者观察了提交解决方案的人。他们发现,工业界正在统治这条赛道

  • 企业短跑选手: 大多数顶尖表现者都是公司。不仅是像 Google 或 IBM 这样的巨头,还有许多小型初创公司和“夫妻店”式的技术小店。
  • 学术跑者: 大学和研究实验室仍在参与,但与企业团队相比,他们的数量较少。
  • 个人运动员: 少数个人也在独自参加比赛,考虑到工具的强大程度,这非常令人印象深刻。

类比: 想象一场马拉松,曾经的赢家主要是大学跑者。现在,领奖台主要被来自大型企业和小型初创公司的专业团队占据,只有少数大学跑者仍在紧随其后。

3. 装备(AI 模型)

这也许是最令人惊讶的发现。想要跑得快,你需要好鞋。在这场比赛中,“鞋子”就是 大语言模型 (LLMs) ——即修复机器人背后的 AI 大脑。

  • “超级跑鞋”: 最快的跑者几乎排他性地使用专有(闭源)模型,特别是 Claude 系列(由一家名为 Anthropic 的公司制造)。目前的冠军 Claude 4 Sonnet 就像是一双超轻量化、高科技的钉鞋,除了它,没人能买到或看到它的设计。
  • 开源运动鞋: 有些跑者使用的是开源模型(任何人都可以下载和研究的模型),但他们目前还无法获得金牌。他们具有竞争力,但还未能创造世界纪录。
  • 混合搭配: 一些团队会将不同的模型混合在一起使用(就像穿着两只不同的鞋),但单一最好的“鞋”仍然是专有的 Claude 模型。

4. 结果(谁在获胜?)

  • 计分板: “Verified”排行榜的分数比 “Lite” 高得多。最好的解决方案修复了大约 76% 到 77% 的漏洞。
  • 趋势: 在开始阶段,大学处于领先地位。但随着比赛的进行,小型和大型公司开始实现超越,通常能取得最高的得分。
  • “黑盒”问题: 许多顶尖解决方案都是“闭源”的。这意味着我们知道它们有效,但不知道它们究竟是如何做到的,因为这些公司对代码保密。这就像看到一名跑者赢得比赛,却不允许你看到他们的训练计划。

5. 陷阱(需要注意的事项)

作者警告说,计分板可能会有些误导性,就像一场终点线会移动的比赛。

  • “作弊条”效应: 有时,AI 并不是真正“学习”了如何修复漏洞,它只是记住了答案,因为它在训练数据中见过这个漏洞。这被称为数据污染 (Data Contamination)
  • “假修复”效应: 有时,AI 写出的修复方案通过了自动化测试(就像学生在选择题上猜中了正确答案),但并没有真正解决实际问题。这被称为过拟合 (Overfitting)
  • 成本: 最好的“鞋子”(顶尖 AI 模型)是需要花钱使用的。这意味着只有拥有雄厚预算的团队才能负担得起运行最快的速度,这可能会让规模较小的研究人员或开源社区掉队。

核心结论

论文总结道,自动化程序修复领域的发展极其迅速,但它正变得成为一项由企业主导的运动。最好的结果是由使用昂贵、秘密 AI 模型的大型公司驱动的。虽然这对速度提升很有利,但作者建议我们需要保持警惕:我们需要确保修复是真正的修复,而不仅仅是记忆答案;同时,我们需要保持比赛的开放性,让每个人都有机会参与,而不只是那些拥有最大预算的团队。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →