✨ 要点🔬 技术摘要
想象一下,修复计算机代码的世界就像是一场规模宏大、高风险的软件工程师奥林匹克运动会 。多年来,研究人员一直试图制造机器人(AI),使其能够自动发现代码中的漏洞并进行修复。为了看看到底谁在领先,他们需要一条标准的赛道。
本论文深入探讨了目前用于这场比赛的两条主要赛道:SWE-Bench Lite 和 SWE-Bench Verified 。作者 Matias Martinez 和 Xavier Franch 扮演了体育分析师的角色,通过观察计分板、运动员和他们使用的装备,来观察这个领域究竟发生了什么。
以下是他们的发现,通过简单的形式进行拆解:
1. 赛道(基准测试)
将 SWE-Bench 想象成一个巨大的健身房,里面充满了从真实世界项目中提取的 2,294 个损坏的软件部件(漏洞)。
SWE-Bench Lite: 这是“资格赛”。它包含 300 个最常见的漏洞。它出现得较早,且拥有大量的参赛记录。
SWE-Bench Verified: 这是“冠军赛”。它包含 500 个经过一家主要 AI 公司(OpenAI)仔细检查和清理的漏洞,以确保它们是可解的。它更新,且这里的竞争更加激烈。
2. 谁在跑步?(提交者)
作者观察了提交解决方案的人。他们发现,工业界正在统治这条赛道 。
企业短跑选手: 大多数顶尖表现者都是公司。不仅是像 Google 或 IBM 这样的巨头,还有许多小型初创公司和“夫妻店”式的技术小店。
学术跑者: 大学和研究实验室仍在参与,但与企业团队相比,他们的数量较少。
个人运动员: 少数个人也在独自参加比赛,考虑到工具的强大程度,这非常令人印象深刻。
类比: 想象一场马拉松,曾经的赢家主要是大学跑者。现在,领奖台主要被来自大型企业和小型初创公司的专业团队占据,只有少数大学跑者仍在紧随其后。
3. 装备(AI 模型)
这也许是最令人惊讶的发现。想要跑得快,你需要好鞋。在这场比赛中,“鞋子”就是 大语言模型 (LLMs) ——即修复机器人背后的 AI 大脑。
“超级跑鞋”: 最快的跑者几乎排他性地使用专有(闭源)模型 ,特别是 Claude 系列 (由一家名为 Anthropic 的公司制造)。目前的冠军 Claude 4 Sonnet 就像是一双超轻量化、高科技的钉鞋,除了它,没人能买到或看到它的设计。
开源运动鞋: 有些跑者使用的是开源模型(任何人都可以下载和研究的模型),但他们目前还无法获得金牌。他们具有竞争力,但还未能创造世界纪录。
混合搭配: 一些团队会将不同的模型混合在一起使用(就像穿着两只不同的鞋),但单一最好的“鞋”仍然是专有的 Claude 模型。
4. 结果(谁在获胜?)
计分板: “Verified”排行榜的分数比 “Lite” 高得多。最好的解决方案修复了大约 76% 到 77% 的漏洞。
趋势: 在开始阶段,大学处于领先地位。但随着比赛的进行,小型和大型公司开始实现超越,通常能取得最高的得分。
“黑盒”问题: 许多顶尖解决方案都是“闭源”的。这意味着我们知道它们有效,但不知道它们究竟是如何做到的,因为这些公司对代码保密。这就像看到一名跑者赢得比赛,却不允许你看到他们的训练计划。
5. 陷阱(需要注意的事项)
作者警告说,计分板可能会有些误导性,就像一场终点线会移动的比赛。
“作弊条”效应: 有时,AI 并不是真正“学习”了如何修复漏洞,它只是记住了答案,因为它在训练数据中见过这个漏洞。这被称为数据污染 (Data Contamination) 。
“假修复”效应: 有时,AI 写出的修复方案通过了自动化测试(就像学生在选择题上猜中了正确答案),但并没有真正解决实际问题。这被称为过拟合 (Overfitting) 。
成本: 最好的“鞋子”(顶尖 AI 模型)是需要花钱使用的。这意味着只有拥有雄厚预算的团队才能负担得起运行最快的速度,这可能会让规模较小的研究人员或开源社区掉队。
核心结论
论文总结道,自动化程序修复领域的发展极其迅速,但它正变得成为一项由企业主导的运动 。最好的结果是由使用昂贵、秘密 AI 模型的大型公司驱动的。虽然这对速度提升很有利,但作者建议我们需要保持警惕:我们需要确保修复是真正的 修复,而不仅仅是记忆答案;同时,我们需要保持比赛的开放性,让每个人都有机会参与,而不只是那些拥有最大预算的团队。
技术摘要:基准测试中包含什么?以自动化程序修复中的 SWE-Bench 为例
问题陈述 随着大语言模型(LLM)和智能体(Agent)系统的集成,自动化程序修复(APR)领域正在迅速演进。虽然像 Defects4J 这样的基准测试在历史上曾作为通用的评估标准,但 SWE-Bench 已成为一个主流基准,它通过挖掘流行开源 Python 仓库中的问题来反映真实世界的场景,且无需预先存在的测试用例进行验证。尽管该基准被快速采用并存在公开排行榜(SWE-Bench Lite 和 SWE-Bench Verified),但目前仍缺乏对其周边生态系统的系统性分析。具体而言,关于谁在提交解决方案、所采用的产品与模型的性质,以及这些方法的开放程度等动态,仍缺乏深入研究。本文旨在通过理解 SWE-Bench 生态系统的构成,为未来的研究向更高的透明度和多样性发展提供指导。
研究方法 作者对 SWE-Bench Lite 和 SWE-Bench Verified 排行榜进行了首次全面的研究。该研究共分析了 212 个条目:其中 79 个来自 Lite 排行榜,133 个来自 Verified 排行榜。
数据收集: 研究人员手动检查了每个排行榜条目,检索了提交的拉取请求(Pull Request)、相关网站及仓库文件(如 README.md、metadata.yaml)中的元数据。此外,他们还通过针对性的 Google 搜索(使用“条目名称 + SWE-Bench”)以及查看 LinkedIn 个人资料,来识别提交者的所属机构和产品详情。
排除标准: “Full”和“Multimodal”排行榜被排除在外,因为“Full”中的解决方案已在其他排行榜中得到体现,且本研究专注于基于语言的智能体。
标注: 通过结合演绎编码和归纳编码,作者根据五个维度对数据进行了分类,这些维度对应于其研究问题(RQs):
演进(Evolution): 追踪提交次数和精确度(% Resolved)随时间的变化。
提交者画像(Submitter Profile): 将提交者分类为学术界、工业界(进一步细分为规模和公开状态)、学术-工业合作、开源社区、个人开发者或未知。
产品与可用性(Products & Availability): 对软件制品(如 IDE 插件、云平台、CLI 工具)进行分类,并划分其可用模式(公开可用产品、经请求后提供、B2B、非商业解决方案、不可用)。
开放程度(Openness): 区分开源与闭源的解决方案代码。
所使用的 LLM(LLMs Employed): 识别所使用的特定 LLM,包括组合方式以及它们是专有模型还是开源模型。
核心贡献与结果
RQ1(演进): 提交量稳步增长,且自 2024 年 8 月官方发布 Verified 版以来,活动显著转向了 Verified 排行榜。虽然 Lite 的提交在 2025 年有所放缓,但 Verified 持续增长。Verified 排行榜展示了更高的精确度,中位数为 46.6%,最大值为 76.8%,而 Lite 的中位数为 32%,最大值为 60.3%。这种差异归因于 Verified 的构建方式,它过滤掉了被认为过难或无法解决的实例。
RQ2(提交者画像): 大多数提交源自工业界(占总数的 58%,若计入合作则上升至 79%)。小型公司和大型上市企业(如亚马逊、IBM、谷歌、EPAM)是最活跃的贡献者。虽然学术界的贡献仍具竞争力,但其在总条目中所占份额较小,尤其是在 Verified 版中。个人开发者和开源社区虽然存在,但在 Verified 排行榜中的主导地位较低。
RQ3(产品与可用性): 条目关联了多样化的产品形式,包括编程助手(通常为 IDE 插件)、开发平台(基于云端)和问题解决工具。公开可用产品(PAP)和非商业解决方案(NCS)是最常见的可用模式。值得注意的是,与 PAP 和“经请求后提供”相关的条目往往能获得更高的精确度,这与工业界的参与度较高相关。
RQ4(开放程度): 存在明显的开放度分歧。学术界驱动着开源生态系统;当学术机构参与(单独或合作)时,解决方案主要是开源的。相比之下,工业界的提交大多是闭源的。虽然闭源解决方案通常实现更高的中位精确度,但一些开源方法在 2025 年已达到了最先进的性能水平。
RQ5(LLMs): 专有 LLM 在顶尖结果中占据主导地位。Claude 系列 (特别是 Claude 4 Sonnet )是两个排行榜上取得最先进结果时最常用的模型。Verified 排行榜上的最高结果(76.8%)就是使用 Claude 4 Sonnet 实现的。虽然开源模型(如 Qwen2.5、Llama)也被使用,通常是与闭源模型结合或经过微调,但当仅单独使用时,其精确度通常较低。顶尖表现者经常使用多种 LLM 的组合。
意义与启示 本文认为,目前的 SWE-Bench 生态系统具有强烈的工业界色彩,并且依赖高成本的专有 LLM 来实现顶尖性能。作者强调了几个关键的启示:
对于研究人员: 软件工程(SE)社区与 AI 社区在补丁验证方面存在错位。SE 研究人员通常会区分正确补丁与过拟合补丁,而许多以 AI 为中心的提交仅报告测试通过的结果。本文呼吁加强对过拟合风险的传播,并鼓励产出开源制品。
对于从业者: 由于存在补丁过拟合和数据污染(训练数据记忆)的风险,应谨慎解读排行榜分数。在 SWE-Bench 上的表现可能无法泛化到多样化的现实场景中。
对于基准测试构建者: 透明度与参与度之间存在权衡。虽然详细的元数据有助于理解,但严格的要求可能会阻碍工业界的参与。作者建议在轻量级元数据要求与追溯性需求之间取得平衡。同时,他们也呼吁建立机制来追踪基准测试版本,处理新兴的子集(如 SWE-bench-Lite-S),并通过像 SWE-bench-Live 这样不断演进的基础设施来减轻数据污染。
成本与可及性: 依赖昂贵的云端 API 来获取顶尖性能,为学术研究者和较小型实体制造了门槛。本文建议未来的评估应考虑成本与性能的权衡,并鼓励报告开源模型的结果,以提供多样化的基准线。
总之,这项研究为当前由工业界和专有模型驱动的 APR 研究现状提供了基础性的理解,同时也指出了社区必须在哪些方面进行演进,以确保未来基准测试驱动型研究的鲁棒性、透明度和包容性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。