← 最新论文
💬 NLP

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

本文介绍了 SWE-bench ProMax,这是一个经过严格策划、包含 170 个大规模代码重构任务的多语言基准测试,旨在克服现有评估方法的缺陷与饱和问题,并证明了当前的尖端 AI 智能体在处理复杂的、保持行为一致性的软件工程挑战方面仍然存在困难。

原作者: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机正在学习成为软件工程师的世界。多年来,科学家们一直通过让这些“AI 编程智能体”解决微小的、孤立的谜题(比如编写一个将两个数字相加的单一函数)来测试它们。这就像是通过让飞行员在跑道上滑行来测试飞行员。但真正的软件并不是逐行构建的;它是一个庞大且相互关联的代码城市,改变一个路标可能需要更新整个大都市的地图、交通灯和公交时刻表。研究人员提出的核心问题是:这些 AI 智能体能否应对重写大规模软件块时那种混乱且复杂的现实,而不破坏任何东西?这就是“代码重构”的领域——即在不改变内部灯光开关功能的情况下,重新组织建筑内部布线的艺术。

于是有了 SWE-Bench ProMax,这是一个全新的、极具挑战性的测试,旨在观察 AI 智能体是否已准备好进入顶级联赛。之前的测试就像是在玩“简单模式”的游戏,AI 通常可以依赖记忆答案或解决过于简单的题目。该新基准测试的创造者意识到,如果测试过于简单或设计拙劣,AI 的高分仅仅是智能的一种幻象。因此,他们打造了一个“困难模式”的试炼场。他们收集了来自七种不同编程语言(包括 Python、Java、C++ 和 Rust)的 170 个真实世界软件挑战。这些不是小修小补;而是大规模的重组,AI 必须协调平均涉及 11.4 个不同文件的变更,并重写超过 260 行代码,同时还要确保软件的行为与之前完全一致。

测试结果是对 AI 行业的一次现实检验。当最聪明、最昂贵的 AI 模型被投入这个竞技场时,它们并没有轻松取胜。表现最好的模型也仅解决了 41.2% 的任务。这表明,虽然 AI 擅长处理琐碎的小事,但在处理现实世界工程所需的复杂、多步骤协调方面仍然感到吃力。有趣的是,论文发现,在模型上投入更多的资金并不总是意味着更好的结果;一些廉价的开源模型表现得几乎与那些昂贵的巨头模型一样出色。AI 失败的主要原因是什么?它倾向于做一个“部分”工作者。它会修复主要问题,但却忘了更新辅助文件,就像修好了漏水的管道,却忘了通知水表,导致整个系统失效。这一基准测试证明,对于 AI 而言,真正的软件工程大师水平仍处于开发过程中,这需要一种目前的智能体尚未完全掌握的规划能力和跨文件协调能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →