SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
为了解决现有基准测试(如 SWE-bench)中存在的严重数据污染和测试用例不足的问题,本文引入了 SWE-MERA,这是一个动态且持续更新的基准测试,它利用自动化流水线来策划真实的 GitHub 问题,从而为大语言模型在软件工程任务上的评估提供了一个严谨且可靠的框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何修理一个损坏的视频游戏。长期以来,测试机器人的最佳方法是给它一份大家已经见过的特定损坏关卡列表。但问题在于,机器人只是在死记硬背答案,而不是真正学习如何修复事物。这就像一个学生背下了去年数学考试的答案解析,但当数字发生变化时,他在新考试中却失败了。
这正是著名的 SWE-bench——一个流行的 AI 编程技能测试——所发生的情况。论文揭示了这个旧测试存在答案泄露的问题。大约 32.67% 的“成功”修复仅仅是 AI 复制了它已经见过的解决方案,另有 31.08% 的通过是因为测试太弱,无法捕捉到真正的错误。它是一把坏掉的尺子。
于是,SWE-MERA 出现了,这是一个全新的、动态的挑战者。请不要把 SWE-MERA 仅仅看作一本静态的教科书,而要把它看作一个实时跳动的、每月更新的视频游戏服务器。它不再使用旧的、死记硬背的谜题,而是不断地从互联网(特别是人们分享代码的 GitHub)中搜寻全新的、现实世界中的问题。
这个新测试是如何运作的
作者构建了一个超级组织化的机器人流水线来寻找这些新鲜的问题。这就像一场高科技的寻宝游戏,拥有七条严格的规则来确保线索的真实性:
- 选择合适的游乐场: 它只关注流行的、活跃的 Python 项目(至少有 10 个 star 和 10 个 fork)。
- 匹配线索: 它寻找一个特定的问题(一个“issue”)和修复该问题的精确方案(一个“pull request”),并确保它们是完美的、一一对应的关系。
- 检查规模: 它忽略微小的笔记和庞大且混乱的项目,只保留那些大小适中的项目。
- 验证修复: 它检查解决方案是否真的修改了代码,并增加了一个测试来证明其有效性。
- 搭建实验室: 它尝试在一个安全的、隔离的容器(类似于数字沙盒)中构建该项目,以观察测试是否通过。
- 执行完整任务: 它从头到尾运行整个任务,以确保它是可复现的。
- AI 裁判: 最后,另一个 AI 模型(Qwen3-32B)充当严厉的老师,根据正确性和完整性对任务进行 1 到 10 分 的评分。如果一个任务太简单、太难或解释不清,它就会被剔除。
结果如何?它产生了一个包含约 10,000 个潜在任务的庞大集合,其中 728 个高质量样本目前已准备就绪。
结果:谁才是真正的赢家?
研究人员将十几个最聪明的编程 AI 放在这些新鲜的问题面前进行了测试。他们不仅仅是让 AI 解决一次,而是给了它 六次尝试 来修复漏洞,并给予它思考和重新检查工作的机会。
结果令人大开眼界:
- 顶尖表现者: DeepSeek-R1-0528 模型成为了冠军,它在第一次尝试时修复了约 27.8% 的问题,并在六次尝试内修复了 40.2%。
- 亚军: Devstral-Small-2505 以 17.2% 的首次尝试解决率和 28.2% 的总解决率位居第二。
- 挣扎者: 即便是像 Llama-3.3-70B 这样强大且擅长聊天的模型(虽然它很擅长聊天,但并非专门为代码构建),在第一次尝试中也仅达到了 8.7%。最小的模型 Qwen2.5-Coder-7B 在第一次尝试中只能修复 2.7%。
论文指出,这些新的动态测试能更好地分辨出哪些是聪明的 AI,哪些是靠死记硬背的 AI。例如,一些在旧测试中表现优异的模型在新的 2025 年任务中表现反而下降,这表明它们之前只是在死记硬背旧答案。
这个测试不做的事情
了解这个新基准测试遗漏了什么非常重要。论文明确指出,这项测试并不衡量代码的可读性、可维护性或安全性。它也不测试团队协作或人类与机器人之间的协作能力。它严格专注于:“机器人能否修复漏洞并使测试通过?”
此外,作者警告说,由于这些问题是自动收集的,其中一些可能显得有些奇怪,或者缺乏人类编写谜题时的创意细微差别。此外,尽管系统试图防止这种情况,但仍存在 AI 可能在训练数据中见过类似问题的微小风险。
大局观
作者相信 SWE-MERA 是一个更加公平的衡量进步的方式。通过不断用全新的、未见的挑战来刷新测试,它阻止了 AI 通过死记硬背答案来“作弊”。他们甚至建立了一个公开的排行榜,任何人都可以查看自己的编程机器人与世界顶尖水平的对比情况,并配有一个滑动条,让你可以看到性能随时间的变化。
简而言之,SWE-MERA 是该领域所需的“新鲜空气”。它告别了尘封、死记硬背的教科书,进入了一个动态、不断变化的竞技场,只有那些真正具备适应能力的编程智能体才能生存下来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。