SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
本文提出了 SWE-rebench V2,一种语言无关的自动化流水线,能够大规模收集并构建涵盖 20 种语言和 3600 多个仓库的 3.2 万个可执行真实世界软件工程任务及 12 万个扩展任务,旨在解决强化学习训练数据稀缺问题并推动跨语言软件智能体的高效训练。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 SWE-rebench V2 的新项目。为了让你轻松理解,我们可以把软件开发(写代码、修 Bug)想象成**“修理一辆辆不同品牌的汽车”**。
1. 背景:为什么我们需要这个?
想象一下,你正在训练一群**“超级机器人修理工”**(这就是论文里的 AI 智能体)。这些机器人很聪明,能看懂图纸(代码),也能动手修车。
但是,要训练它们,你需要大量的**“练习题库”**。
- 以前的难题:以前的题库(比如 SWE-bench)就像只给了你“丰田”和“大众”的练习车。而且,这些车要么没有说明书,要么修的时候需要人工在旁边手把手教怎么拧螺丝(环境配置),要么修完不知道到底修没修好(测试不靠谱)。
- 后果:因为练习车太少、太单一,机器人学不会怎么修“法拉利”、“拖拉机”或者“火星车”(其他编程语言和冷门项目)。
2. 核心创新:SWE-rebench V2 是什么?
SWE-rebench V2 就像是一个**“全自动汽车修理厂建设机器”。它的目标不是只造几辆车,而是能自动、大规模地**为全世界各种各样的汽车(20 种编程语言,3600 多个项目)制造“练习场”。
它有三个绝招:
第一招:万能翻译官(语言无关)
以前的系统可能只懂“中文”(Python),遇到“法语”(Java)或“俄语”(Go)就傻眼了。
- SWE-rebench V2 就像一个万能翻译官。它有一套通用的流程,不管面对什么语言,它都能自动识别:“哦,这是一辆‘德语车’,我需要换一套德语的扳手和说明书。”
- 比喻:它不再需要为每种车专门雇一个修理工,而是雇了一个**“超级修理工”**,只要给他一本通用的《如何修任何车》手册,他就能搞定所有车型。
第二招:自动试错机器人(交互式设置)
在修车前,你得先知道怎么把车发动起来,怎么接上电源。以前这步得靠人手动试,累死人。
- SWE-rebench V2 派出了一个**“自动调试机器人”**。它把车开进车库,尝试点火、加油、接电线。如果第一次没着,它不会放弃,而是会看报错信息,换个方法再试,直到车能跑起来,并且能听到“滴滴”的测试通过声。
- 比喻:就像你教小孩玩积木,以前是你帮他搭好底座;现在是你给小孩一个**“会自己思考的助手”**,助手会自己试错:“哎呀,这块积木放反了,我换一块试试”,直到把底座搭好。
第三招:严格的质检员(AI 法官团)
不是所有“练习车”都适合训练。有的车说明书太模糊(“修好它”),有的车零件是坏的(测试本身就有问题)。
- SWE-rebench V2 雇佣了三个 AI 法官。在把题目放进题库前,它们会一起评审:“这道题描述清楚吗?”“测试标准靠谱吗?”只有三个法官都点头,这道题才会被收录。
- 比喻:就像学校出题,以前可能随便抄个题就考学生;现在有三个**“特级教师”**先审题,把那些“题目出错了”或者“题意不明”的题全部剔除,保证学生(AI 模型)练的都是好题。
3. 成果:我们得到了什么?
通过这套流水线,他们造出了两个巨大的宝库:
精选题库(32,000+ 题):
- 这是**“精装修版”**。每道题都配好了现成的“车库”(Docker 容器),机器人进去就能直接修,修完自动打分。
- 涵盖了 20 种语言,从常见的 Python 到冷门的 Rust、Scala 都有。
海量素材库(120,000+ 题):
- 这是**“毛坯房版”**。虽然还没完全装修好,但提供了详细的“施工图纸”(安装步骤)和“验收标准”(测试用例)。
- 这些题目是从 GitHub 上成千上万的**“修车记录”(Pull Request)**里直接提取的,问题描述直接来自修车师傅的笔记,非常真实。
4. 为什么这很重要?(给未来的影响)
- 打破语言壁垒:以前 AI 只会修 Python 车,现在它开始学习修 Java、Go、Rust 等各种车了。
- 像人类一样学习:通过这种大规模的“试错 - 反馈”训练,AI 修理工不再只是死记硬背,而是学会了**“遇到新车型怎么自己找工具、怎么调试”**。
- 透明化:他们还给每道题贴上了“诊断标签”。比如,这道题难是因为“题目没写清楚”(B4),还是因为“测试太严格”(B1)。这让研究人员可以像医生一样,根据 AI 的弱点进行针对性训练。
总结
SWE-rebench V2 就像是给 AI 修理工建了一个**“全球通用的超级驾校”**。
它不再依赖人工去一个个搭建练习场,而是用自动化流水线,把全世界开源社区里真实的“修车案例”变成了标准化的训练数据。这让 AI 能够以前所未有的速度和广度,学会解决各种复杂的软件问题,从写代码到修 Bug,样样精通。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。