← 最新论文
💻 computer science

From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents

该论文提出了从 SWE-ZERO 到 SWE-HERO 的两阶段微调范式,通过结合免执行的大规模语义训练与基于执行的针对性精炼,成功将开源模型在 SWE-bench 上的解决率提升至 62.2%,并验证了其在多语言场景下的泛化能力。

原作者: Nikolai Ludwig, Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikolai Ludwig, Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 "SWE-ZERO 到 SWE-HERO" 的新方法,旨在训练人工智能(AI)像真正的软件工程师一样去修复代码漏洞。

为了让你更容易理解,我们可以把训练 AI 修复代码的过程,想象成培养一名“超级修车工”

1. 以前的痛点:修车工太依赖“试车场”

传统的训练方法(就像以前的修车培训)是这样的:

  • 必须实地试车:AI 每提出一个修车方案,就必须真的把车(代码)开进一个复杂的试车场(Docker 容器环境)里跑一遍,看看能不能跑通。
  • 成本极高:建立和维护成千上万个这样的“试车场”非常昂贵、耗时,而且一旦某个车的零件(依赖库)太老或太怪,试车场就建不起来,导致很多真实的修车案例(GitHub 上的代码问题)被直接丢弃。
  • 结果:因为太依赖“实地试车”,能用来训练的数据量很少,AI 学得不够多,也不够快。

2. 新方法的核心:两步走战略

作者提出了一种“先动脑,后动手”的两阶段训练法,把 AI 从“新手”培养成“英雄”。

第一阶段:SWE-ZERO(“纸上谈兵”的直觉训练)

  • 比喻:想象让修车工在没有实车的情况下,只通过看图纸(代码)和听描述(问题),在脑海里模拟修车过程。
  • 怎么做
    • 利用 AI 大脑里已经学过的海量知识(大模型的“世界观”),让它在不运行代码的情况下,直接分析代码逻辑,找出问题并写出修复方案。
    • 优势:因为不需要建“试车场”,速度极快,成本极低。他们收集了 30 万 个这样的“纯理论”修车案例来训练 AI。
    • 效果:AI 学会了宏观直觉。它现在能像老手一样,一眼看出代码哪里不对劲,不需要每次都去“试车”验证。这解决了“数据不够多”的问题。

第二阶段:SWE-HERO(“实战演练”的精准打磨)

  • 比喻:现在修车工有了极强的直觉,但偶尔还是会遇到一些看不见的“隐形故障”(比如并发问题,必须跑起来才能发现)。于是,我们给他安排1.3 万个最典型的“实战试车场”案例。
  • 怎么做
    • 让已经具备直觉的 AI,在这些真实的、有反馈的环境中,进行针对性的“实战演练”。
    • 如果 AI 写错了,试车场会报错,AI 就根据报错修正。
    • 优势:用少量的、高质量的“实战数据”,把 AI 的“直觉”转化为“严谨的工程能力”。
  • 效果:AI 从“凭感觉修车”进化到了“既懂原理又能精准验证”的超级工程师

3. 惊人的成果

  • 小模型,大能量:他们训练出的 32B(320 亿参数) 模型,在著名的代码修复测试(SWE-bench)中,成功修复了 62.2% 的问题。这比之前同体量的开源模型都要强,甚至接近了一些更昂贵的商业模型。
  • 举一反三:最有趣的是,这个模型虽然只用了Python语言的数据训练,但它竟然能很好地修复其他语言(如 Java, JavaScript 等)的代码问题。
    • 比喻:就像这个修车工虽然只练过修“丰田”,但因为他在第一阶段学会了“汽车机械原理”,所以让他去修“宝马”或“奥迪”时,他也能上手很快。这证明了他们的方法抓住了代码的通用逻辑,而不仅仅是死记硬背。

4. 总结:为什么这很重要?

这就好比以前我们想培养一个顶级工程师,必须给他建无数个昂贵的实验室,导致人才稀缺。
现在,SWE-ZERO 到 SWE-HERO 的方法告诉我们:

  1. 先让 AI 在海量数据中大量阅读和模拟(低成本、高效率),建立强大的直觉。
  2. 再让它在少量真实场景精准纠错(高价值、保质量)。

这种方法不仅让开源 AI 模型变得更强,还打破了“必须依赖昂贵环境才能训练”的瓶颈,让未来的 AI 工程师能更便宜、更快速地诞生。

一句话总结
这篇论文教 AI 先通过“海量阅读”练就火眼金睛,再通过“少量实战”打磨成绝世高手,最终用极低的成本训练出了能解决真实世界代码难题的开源 AI 英雄。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →