← 最新论文
💬 NLP

SERA: Soft-Verified Efficient Repository Agents

该论文介绍了 SERA,这是一种利用软验证生成(Soft Verified Generation)进行训练的具有成本效益的方法,旨在通过监督微调使开源编程智能体专门化以适应私有代码库,其性能可媲美领先的开源模型,而成本仅为强化学习或以往合成数据方法的极小部分。

原作者: Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:让每个人都能拥有编程智能体

想象你有一个超级聪明的机器人助手(一个“编程智能体”),它能够修复 Bug 并编写软件。目前,最优秀的机器人就像是闭源的黑盒:你可以租用它们,但你无法教它们属于你的特定“秘密”。如果你在一家拥有私有代码的公司工作,你无法在不将这些秘密发送给大型云端公司的情况下,用你特定的文件来训练这个机器人。

这篇论文的作者想要构建一个开源机器人,让任何人都能在自己的私有代码上进行训练。但问题在于:训练这些机器人过去极其昂贵且复杂,就像试图在自家车库里制造一枚火箭一样。

SERA(软验证高效仓库智能体)是他们提出的新方法。这是一种训练编程机器人的方式,它既便宜、又快速,而且不需要复杂的测试实验室。


旧方法 vs. 新方法

旧方法:“严厉的老师”

此前,为了训练编程机器人,研究人员必须扮演严厉的学校老师的角色:

  1. 创建测试: 他们会在代码文件中人为制造一个特定的 Bug。
  2. 搭建实验室: 他们必须搭建一个复杂的计算机环境来运行“单元测试”(就像期末考试一样),以观察机器人是否真的修复了 Bug。
  3. 验证: 如果机器人通过了测试,数据就是好的;如果失败了,数据就是垃圾。

问题所在: 这需要庞大的工程师团队、昂贵的计算机和大量的时间。这就像为了教学生如何烤蛋糕,而必须先配备一间完整的化学实验室。

新方法 (SERA):“软验证”法

作者意识到他们并不需要化学实验室。他们发明了一种称为软验证生成 (Soft-Verified Generation, SVG) 的方法。

类比:“模仿游戏”
想象你想教一名学生(AI)如何编辑一本书。

  1. 阶段 1(老师): 你要求一位非常聪明的老师(一个强大的 AI 模型)去“修复书中的一个模糊问题”。老师写出了该章节的新版本。
  2. 提示词: 你拿起这个新版本,并写下一条笔记:“这是老师所做的改动。请执行同样的操作。”
  3. 阶段 2(学生): 你再次要求老师阅读这条笔记,并尝试从零开始重新实现那个改动。
  4. 检查(软验证): 我们不需要运行复杂的测试来查看代码是否完美运行,你只需要逐行对比这两个版本
    • 如果第二个版本看起来与第一个版本有 80% 的相似度,你就说:“足够好了!让我们用这个来训练我们的学生。”

为什么这是一个游戏规则的改变者:

  • 无需实验室: 你不需要运行测试或搭建复杂的环境。你只需要对比文本即可。
  • 任何代码皆可用: 你可以对任何代码仓库进行此操作,即使是那些没有测试或属于私有公司的代码。
  • 模糊的指令: 作者发现,给 AI 提供模糊的指令(如“改进这段代码”)实际上比具体的 Bug 修复效果更好。它教会了 AI 如何重构和清理代码,而这正是现实中开发者最常做的事情。

结果:快速、廉价且强大

团队使用这种方法创建了一个包含 200,000+ 训练样本(轨迹)的海量数据集。以下是他们的成就:

  1. 前所未有的廉价: 创建这些模型的成本比使用强化学习(旧的复杂方法)低 26 倍,比之前的合成数据方法低 57 倍
    • 类比: 如果用旧方法建造一个机器人需要 10 万美元,那么 SERA 大约只需要 2000 美元。
  2. 击败竞争对手: 他们的开源模型(SERA-32B)在标准编程基准测试中的表现,达到了甚至超过了许多昂贵的闭源模型。
  3. 针对你的代码进行专业化: 这是其“杀手级应用”。因为该方法非常便宜,所以一家公司可以利用自己的私有代码生成 8,000 个示例,并训练出一个比任何巨型 AI 模型都更了解其代码库的机器人。
    • 类比: 你不再是雇佣一位了解世界万物的通用顾问,而是可以花费几杯咖啡的钱,训练一位对你家里的内部构造了如指掌的专家。

给普通读者的核心要点

  • 你不需要博士学位或超级计算机: 作者仅凭一个小型团队(3 名研究员)和适度的预算就完成了这项工作。
  • 不需要追求完美: 你不需要验证代码是否 100% 正确才能从中学习。仅仅观察 AI 尝试 如何修复它是非常有价值的。
  • 隐私是可能的: 你现在可以构建一个了解你私密信息的 AI,而无需将这些秘密发送给任何大型科技公司。
  • 开源必胜: 他们免费发布了所有的代码、数据和模型,希望让其他人也能在无需从零开始的情况下,构建出更好的编程机器人。

简而言之,SERA 将训练编程 AI 的过程从一个“耗资数百万美元的工业项目”转变为一个“小团队在自家车库就能完成的任务”,为每个人拥有一位真正理解其具体工作的编程助手打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →