← 最新论文
💻 computer science

RepoZero: Can LLMs Generate a Code Repository from Scratch?

本文介绍了 RepoZero,这是首个针对大语言模型根据 API 规范从零开始生成完整软件仓库并进行全自动化执行验证的基准测试,同时提出了代理代码 - 测试演进(ACE)框架,结果表明,即使是当前最先进的代理也难以在此复杂任务中实现高成功率。

原作者: Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文"RepoZero"的解释。

核心思想:AI 能否仅凭蓝图建造房屋?

想象你有一个非常聪明的机器人助手(AI),它擅长修理漏水的水龙头或粉刷一面墙。但现在,你向它提出了一个更棘手的问题:“你能仅凭一份指令列表,在不查看原始蓝图或成品房屋的情况下,从零开始建造整栋房子吗?”

这篇论文 RepoZero 提出的正是这个问题,只不过它关注的不是房屋,而是软件代码仓库(构成软件程序的文件集合)。

问题所在:“假装直到成功”的陷阱

此前,研究人员通过让 AI 修复小漏洞或编写单个文件来测试这些机器人。但在从零开始构建整个程序时,很难判断 AI 究竟是真正理解了构建方法,还是仅仅死记硬背了训练数据中的答案(就像学生死记硬背课本答案而非学习数学原理)。

大多数现有测试依赖人类或其他 AI 阅读代码并说“看起来不错!”。这就像老师批改数学试卷时,只看最终答案而不检查解题过程。这种测试很容易作弊,且不可靠。

解决方案:"RepoZero"挑战

作者创建了一个名为 RepoZero 的全新、超严苛测试。以下是其运作方式,采用烹饪类比

  1. 原始菜肴(源文件): 想象一位名厨拥有一份复杂蛋糕的秘方。我们确切知道它的味道和表现。
  2. 挑战: 我们给 AI 机器人一份食材清单,以及关于蛋糕应该具备功能的描述(例如:“加热时必须膨胀”,“尝起来必须甜”)。
  3. 转折(跨语言): 机器人不允许使用原始食谱。更糟糕的是,它必须在完全不同的厨房中使用不同的工具来制作蛋糕。
    • 如果原始蛋糕是在 Python 厨房制作的,机器人必须在 JavaScript 厨房中构建它。
    • 如果原始版本是 C++,机器人必须在 Rust 中构建它。
    • 为什么? 这阻止了机器人直接复制食谱。它迫使机器人真正理解逻辑并从头重建。
  4. 品尝测试(验证): 机器人制作自己的蛋糕。然后我们将两个蛋糕并排品尝。如果机器人的蛋糕表现与原始蛋糕完全一致(膨胀程度相同、味道相同、质地相同),则通过测试。如果有细微差别,则失败。

"ACE"框架:机器人的自我修正循环

论文还介绍了一种让机器人在工作过程中学习的新方法,称为 ACE(代理代码 - 测试演进)。

这就像大型比赛前的练习环节

  • 机器人不再只是尝试一次建造房屋并寄希望于最好结果,而是先构建一小部分,然后立即测试它。
  • 如果测试失败(例如,“门打不开”),机器人会看到错误,修复门,然后再次测试。
  • 它重复这个循环:构建 -> 测试 -> 修复 -> 构建
  • 论文发现,使用这种“练习循环”的机器人在构建最终产品方面,比那些试图一次性完成构建的机器人表现要好得多。

他们发现了什么?

结果令人惊讶且略显清醒:

  • 即使是最“聪明”的机器人也感到吃力: 当今最先进的 AI 模型(如 Claude、DeepSeek 和 Kimi)成功从零构建完整软件“房屋”的概率仅为 30% 到 55%
  • 差距巨大: 虽然这些 AI 在编写单行代码方面表现出色,但它们距离能够自主从零构建复杂、可运行的软件系统还有很长的路要走。
  • 自我检查是关键: 使用"ACE"循环(测试并修复自己的工作)的机器人表现显著更好。这表明,要让 AI 成为真正的软件工程师,它需要提高检查自身工作的能力,而不仅仅是猜测。

总结

RepoZero 是为 AI 机器人设立的一个全新且严格的训练场。它迫使机器人在不同语言中重建复杂软件,以证明它们并非通过死记硬背答案来作弊。测试表明,虽然 AI 在处理小任务方面日益精进,但在能够独立构建整个软件项目之前,仍有很长的路要走。论文指出,实现这一目标的关键在于教会 AI 在构建过程中测试并修复自身的错误

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →