← 最新论文
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench 引入了一个基于真实开源版本升级的、包含 115 项复杂且长周期编码任务的基准测试,以证明当前前沿 AI 智能体在大规模、多目标软件开发中面临显著困难,即使采用最先进的模型,其任务解决率也不足 40%。

原作者: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一支由超级聪明、由人工智能驱动的初级开发者组成的团队。你想知道他们能否胜任真正的工作:不仅仅是修复食谱中的一个拼写错误,而是要彻底重写一本长达 500 页的巨型食谱,添加新章节,改变食材的计量方式,并修复损坏的烤箱——同时确保旧版食谱对仍在使用旧版本的人依然有效。

这正是论文 ROADMAPBENCH 所探讨的内容。

以下是该论文用通俗语言进行的拆解:

1. 问题所在:“拼写错误”与“整体改造”

长期以来,我们都在用简单的小任务来测试 AI 编程助手。这就像在问:“你能修复这段文字中的一个句子吗?”AI 通常会回答:“当然!”然后拿到 A+。

但在现实世界中,软件开发并非关于修复一个句子。它关乎翻新一座摩天大楼。你必须同时改变 50 层楼的管道、电路和电梯系统,且不能让大楼倒塌。

作者们意识到,现有的测试过于简单。这就像要求建筑师去修复一个漏水的龙头,而实际的工作却是为医院设计一个新的翼楼。因此,他们构建了一个全新、难度高得多的测试,名为 ROADMAPBENCH

2. 新测试:“版本升级”挑战

ROADMAPBENCH 不再要求 AI 修复漏洞,而是给它一份路线图

  • 设置:AI 被投入一个数字车间,里面有一个真实软件项目(例如一个流行的开源工具)的旧版本。
  • 任务:AI 会收到一份“路线图”文档。该文档指出:“在软件的下一个版本中,我们需要添加这 5 个新功能,改变这 3 件事的运作方式,并修复这 2 个漏洞。”
  • 规模:这并非微小的改动。平均而言,AI 必须重写分布在 51 个不同文件 中的 3,700 行代码。这就像要求 AI 一次性重写整部电影剧本、更换服装并重新拍摄场景。
  • 规则:AI 不能偷看“答案键”(即软件的新版本)。它必须仅凭指令来推断出结果。

3. 结果:AI 仍然是“初级”

研究人员测试了 13 个最智能的可用 AI 模型(包括来自 Anthropic、OpenAI 和 Google 等公司的最新版本)。他们让这些模型通过了 ROADMAPBENCH 测试。

结果令人清醒:

  • 即使是最聪明的 AI(Claude-Opus-4.7),也仅在 39.1% 的任务中取得成功。
  • 弱的 AI 仅在 5.2% 的任务中取得成功。

比喻:
如果你让一名人类初级开发者去改造一所房子,而他们只有 10 次机会中完成了 4 次正确的工作,你会说:“他们还在学习。”这篇论文表明,就复杂的长期软件项目而言,即使是我们最先进的 AI 仍处于“学习”阶段。

4. 他们在哪里失败了?

这篇论文不仅统计了失败次数,还分析了失败的原因。他们发现了一种基于 AI“智能”程度的模式:

  • 较强的模型:它们通常能让代码编译(构建)成功,并能编写大部分功能。但它们在细节上失败了。这就像它们建造了一座完美的房子,但门把手装在了错误的一侧,或者电灯开关实际上无法打开灯。它们理解了大局,却忽略了微小而精确的逻辑。
  • 较弱的模型:它们甚至常常无法把房子建起来。它们忘了安装屋顶,或者试图把厨房建在地下室。它们在基础构建层面就失败了。

5. 为什么这很重要(根据论文观点)

作者们认为,我们需要停止用“拼写错误修复”来测试 AI,因为这会给我们一种虚假的安全感。仅仅因为 AI 能修复一个漏洞,并不意味着它能构建一个新功能。

ROADMAPBENCH 是一把新的、诚实的尺子。它告诉我们,虽然 AI 正在变得更好,但处理长期、复杂、多步骤的软件项目的能力仍然是一个巨大的、未解决的挑战。目前的 AI 就像一个非常有天赋的学徒,能够很好地遵循几步指令,但当项目变得过于庞大和复杂时,它就会感到困惑。

总结

  • 旧测试:“你能修复这个坏掉的单词吗?”(AI:能!)
  • ROADMAPBENCH:“这是一个升级整个软件系统的计划。你能做到吗?”(AI:我可以试试,但我可能会搞错细节或忘记某一步。)
  • 结论:我们尚未到达那里。AI 很聪明,但它尚未准备好成为重大软件项目的首席工程师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →