RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
RoadmapBench 引入了一个基于真实开源版本升级的、包含 115 项复杂且长周期编码任务的基准测试,以证明当前前沿 AI 智能体在大规模、多目标软件开发中面临显著困难,即使采用最先进的模型,其任务解决率也不足 40%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一支由超级聪明、由人工智能驱动的初级开发者组成的团队。你想知道他们能否胜任真正的工作:不仅仅是修复食谱中的一个拼写错误,而是要彻底重写一本长达 500 页的巨型食谱,添加新章节,改变食材的计量方式,并修复损坏的烤箱——同时确保旧版食谱对仍在使用旧版本的人依然有效。
这正是论文 ROADMAPBENCH 所探讨的内容。
以下是该论文用通俗语言进行的拆解:
1. 问题所在:“拼写错误”与“整体改造”
长期以来,我们都在用简单的小任务来测试 AI 编程助手。这就像在问:“你能修复这段文字中的一个句子吗?”AI 通常会回答:“当然!”然后拿到 A+。
但在现实世界中,软件开发并非关于修复一个句子。它关乎翻新一座摩天大楼。你必须同时改变 50 层楼的管道、电路和电梯系统,且不能让大楼倒塌。
作者们意识到,现有的测试过于简单。这就像要求建筑师去修复一个漏水的龙头,而实际的工作却是为医院设计一个新的翼楼。因此,他们构建了一个全新、难度高得多的测试,名为 ROADMAPBENCH。
2. 新测试:“版本升级”挑战
ROADMAPBENCH 不再要求 AI 修复漏洞,而是给它一份路线图。
- 设置:AI 被投入一个数字车间,里面有一个真实软件项目(例如一个流行的开源工具)的旧版本。
- 任务:AI 会收到一份“路线图”文档。该文档指出:“在软件的下一个版本中,我们需要添加这 5 个新功能,改变这 3 件事的运作方式,并修复这 2 个漏洞。”
- 规模:这并非微小的改动。平均而言,AI 必须重写分布在 51 个不同文件 中的 3,700 行代码。这就像要求 AI 一次性重写整部电影剧本、更换服装并重新拍摄场景。
- 规则:AI 不能偷看“答案键”(即软件的新版本)。它必须仅凭指令来推断出结果。
3. 结果:AI 仍然是“初级”
研究人员测试了 13 个最智能的可用 AI 模型(包括来自 Anthropic、OpenAI 和 Google 等公司的最新版本)。他们让这些模型通过了 ROADMAPBENCH 测试。
结果令人清醒:
- 即使是最聪明的 AI(Claude-Opus-4.7),也仅在 39.1% 的任务中取得成功。
- 最弱的 AI 仅在 5.2% 的任务中取得成功。
比喻:
如果你让一名人类初级开发者去改造一所房子,而他们只有 10 次机会中完成了 4 次正确的工作,你会说:“他们还在学习。”这篇论文表明,就复杂的长期软件项目而言,即使是我们最先进的 AI 仍处于“学习”阶段。
4. 他们在哪里失败了?
这篇论文不仅统计了失败次数,还分析了失败的原因。他们发现了一种基于 AI“智能”程度的模式:
- 较强的模型:它们通常能让代码编译(构建)成功,并能编写大部分功能。但它们在细节上失败了。这就像它们建造了一座完美的房子,但门把手装在了错误的一侧,或者电灯开关实际上无法打开灯。它们理解了大局,却忽略了微小而精确的逻辑。
- 较弱的模型:它们甚至常常无法把房子建起来。它们忘了安装屋顶,或者试图把厨房建在地下室。它们在基础构建层面就失败了。
5. 为什么这很重要(根据论文观点)
作者们认为,我们需要停止用“拼写错误修复”来测试 AI,因为这会给我们一种虚假的安全感。仅仅因为 AI 能修复一个漏洞,并不意味着它能构建一个新功能。
ROADMAPBENCH 是一把新的、诚实的尺子。它告诉我们,虽然 AI 正在变得更好,但处理长期、复杂、多步骤的软件项目的能力仍然是一个巨大的、未解决的挑战。目前的 AI 就像一个非常有天赋的学徒,能够很好地遵循几步指令,但当项目变得过于庞大和复杂时,它就会感到困惑。
总结
- 旧测试:“你能修复这个坏掉的单词吗?”(AI:能!)
- ROADMAPBENCH:“这是一个升级整个软件系统的计划。你能做到吗?”(AI:我可以试试,但我可能会搞错细节或忘记某一步。)
- 结论:我们尚未到达那里。AI 很聪明,但它尚未准备好成为重大软件项目的首席工程师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。