A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
本文介绍了 SWE-RPG,这是一个用于评估编程智能体的统一基准测试,它不仅评估最终补丁的成功率,还评估诸如需求澄清和实现规划等中间推理步骤,从而揭示了隐式需求恢复是限制当前智能体在仓库级任务上性能的主要瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你拥有一个超级聪明的机器人助手,它能够编写计算机代码。你给它一个简单的指令,比如“修复这个游戏中的漏洞”或“增加一个新关卡”,它就会开始工作。这就是**AI 编程智能体(AI coding agents)**的梦想。长期以来,科学家们一直在通过给这些机器人布置任务并观察最终结果是否有效来测试它们。如果游戏运行正常且没有崩溃,机器人就会获得一颗金星;如果游戏崩溃了,机器人就会得到一个红色的 X。
但问题在于:一个红色的 X 并不能告诉你机器人为什么失败了。是它误解了你的指令?是它制定了一个糟糕的计划?还是它仅仅写错了代码?这就像一名学生数学考试不及格,只得到了一个“0/10”的分数,却看不到老师关于错在哪里里的评语。为了让这些机器人变得真正更好,我们需要看到它们的思考过程,而不仅仅是最终答案。这正是这篇论文所探讨的核心问题:我们如何停止仅仅对最终补丁进行评分,转而开始诊断机器人的“大脑”?
于是有了 SWE-RPG,这是一个旨在窥探机器人思维的新型、超详细的测试。研究人员利用来自 31 个不同软件项目的 163 个真实世界编程任务构建了一个基准测试(标准化测试)。他们不仅检查代码最终是否有效,还为机器人旅程中的每一个步骤都创建了“黄金真相(Gold Truth)”参考。这就像拥有一本大师级厨师的食谱,它不仅展示了最终的菜肴,还列出了厨师必须猜测的每一种隐藏配料、每一个烹饪步骤,以及机器人可能偏离轨道的准确时刻。
研究人员将三个流行的编程智能体(分别命名为 Claude Code、Codex 和 OpenCode)投入测试,并将它们与六个不同的“大脑”模型(大语言模型,LLMs)进行配对。结果却是一个现实的警示。即使是最优秀的机器人也只解决了大约 31.5% 的任务。这意味着它们失败了近三分之二!但 SWE-RPG 的真正魔力在于弄清楚它们是在哪里失败的。研究发现,最大的瓶颈其实不在于编写代码,而在于理解隐藏规则。大约 24.5% 到 46.0% 的失败是因为机器人无法理解“隐性需求”——即那些你没有明说、但机器人为了正确完成工作所必须知道的事情。
例如,如果你要求机器人“修复 TSV 导入功能”,它可能会修复代码,但却不小心破坏了 CSV 导入功能,因为它没意识到这两者是相关的。这项研究表明,要让这些智能体真正变得有用,我们不能仅仅专注于让它们写出更快的代码,而应该开始教它们如何成为更好的侦探,具备读懂用户请求“弦外之音”的能力。论文总结道,虽然这些智能体令人印象深刻,但它们在处理软件开发中复杂的人性化方面仍然感到吃力,而 SWE-RPG 正是我们帮助它们导航这些棘手隐藏需求所需的新地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。