← 最新论文
💻 computer science

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

本文通过一项受控消融研究表明,持久性上下文文件(例如 AGENTS.md)并不能显著提高编程智能体的正确性,因为失败源于实现能力的缺陷而非仓库知识的缺失,同时本文还通过智能体特定任务难度的差异解释了此前矛盾的研究结果。

原作者: Prakhar Khatri

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Prakhar Khatri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字图书管理员 vs. 建筑大师

想象一下,你正试图教一个超级聪明但完全是新手型的机器人助手,如何在巨大的、杂乱无章的工作坊里修理一台复杂的机器。你有两种主要的方法来帮助它。首先,你可以给它一份工作坊的详细地图、一份关于如何使用工具的规则清单,以及一份关于这台机器通常行为方式的指南。在计算机编程的世界里,这被称为“上下文文件”(通常命名为 AGENTS.mdCLAUDE.md)。这就像是在机器人的桌上贴了一张便签,上面写着:“记住,我们在这里总是使用红色的螺丝!”

第二种方法,你可以直接让机器人走进工作坊,通过观察机器本身来自己摸索。

长期以来,开发这些 AI 编程助手的人一直痴迷于第一种方法。他们花费大量时间编写这些说明手册,认为如果机器人能更好地“了解”规则,它就能写出更好的代码。但这里有一个大问题:阅读手册真的能让机器人变成更好的建筑师吗?还是仅仅让机器人看起来更有信心,却依然犯着同样的错误?这就是一项新研究旨在解决的谜题,它测试了这些数字说明手册究竟是让 AI 编程变得更强大的魔法钥匙,还仅仅是一堆多余的废纸。

大规模手册测试

在这项研究中,研究人员扮演了严厉的科学老师的角色。他们选取了当今最智能的两个 AI 编程代理——一个来自 Anthropic 公司(名为 Claude),一个来自 OpenAI(名为 Codex)——并给了它们一系列现实世界的编程挑战。这些不是虚假的家庭作业题,而是从真实的软件项目中提取的实际任务,比如修复云工具包中的漏洞或调整一个编译器。

为了测试“手册”是否有帮助,他们为每个机器人分别进行了三次相同的任务运行:

  1. “无笔记”运行: 机器人得到了任务,但没有手册。
  2. “全时开启”运行: 手册全程都塞进机器人的大脑里。
  3. “按需索取”运行: 机器人拥有一个组织有序的小型笔记库,如果它卡住了,可以选择阅读其中的内容。

他们总共进行了 288 次实验,并将最终生成的代码与一个隐藏的“金标准”测试进行对比,以检查代码是否真的有效。

大惊喜:手册无法修补拙劣的建造

研究结果让那些编写手册的人感到有些震惊。研究发现,拥有上下文文件对于 AI 是否能完成任务几乎没有任何影响

无论机器人拥有的是手册、笔记库还是什么都没有,成功率都基本保持不变。对于 Claude 机器人来说,手册对结果的影响偏差不超过 10 个百分点。对于 Codex 机器人来说,偏差也不超过 15 个百分点。在科学领域,我们称之为“无效结果”(null result)——这意味着我们认为重要的东西,其实并不重要。

研究人员进行了更深入的调查,以找出手册为何没有起到作用。他们观察了那些机器人差一点就答对但最终失败的情况。他们发现,机器人失败并不是因为缺少手册中的某个事实(比如“不要使用红色螺丝”),而是因为缺乏建造技能

可以这样理解:如果你给一位天才建筑师一份完美的房屋蓝图,但他们却不知道如何铺设砖块或连接电灯开关,那么蓝图也救不了他们。研究中的 AI 代理擅长阅读,但在实际“动手做”的过程中却栽了跟头。它们在设计功能、选择合适的模式以及正确连接各个部件方面表现挣扎。手册无法教会它们如何建造,它只能告诉它们建筑长什么样。

“并非一成不变”的转折

还有另一个有趣的发现。研究人员注意到,对于一个机器人来说极其简单的任务,对于另一个机器人来说可能异常困难,反之亦然。这就像有些人擅长解数学谜题但非常不擅长玩杂耍,而他们的朋友则恰恰相反。

因此,这项研究表明,之前的研究可能产生了误导。如果一位科学家在任务对机器人来说很简单的环境下测试手册,而另一位科学家在任务很难的环境下测试,他们得到的结果就会不同。手册可能真正发挥作用的“甜点区”(sweet spot)对每个 AI 大脑来说都是不同的。

手册到底有没有用?

那么,手册完全没用吗?也不完全是,它们的益处非常具体且微小。

  • 速度与成本: 在一个特定的项目中,当机器人拥有手册时,它停止运行不必要的、缓慢的测试。这就像机器人读到一张告示说“此测试需耗时 20 分钟”,于是决定跳过它。这节省了时间,但并没有让代码变得更好。
  • “差一点成功”测试: 研究人员进行了一项特别实验,他们选取了那些机器人差一点就解决的任务,并给它们提供高质量的真实手册,看看能否推动它们跨越最后一步。结果并没有。即使有了最好的指令,机器人仍然无法将“差一点成功”转化为“成功”。

总结

研究结论认为,对于所测试的这些 AI 编程代理而言,花费大量时间编写完美的指令手册(AGENTS.md)可能并不会让它们写出更好的代码。问题不在于机器人不知道规则,而在于它们需要提高实际构建软件的技艺。

虽然这些手册可能有助于机器人工作得更快,或者通过避免坏习惯来节省一点点成本,但它们并不是修复破碎代码的魔杖。如果你想让你的 AI 助手成为一个更好的建筑师,研究表明,与其仅仅给它更多的规则去读,不如通过将任务分解为更小的步骤,或者给它更多关于如何构建的优秀范例,这样可能会获得更好的效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →