← 最新论文
💻 computer science

Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

本专题论文认为,AI 编程智能体的可靠性更多地取决于其周围的系统基础设施——例如执行环境、状态管理和验证——而非仅仅取决于模型能力本身,并提供了一个综合框架及包含 206 条可靠性记录的目录,以指导这些智能体作为集成系统的评估与运行。

原作者: Stephanie Jarmak

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Stephanie Jarmak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一场魔术表演,一名机器人助手正试图修理一个坏掉的玩具。你看到机器人拿起一把螺丝刀,转动了一个螺丝,然后玩具就开始正常工作了。看起来这个机器人简直是个天才。但如果这个机器人其实只是在瞎猜,而玩具之所以开始工作,仅仅是因为内部的一个隐藏弹簧恰好跳回了原位呢?或者,如果机器人看的其实是去年那个玩具的照片,而不是眼前这个坏掉的玩具呢?在计算机科学领域,特别是人工智能(AI)与软件工程领域,我们正在构建这些“机器人助手”(称为编码智能体/coding agents)来编写和修复计算机代码。长期以来,人们一直认为机器人的“大脑”——即 AI 模型——是唯一重要的部分。如果大脑足够聪明,机器人就会很可靠。但本文指出,大脑只是一个庞大机器中的一部分。真正的魔力(或真正的灾难)发生在围绕着大脑的整个“系统”中:它使用的工具、它保存的记忆、它通过的安全检查,以及监督它的观察者。如果系统一团糟,即使是最聪明的大脑也会失败;而如果系统稳固,一个简单的脑子也能做出惊人的成就。

这篇由 Stephanie Jarmak 撰写的论文,就像是一本为构建这些 AI 编码系统而准备的庞大维修手册和侦探指南。作者在 2026 年 7 月和 8 月进行了一项结构化审查,分析了数百项研究、真实的工程日志以及她自己的实验,以弄清楚为什么 AI 编码智能体有时会失败,即便它们在纸面上看起来表现得非常出色。其主要发现是一个警钟:你不能仅仅通过观察 AI 编码智能体的最终得分或它的“大脑”来判断它。 相反,你必须观察围绕着它的整个“支架”。论文引入了一个名为**“可靠性依赖链”(reliability dependency than)**的概念。把它想象成一排多米诺骨牌。如果第一块骨牌(衡量成功的方式)摇摇欲坠,第二块骨牌(评分系统)就会倒下,进而撞倒第三块(恢复计划),以此类推。如果这条链条中的任何一个环节薄弱,整个系统就会变得不可靠,无论 AI 有多聪明。

本文反对那种认为我们只需不断让 AI 模型变得更大、更聪明就能解决所有问题的观点。它指出,许多“失败”实际上并不是 AI 的错,而是由围绕它的系统造成的。例如,如果给 AI 分配了一项任务,但系统没有给它读取正确的文件的权限,AI 就会失败。这是 AI 的错吗?不,是系统的错。论文还警告不要“操纵”系统。如果你在一个 AI 已经见过的谜题集上测试它,它可能会得到满分,但这并不意味着它能解决的谜题。作者展示了许多公开得分之所以虚高,是因为 AI 已经“背诵”了答案,或者是因为测试不够严格。

为了解决这个问题,论文提出了一种构建和测试这些智能体的新方法。这不在于寻找一个“完美的”AI 模型,而在于构建一个稳健的工厂。想象一个机器人制造汽车的工厂。如果机器人掉落了一个零件,工厂不应该假装没发生过。它需要一个系统来捕捉掉落的情况、记录下来,并尝试重新开始而不损坏汽车。论文提供了 206 项“可靠性记录”——基本上是确保系统安全的规则和工具。这些包括:

  • 多次运行测试: 就像抛一次硬币并不能说明它是否公平一样,运行 AI 一次并不能说明它是否可靠。你必须运行很多次才能看到它的稳定性。
  • 检查工具: 确保 AI 没有使用它不该使用的工具,或者确保它使用的工具确实在正常工作。
  • 人类监督: 让一个人来检查工作,但只在正确的时刻进行,以免人类感到不堪重负。
  • 安全恢复: 如果 AI 崩溃或出错,系统应该能够重启,而不会丢失进度或造成更多破坏。

作者非常谨慎,并没有声称他们已经“解决”了所有问题。他们承认,他们的一些想法是基于实验的有力证据,而另一些则是基于关于系统如何运作以避免灾难的逻辑推理。他们并不声称这些规则适用于世界上每一个 AI,但他们为工程师测试自己的系统提供了一个坚实的框架。他们强调,如果你想信任一个为银行或医院编写代码的 AI,你不能只看它的测试分数。你必须观察整个机器,检查那些多米诺骨牌,并确保系统被构建为能够安全地处理错误。

简而言之,这篇论文告诉我们,构建一个可靠的 AI 编码器,与其说是寻找一个超级天才机器人,不如说是围绕它构建一个超级可靠的工厂。这是一份指导工程师停止猜测并开始测量的指南,确保当 AI 说“我修好了”时,它真正的意思是“我修好了,而且我可以证明这一点”。论文总结道,AI 编码的未来不仅仅在于更聪明的大脑,更在于围绕着它们的更聪明、更安全且更诚实的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →