← 最新论文
🤖 AI

Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub

本文通过对 GitHub 上 33,000 个 AI 生成的拉取请求进行大规模实证研究,结合定量分析与定性分类法,揭示了虽然文档和持续集成(CI)任务的成功率最高,但智能体失败是由代码变更规模过大、CI 失败以及与人类评审者预期不一致等因素驱动的。

原作者: Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个繁忙的建筑工地,人类建筑师和工程师正在建造软件。最近,一群新的 AI 机器人(被称为“编程智能体”)来到了这里。这些机器人不仅仅是向人类低声提供建议;它们现在正在建造整个房间、粉刷墙壁,甚至提交自己的蓝图(称为“拉取请求”或 “PR”)以求被添加到建筑中。

你提供的这篇论文就像是一场法医调查,旨在研究为什么有些由机器人建造的房间会被批准并添加到建筑中,而另一些则会被拒绝并拆除。研究人员查看了来自 GitHub 上五个不同机器人团队的 33,000 多份蓝图,以弄清楚机器人在哪里出了问题。

以下是他们的研究结果,使用了简单的类比:

1. “容易获胜” vs. “难以推销”

研究人员发现,机器人在处理简单、常规的琐事方面表现出色,但在处理复杂、高风险的任务时却很吃力。

  • 机器人的超能力: 在处理文档、修复建筑进度表 (CI/Build) 以及更新规则方面,它们就像专业的园丁。这些任务的通过率约为 80-90%。这就像机器人非常擅长扫地或重新粉刷篱笆。
  • 机器人的弱点: 它们在**修复损坏的引擎(缺陷修复)提高建筑运行速度(性能优化)**方面表现得很糟糕。这些任务被拒绝的频率最高。这就像机器人试图修理漏水的管道,结果却淹没了地下室。

2. “无法掌控”的问题

当机器人提交一份被拒绝的蓝图时,通常是因为它试图一次性做太多事情

  • 类比: 想象你要求一个机器人“修理厨房”。如果它回来提交一个计划,要重建整个房子、移动地基并重新设计屋顶,人类建筑师会说:“不行,这太多了。”
  • 研究发现: 被拒绝的蓝图涉及的代码行数更多,且触及了更多的文件。机器人往往表现得“过于热情”,会做出巨大的改动,从而让负责审核的人类感到应接不暇。

3. “测试失败”警报

在人类建筑师查看蓝图之前,建筑物的自动化安全系统会进行检查。

  • 研究发现: 被拒绝的蓝图经常未能通过这些自动化安全检查(CI 构建)。这就像机器人提交了一个未通过消防安全检查的计划。如果机器人的代码破坏了测试,人类通常甚至不会仔细查看它。

4. 人类为什么说“不”?(4 个原因)

研究人员深入调查了 600 份被拒绝的蓝图,以找出人类说“不”的原因。他们发现了四个主要原因,按发生频率从高到低排列:

  • 原因 #1:“无人问津” (38%)

    • 发生了什么: 机器人提交了一份蓝图,但从未有人查看过它。人类太忙了,或者机器人被忽视了,请求就一直搁置在那里,直到被自动关闭。
    • 类比: 机器人把一张便条留在了建筑师的桌子上,但建筑师去度假了,便条最终被扔进了垃圾桶。
  • 原因 #2:“重复预约” (31%)

    • 发生了什么: 机器人试图修复一个别人已经在另一份蓝图中修复过的问题。
    • 类比: 机器人提交了一个建造新桥梁的计划,却没意识到另一支团队昨天已经开始建造那座一模一样的桥了。
  • 原因 #3:“残缺的蓝图” (22%)

    • 发生了什么: 代码本身是损坏的,未能通过测试,或者并没有真正解决问题。
    • 类比: 机器人造了一扇门,但门打不开,或者门是用一碰就会碎的玻璃做的。
  • 原因 #4:“错误的指令” (2%)

    • 发生了什么: 机器人忽略了人类的要求,或者违反了法律规则(如版权)。
    • 类比: 人类要求机器人“把墙涂成蓝色”,但机器人把它涂成了红色,并且使用的油漆是不符合建筑保险规定的。

核心结论

论文总结道,虽然这些 AI 机器人写代码的能力正在提高,但它们仍然不擅长察言观色

它们不知道何时该停止(它们做的改动太大),不知道已经完成了什么(它们会重复工作),并且在遵循复杂的指令方面很吃力。为了在未来取得成功,这些机器人需要学会变得规模更小、目标更集中,并且在请求人类许可进行建造之前,先更好地检查自己的工作是否确实被需要

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →