← 最新论文
💻 computer science

Why Agentic-PRs Get Rejected: A Comparative Study of Coding Agents

本文分析了五个编程智能体和一个人类基准线下的 654 个被拒绝的拉取请求,旨在识别独特且针对特定智能体的拒绝模式,同时提出了针对 67.9% 的案例中缺失评审反馈这一挑战的启发式方法。

原作者: Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将软件开发想象成一个繁忙、庞大的建筑工地。通常,当一名工人(人类开发者)完成了一个新房间的建造或修复了一个漏水点时,他们会向现场经理提交一份“变更请求”(Pull Request)。经理会查看后说:“太棒了,让我们开工吧,”或者“不行,这行不通。”

最近,一种新型工人来到了现场:AI Agent(人工智能智能体)。这些机器人可以进行规划、构建并提交自己的变更请求,而不需要人类在旁边手把手地指导。本论文研究了当这些 AI 工人提交工作时,与人类工人相比会发生什么。

以下是该研究的详细拆解,使用了简单的类比:

1. 核心问题:“沉默的拒绝”

研究人员调查了来自五种不同 AI 机器人(如 Devin、Claude Code 和 GitHub Copilot)的 654 份被拒绝的变更请求,并将它们与人类提交的请求进行了对比。

最令人震惊的发现是?每三个拒绝案例中就有两个是“沉默”的。

  • 类比: 想象你向一场比赛提交了一幅画作,结果它被直接扔进了垃圾桶。当你问“为什么?”时,评委只是耸了耸肩,转身走开了。
  • 现实情况: 67.9% 被拒绝的 AI 请求没有任何来自审核者的解释。请求被直接关闭了。这使得研究人员很难知道 AI 为什么失败,因为“评委”并没有写下原因。

2. “仅限 AI”的错误

当研究人员确实找到了拒绝的原因时,他们发现 AI 机器人犯了一些人类几乎不会犯的错误。他们发现了七种特定的拒绝原因,这些原因只出现在 AI 身上:

  • “过大的”盒子: 人类有时也会提交大型项目,但 AI 机器人倾向于一次性提交极其庞大、令人难以应付的变更。这就像是一个 AI 试图在一天之内盖起一整座摩天大楼。经理们拒绝这些请求是因为它们规模太大,无法进行妥善审查。
  • “不信任”徽章: 一些经理仅仅因为代码是由机器人制作的就不信任它。他们仅仅因为它是 AI 生成的就拒绝了它,担心它可能不可靠或存在“幻觉”(凭空捏造)。
  • “废料”标签: 在一个案例中,项目所有者拒绝了一个 AI 请求,并将其标记为“SLOP”(一个形容低质量、大规模生产内容的俚语),本质上是在说:“这是机器生成的垃圾。”
  • “实验”失败: 有些 AI 请求提交仅仅是为了测试机器人是否能做到某件事,而不是因为真的有人需要这段代码。这些请求被拒绝是因为它们并非为了实际用途而设计。

3. “机器人特有的”怪癖

不同的 AI 机器人有不同的个性与设置,从而导致了独特的拒绝模式:

  • “Devin 效应”: 其中一个名为 Devin 的特定机器人有一个设置,如果它的请求闲置时间过长,它会自动关闭自己的请求。研究发现,许多 Devin 的拒绝并不是因为代码不好,而是因为机器人自己在 7 天沉默后说:“我腻了,我要关掉这个。”
  • “上下文”陷阱: 一些 AI 机器人被拒绝是因为它们无法看到完成工作所需的“私有”文件或数据。这就像一个机器人试图修理一把锁,却被锁在了存放钥匙的房间之外。

4. 解决方案:“垃圾过滤器”

由于如此多的拒绝都缺乏注释(即“沉默的拒绝”问题),研究人员意识到他们需要一种方法来清理数据,以便进行研究。他们创建了一个简单的过滤器(一套规则),用来猜测哪些拒绝是真正的“沉默”拒绝,哪些可能隐藏着线索。

  • 过滤器规则: 他们寻找符合以下特征的请求:
    1. 由提交者本人关闭(自我关闭)。
    2. 关闭速度很快(例如,在 7 天内)。
    3. 关闭时没有任何人留下评论。
  • 结果: 通过使用这些规则,他们可以过滤掉“噪音”(那些沉默的、无助的拒绝),并将精力集中在那些经理确实解释了“为什么”说“不”的案例上。这有助于未来的研究人员获得更清晰的图景,了解到底哪里出了问题。

总结

论文得出结论:虽然 AI Agent 构建代码的速度比以往任何时候都快,但它们被拒绝的频率比人类更高。这不仅仅是因为它们的代码有 Bug,更是因为它们:

  1. 提交的东西过于庞大或复杂。
  2. 触发了人类经理的不信任感。
  3. 拥有人类所没有的独特“机器人行为”(如自动关闭)。
  4. 经常在没有人解释原因的情况下被拒绝,导致难以从错误中学习。

这项研究提供了一个“过滤器”,帮助清理这些数据,以便我们更好地理解如何让这些 AI 工人变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →