← 最新论文
💻 computer science

Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance

这项实证研究分析了 7,156 个拉取请求,揭示出尽管 Devin 在采纳率上呈现出独特的积极时间趋势,但任务类型才是影响成功率的主导因素,OpenAI Codex 在各类任务中均表现出最稳定的高性能,尽管没有任何单一智能体在所有任务类型上均表现卓越。

原作者: Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家繁忙建筑工地的经理。你手下没有人类工人,而是有五款不同的AI 机器人(OpenAI Codex、GitHub Copilot、Devin、Cursor 和 Claude Code),它们能够编写代码、修复漏洞并撰写文档。你的目标是看看哪款机器人在工地检查员(即“拉取请求接受率”)那里最能顺利通过工作验收。

这篇论文就像一份详细的成绩单,比较了这五款机器人在数月内的表现。以下是研究发现的简明解读:

1. “工作类型”比机器人本身更重要

最大的惊喜并非哪款机器人速度最快,而是它们正在做什么类型的工作

  • 类比:想象一下,让机器人去“写一首诗”与去“建一座桥”。写诗通常比建桥更容易获得通过。
  • 发现:论文指出,任务类型是最重要的因素。
    • 当机器人被要求处理文档(如编写手册或注释)时,它们的通过率高达82%
    • 当它们被要求构建新功能(如给房子加一个新房间)时,通过率仅为66%
  • 启示:如果仅凭总体评分来评判机器人,你可能会被误导。一款主要从事简单“写诗”任务的机器人看起来会像超级明星,即使它在“建桥”方面表现糟糕。

2. 没有一款机器人能在所有类别中胜出

不存在一款适用于所有情况的“最佳机器人”。每款机器人都有其特定的超能力。

  • OpenAI Codex:这是可靠的万金油。它在几乎每种工作类型中表现都稳定出色,从未跌落到及格线以下。
  • Claude Code:这是文档专家。它在编写手册和创建新功能方面表现最佳,但我们必须谨慎,因为在这项研究中它并未承担太多其他类型的任务。
  • Cursor:这是漏洞修复者。在修复损坏内容方面,它是表现最顶尖的。
  • Devin:这款机器人起步较慢,但随时间推移表现越来越好。它是唯一一款显示出每周清晰进步趋势的机器人,通过率从约 60% 攀升至 80%。

3. 时间会改变一切(但并非对所有人如此)

研究人员观察了这些机器人数月,以查看它们是否有所学习或进步。

  • 类比:这就像一名学生每周参加一次考试。
    • Devin 就像那个努力学习、每周分数都不断提高的学生。
    • 其他机器人 则像那些原本就很聪明的学生;他们起步分数高,并保持高位,但随时间推移并未显示出太多进步。它们只是保持稳定。

4. 为什么“全球评分”具有误导性

论文警告不要只看机器人的单一“平均分数”。

  • 类比:想象两位厨师。厨师 A 只烹饪简单的沙拉(大家都喜欢)。厨师 B 只烹饪复杂、辛辣的炖菜(很难做对)。如果你只看“平均顾客评分”,厨师 A 可能看起来更好。但这并不意味着厨师 A 是更优秀的厨师;这仅仅意味着他们被分配了更简单的食材。
  • 发现:研究人员必须根据机器人所做的工作类型将它们分开,才能获得公平的对比。一旦这样做了,他们就发现,所谓的“最佳”机器人会根据工作是修复漏洞、编写测试还是更新文档而发生变化。

总结

如果你想聘请一位 AI 编程助手,不要只问:“谁是最好的?”

  • 如果你需要漏洞修复,请关注 CursorOpenAI Codex
  • 如果你需要新功能或文档Claude CodeOpenAI Codex 可能是你的最佳选择。
  • 如果你想要一款看起来随时间不断学习和进步的机器人,Devin 是值得关注的那一款。

主要结论是:情境为王。如果不确切知道它被要求做什么工作,你就无法评判一个工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →