← 最新の論文
💻 computer science

Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance

この実証研究は7,156件のプルリクエストを分析し、Devinが採用において特有の肯定的な時間的傾向を示す一方で、成功率に影響を与える支配的要因はタスクの種類であり、OpenAI Codexが単一のエージェントがすべてのタスク種類で卓越するわけではないにもかかわらず、多様なカテゴリにわたって最も一貫した高いパフォーマンスを発揮していることを明らかにする。

原著者: Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

公開日 2026-05-08
📖 1 分で読めます☕ さくっと読める

原著者: Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

忙しい建設現場のマネージャーになったと想像してください。人間の労働者の代わりに、コードの作成、バグの修正、ドキュメントの作成ができる 5 種類の異なる AI ロボット(OpenAI Codex、GitHub Copilot、Devin、Cursor、Claude Code)がいます。あなたの目標は、どのロボットが現場の検査官(「プルリクエスト承認率」)から最もよく承認されるかを判断することです。

この論文は、数ヶ月にわたってこれらの 5 つのロボットを比較した詳細な成績表のようなものです。以下に、彼らの発見を簡単に説明します。

1. 「ロボット」よりも「仕事の種類」が重要

最大の驚きは、どのロボットが最も速かったかではなく、彼らがどのような種類の仕事をしていたかでした。

  • 比喩: ロボットに「詩を書く」よう頼むのと、「橋を建てる」よう頼むのを想像してください。詩を書く方が、橋を建てるよりも承認されやすいものです。
  • 発見: この論文は、タスクの種類が最も重要な要因であることを発見しました。
    • ロボットにドキュメント作成(マニュアルやコメントの作成など)を頼んだ場合、承認率は**82%**でした。
    • 彼らに新機能の構築(家への新しい部屋の追加など)を頼んだ場合、承認率は**66%**に留まりました。
  • 教訓: ロボットを全体のスコアだけで判断すると、騙されてしまうかもしれません。主に簡単な「詩を書く」ようなタスクをこなすロボットは、たとえ「橋を建てる」のが下手でも、スターのように見えるでしょう。

2. すべてのカテゴリーで勝るロボットは存在しない

すべてにおいて「最高のロボット」は存在しません。それぞれに固有のスーパーパワーがあります。

  • OpenAI Codex: これは信頼できる万能選手です。ほぼすべての種類の仕事で一貫して良好なパフォーマンスを発揮し、決してまともなスコアを下回ることはありませんでした。
  • Claude Code: これはドキュメントの専門家です。マニュアルの作成や新機能の作成において最も優れていましたが、この研究では他の多くのタスクを行わなかったため、注意が必要です。
  • Cursor: これはバグ修正者です。壊れたものを直すという点において、トップのパフォーマンスを発揮しました。
  • Devin: このロボットは最初はゆっくりでしたが、時間とともに向上しました。週ごとに明確な改善の傾向を示し、承認率を約 60% から 80% へと引き上げた唯一のロボットでした。

3. 時間は変化をもたらす(ただし全員に当てはまるわけではない)

研究者たちは、これらのロボットが学習したり改善したりするかどうかを見るために、数ヶ月間これらを見守りました。

  • 比喩: 毎週テストを受ける学生だと考えてください。
    • Devinは、一生懸命勉強して毎週スコアを上げていく学生のようです。
    • 他のロボットたちは、もともと賢い学生のようです。最初は高く、その後も高いままですが、時間の経過とともに大きな改善は見せません。彼らは一貫性を保つだけです。

4. なぜ「グローバルスコア」は誤解を招くのか

この論文は、ロボットに対する単一の「平均スコア」を見ることへの警告を発しています。

  • 比喩: 2 人のシェフを想像してください。シェフ A は誰もが好きなシンプルなサラダだけを調理します。シェフ B は、完璧に仕上げることが難しい複雑でスパイシーなシチューだけを調理します。「平均顧客評価」だけを見ると、シェフ A の方が優れているように見えるかもしれません。しかし、それはシェフ A が優れたシェフだということではなく、単に彼に与えられた材料が簡単だっただけです。
  • 発見: 研究者たちは、公平な比較を行うために、ロボットを彼らが行った仕事の種類ごとに分ける必要がありました。そうすると、「最高のロボット」は、バグ修正、テストの作成、ドキュメントの更新のいずれの作業かによって変わることがわかりました。

まとめ

AI コーディングアシスタントを雇いたい場合、「誰が最高か?」とだけ聞いてはいけません。

  • バグ修正が必要な場合は、CursorまたはOpenAI Codexを検討してください。
  • 新機能やドキュメントが必要な場合は、Claude CodeまたはOpenAI Codexが最良の選択かもしれません。
  • 時間とともに学習し改善しているように見えるロボットを望むなら、Devinに注目すべきです。

主な教訓は、文脈が王様であるということです。どの仕事を任されているかを正確に知らなければ、ツールを評価することはできません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →