← 最新の論文
💻 computer science

Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study

11,000 件を超える自律的プルリクエストに関するこの実証的研究は、AI コーディングエージェントの評価をマージまたは却下という結果のみに依存することは誤りを招くことを明らかにしており、なぜなら却下の多くはエージェントの誤りではなくワークフローの制約に起因し、また多くのマージには相当な人間の介入を必要とするため、レビュー行動に基づいた相互作用を考慮した評価指標が必要となるからである。

原著者: Sien Reeve O. Peralta, Fumika Hoshi, Hironori Washizaki, Naoyasu Ubayashi, Inase Kondo, Yoshiki Higo, Hiroki Mukai, Norihiro Yoshida, Kazuki Kusama, Hidetake Tanaka, Youmei Fan

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Sien Reeve O. Peralta, Fumika Hoshi, Hironori Washizaki, Naoyasu Ubayashi, Inase Kondo, Yoshiki Higo, Hiroki Mukai, Norihiro Yoshida, Kazuki Kusama, Hidetake Tanaka, Youmei Fan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

にぎやかでハイテクなキッチン、そこではロボット(AI コーディングエージェント)が次々と新しい料理(コードの変更)を調理し、ヘッドシェフ(人間のレビューア)に提供して承認を求めている様子を想像してください。その目標は、これらの料理をレストランのメニューに追加すること(ソフトウェアにマージすること)です。

長らく、人々はこれらのロボットシェフの良し悪しを、単に最終結果を見て判断してきました:「料理は提供された(マージされた)のか、それともゴミ箱に捨てられた(却下された)のか?」

この新しい研究は、最終結果だけを見ることは、料理がキッチンから出たかどうかだけでシェフを判断し、「なぜ」を問わないことに似ていると主張しています。研究者たちは、「はい/いいえ」というラベルでは物語が非常に不完全であることを発見しました。

以下に、彼らの発見をシンプルな比喩に分解して示します。

1. 「ゴミ箱」が常にシェフのせいとは限らない

ロボットの料理が却下された場合、私たちは往々にしてロボットが食べられないものを調理した(コーディングエラー)と仮定します。しかし、この研究では、却下のうち実際にロボットがレシピを間違えたのは**約 36%**に過ぎないことがわかりました。

残りの 3 分の 2 は、ロボットの調理技術とは無関係な理由で却下されました:

  • 「間違った夜」の問題(31%): 料理は完璧でしたが、キッチンがすでに閉まっていたか、シェフがその夜には別の料理を注文していました。技術用語で言えば、コードは問題なかったものの、プロジェクトのワークフローでは必要なかったり、重複していたりしました。
  • 「沈黙の扱い」(33%): 料理は返却されたものの、シェフは何も言いませんでした。皿の上に理由を説明するメモはありません。ロボットが失敗したのか、それともシェフが単に無視しただけなのか、判別できません。

要点: 却下を単に「失敗」としてカウントするだけでは、実際には単なるタイミングの悪さや沈黙に過ぎないものを、ロボットに不当に責任を負わせることになります。

2. 「提供された」料理が常にロボットだけの成果とは限らない

料理が提供(マージ)された場合、私たちはロボットが最初から最後まで完璧に調理したと想定します。しかし、この研究では、これらの「成功」のうち**約 15%**は、料理を提供する前に人間シェフが介入して修正を必要としたことがわかりました。

  • 「味見」(フィードバックループ): ロボットがメインディッシュを調理しましたが、シェフが味見をして「塩味が足りない」と言い、ロボットが修正しました。
  • 「盛り付け」(人間の介入): ロボットが料理を調理しましたが、シェフが提供する前に飾り付けを並べ替えたり、見栄えを修正したりする必要がありました。

実際、一部のロボット(Copilot や Devin など)では、他のロボット(Codex や Cursor など)に比べて、人間シェフがプロセスに関与する頻度がはるかに高く、後者の場合はほとんどやり取りなしで料理が提供されたように見えました。

要点: 「マージ」というラベルが常にロボットが全作業を単独で行ったことを意味するわけではありません。時には、人間が最後に重い荷物を担いで、それが機能するようにしたのです。

3. 異なるロボット、異なるキッチン

この研究では、異なるロボットがどの「キッチン」(ソフトウェアプロジェクト)にいるかによって、異なる振る舞いを示すことに気づきました。

  • 一部のロボットは、厳格なルールがあり、絶えずフィードバックを与える忙しいシェフがいるキッチンに送られました。これらのロボットは却下が多く、人間の助けも多かったです。
  • 他のロボットは、シェフがより放任主義的なキッチンに送られ、より多くの「沈黙」した承認や却下につながりました。

大きな結論

この論文は、チケットに付いた「提供」または「却下」のスタンプだけを見てロボットシェフの技量を判断することはできないと結論付けています。

  • 却下は、多くの場合、調理の下手さではなく、ワークフロー上の問題や沈黙に過ぎません。
  • マージには、しばしば人間シェフが提供する前に皿を修正する作業が含まれます。

これらの AI エージェントがどれほど優れているかを真に理解するためには、最終結果だけでなく、ロボットと人間の間の対話——コメント、修正、決定の背景にある理由——を見る必要があります。そうしなければ、全体像を語らないメニューに基づいてシェフを判断することになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →