Early Adoption of Agentic Coding Tools by GitHub Projects
本研究は、2,300のGitHubリポジトリにわたる25,000件以上のエージェント生成プルリクエストを分析し、エージェントによるコーディングツールの集中的な採用は依然として少数のプロジェクトのサブセットに集中しているものの、その統合の成功は単一の人間による監視モデルに大きく依存しており、プロジェクトの規模や生産性によって大きく異なることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ソフトウェア開発の世界を、何百万もの人々がコードの一行一行を通じてデジタルな超高層ビルを建設している、巨大で活気ある建設現場だと想像してみてください。長年、この現場の作業員たちは、「スマートアシスタント」――次のレンガを提案したり、ぐらついた壁を直すのを手伝ったりするツール――を使用してきました。しかし最近、新しい種類の作業員がやってきました。それが「エージェンティック(agentic)」なツールです。これらを、単にささやきで提案をするアシスタントではなく、半自律的なインターンと考えてみてください。これらのデジタル・インターンは、設計図を見て、新しい部屋を丸ごと作り上げ、電気がつくかどうかテストし、さらにはプロジェクトマネージャーのドアを叩いて「これを入れてもいいですか?」と尋ねることさえできるのです。この変化は、ソフトウェアの構築スピードを加速させる可能性があるため刺激的ですが、同時に大きな問いも投げかけています。それは、「実際の人間によるチームは、これら新しいデジタル・インターンと実際にどのように協力していくのか?」という問いです。彼らは建物の鍵を丸ごと預けてしまうのでしょうか、それとも厳格に制御し続けるのでしょうか?これは、オープンソース・プロジェクトが、この新しい人間とエージェントのパートナーシップのルールをどのように解明しようとしているかを描いた物語です。
論文『GitHubプロジェクトにおけるエージェンティックなコーディングツールの早期採用』は、数千のソフトウェア・プロジェクトがこれらの新しいデジタル・インターンをどのように扱っているかを調査する、探偵小説のような役割を果たしています。研究者たちは、膨大なデータの山を調査しました。2,361の異なるGitHubプロジェクトから集められた25,264件の「プルリクエスト」(これは基本的に、新しいコードを追加するための正式なリクエストのことです)です。彼らは特定の3ヶ月間(2025年5月、6月、7月)に焦点を当て、3つの人気のあるAIコーディング・エージェント、Copilot、Codex、Claude Codeを追跡しました。彼らの目的は、主に3つの質問に答えることでした。どれだけのプロジェクトが実際にこれらのツールを使用しているのか? これらのツールを使用しているプロジェクトの生産性はどの程度なのか? そして最も重要なのは、人間とエージェントはどのように協力しているのか? ということです。
以下に、その調査結果を明らかにします。それは、皆さんが予想するよりも少し複雑なものです。
第一に、研究者たちは、これらのツールが何千もの場所で使用されている一方で、「重労働」は建設現場のごく一部で行われていることを発見しました。もしランダムにプロジェクトを選んだとしたら、その中央値(真ん中の点)は、その3ヶ月間に生成されたエージェントによるリクエストがわずか1〜2件でした。これは、新しい電動工具が存在していても、ほとんどの建設クルーは月に1、2回しかそれを使っていない状態を見つけるようなものです。この研究は、「集中的な採用」がいまだに比較的限定されたプロジェクトのサブセットに集中していることを示唆しています。しかし、ここにはひねりがあります。チームの規模が非常に重要になるのです。小規模なプロジェクト(貢献者が1〜5人)は、より積極的に飛び込もうとしていました。彼らはチームメンバーのツール使用率が高く、平均して、大規模な企業規模のプロジェクトよりもはるかに多くのエージェント活動を生成していました。実際、小規模プロジェクトはリポジトリあたり平均約50件のエージェント・リクエストを生成していましたが、中規模および大規模プロジェクトの平均はわずか5〜7件でした。小さなクルーはデジタル・インターンを自由に走らせることを厭わない一方で、大きなチームは依然として非常に慎重であるようです。
第二に、チームは生産性について、「一人あたり実際にどれだけのコードが構築されているのか?」という問いを検討しました。彼らは、人間の開発者が3ヶ月間に約36件のリクエストを処理できるという業界のベンチマークと比較しました。結果は、ほとんどのプロジェクトがこのラインを下回っていることを示しました。わずか2,361プロジェクトのうち、わずか25プロジェクト(約1%)だけが、この36リクエストという基準を超えることができました。これは、ツールには能力があるものの、ほとんどのチームはまだエージェントによる膨大な量の仕事を生成できていないことを示唆しています。このラインを超えた数少ないプロジェクトは、主に小規模なものであり、ツールを用いた高い生産性は、まだ完全には理解されていない特定のプロジェクト条件に依存していることを示しています。
最後に、研究は人間とエージェントの間の「ダンス」について調査しました。実際に誰が指揮を執っているのでしょうか? 答えは圧倒的に一人です。ほぼ79%のケースにおいて、単一の人間開発者がエージェントの作業をレビューし、かつその作業をプロジェクトにマージ(統合)していました。これは「ソロ・オーバーサイト(単独監視)」モデルです。教師が生徒の宿題を採点し、他の同僚に意見を求めることなく、すぐに成績表に記入する様子を想像してみてください。大規模なプロジェクトでは、もう少しチームワークが見られ(複数のレビュアーが存在した)、より多くのレビューが行われていましたが、大多数の場合、人間とエージェントのコラボレーションは一対一の関係でした。この論文は、これほど強力なエージェントであっても、レビューし承認するという人間の役割は中心的であり、チームベースのセーフティネットによって置き換えられてはいないことを示唆しています。
要約すると、この論文は初期の実験の姿を描き出しています。デジタル・インターンはここに存在し、いくつかの機敏な小規模チームの中で懸命に働いていますが、ほとんどのプロジェクトにとっては、まだ足慣らしをしている段階に過ぎません。この研究は、これらのツールが真にソフトウェア開発を変革するためには、単にエージェントをより賢くすることではなく、人間がエージェントの生成する仕事をどのように信頼し、レビューし、管理するように組織化されるかが重要であることを示唆しています。このパートナーシップの未来は、エージェントを走らせることと、人間の手をしっかりとステアリングホイール(操舵輪)に置くことの間の、適切なバランスを見つけられるかどうかにかかっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。