← 最新の論文
🤖 AI

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

本論文は、Qwen Code CLIの35回の連続的なリリースに対する詳細な調査によって裏付けられた、コーディングエージェントの品質変動の主な要因は、基盤となる大規模言語モデルではなく、エージェント・ハーネスの急速な進化であることを示す、初の制御された縦断的研究を提示するものである。

原著者: Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単にあなたがコマンドを入力するのを待つのではなく、実際にあなたの代わりに仕事をしてくれる世界を想像してみてください。これは「コーディング・エージェント」の時代です。これらは、コードを読み、バグを修正し、さらには新しいソフトウェアを自律的に書き上げることもできる、スマートで自律的なプログラムです。しかし、ここにある「秘伝のソース」があります。これらのエージェントは、単なる「脳」(巨大なAIモデル)であるだけではありません。機能するためには、「体」と「神経系」も必要なのです。この「体」は「エージェント・ハーネス(装着具)」と呼ばれます。AIモデルを、天才的だが怠け者の天才だと考えてください。彼には、適切な道具を渡し、ルールを教え、思考を整理させるための「マネージャー」が必要です。ハーネスこそが、そのマネージャーなのです。ハーネスは、AIがどのツールを使えるか、どれだけの情報を見せるか、そして最初の試行が失敗した場合にどのようにループしてやり直すかを決定します。誰もが、より優れたマネージャーを雇い、オフィスをアップグレードし続ければ、その天才はより賢くなり、より速く働くようになると考えています。しかし、もしマネージャーが、ルールを増やしすぎたり指示を混乱させたりすることで、実は状況を悪化させているとしたらどうでしょうか? これが、この論文が投げかける大きな問いです。これらの「マネージャー」システムが絶えず更新される中で、それらは本当にAIがより良い仕事をするのを助けているのでしょうか、それとも単にAIを遅く、高くつかせているだけなのでしょうか?

この論文の著者たちは、ソフトウェア開発者が不満を漏らしているある謎を解明するために、探偵役を務めることにしました。彼らは、これらのコーディング・エージェントがアップデートされるたびに、しばしばミスが増えたり、タスク完了に時間がかかるようになったりすることに気づきました。人々は通常、AIの「脳」自体が悪くなったと考え、モデルが愚かになったのだとAIを責めていました。しかし、研究者たちは真の犯人は「マネージャー(ハーネス)」が頻繁に意見を変えすぎていることではないかと疑いました。これを証明するために、彼らは非常に厳格な実験を設定しました。彼らは特定のAIモデルを一つ選び、それが一切変化しないように「檻」の中に閉じ込めました。次に、「マネージャー」ソフトウェア(具体的には Qwen Code CLI)を取り上げ、初期リリースから最新版まで、35の異なるバージョンを通じて実行しました。各バージョンについて、全く同じAIの脳を使用して、50個の実世界のコーディングパズルをエージェントに解かせました。

結果は驚くべきものであり、少し滑稽なものでした。「マネージャー」ソフトウェアが絶えず更新され(時には1日に2回以上の新バージョンがリリースされることもありました)、それにもかかわらず、パズルを解くAIの実力は全く向上しませんでした。実際、成功率は更新の回数に関わらず、約30%のまま横ばいで推移しました。初期のバージョンは、派手で新しい複雑なバージョンと同じくらい、バグ修正において優秀でした。しかし、大きな落とし穴がありました。新しいバージョンのマネージャーは、信じられないほど無駄が多かったのです。最新バージョンのマネージャーは、古いバージョンと比較して、AIに消費させる「トークン」(AIが思考するために燃やす燃料や通貨のようなもの)をほぼ倍増させ、ツール呼び出しの回数も2倍に増やしました。それはまるで、車のエンジンを、スピードは上がらないのにガソリンを2倍消費する超複雑なバージョンにアップグレードしたようなものでした。

研究者たちは、なぜこのようなことが起きているのかを突き止めるために、さらに深く調査しました。彼らはマネージャー・ソフトウェア内のコード変更を調べ、開発者が多くの新機能を追加したり、多くの小さなバグを一度に修正しようとしたりすると、AIが混乱し、より多くのエネルギーを浪費することを発見しました。また、マネージャーの「体」の特定の部位は、触れると危険であることも発見しました。AIが脳とどのように対話するか(「LLMプロバイダー」レイヤー)や、どのように記憶するか(「コンテキスト管理」レイヤー)を変更すると、エージェントが躓いたり失敗したりすることがよくありました。一方で、セキュリティの脆弱性を修正したり、単純な拡張機能を追加したりすることは安全であるようでした。最大の衝撃は、ソフトウェアチームがこれらの問題が起きていることを知る術を持っていなかったことです。彼らの自動テストは、ソフトウェアが「クラッシュ」したかどうかのみをチェックしており、AIが実際にうまく仕事をしているか、あるいは資金を浪費しているかをチェックしていませんでした。それは、組み立てラインが動いているかどうかだけをチェックし、出来上がった車に実際に車輪がついているかどうかは決してチェックしない工場のようなものでした。

結局のところ、この論文は、これらのミスをAIの脳のせいにすることをやめるべきだと示唆しています。真の問題は、「マネージャー」ソフトウェアが適切な品質チェックなしに進化しすぎていることです。開発者が多くの機能や変更を追加しているため、AIは足止めを食らい、以前と同じ結果を得るために、より多くのリソースを消費しています。著者たちは、エージェントが更新のたびに依然として効率的かつ効果的であることを具体的にチェックする、新しい種類の「品質保証」を求めています。それまでは、これらのコーディング・エージェントをアップグレードすることは、単に同じパフォーマンスに対して高い料金を支払っているだけになるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →