← 最新の論文
🤖 AI

Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First

SuperScoutは、軽量な「サーチャー(探索者)」エージェントをデプロイしてリポジトリを探索し、検証済みの構造化されたハンドオフを生成することで、ルーターがソフトウェア修復タスクを最前線のモデルに派遣することを可能にし、最高性能の単一モデルと同等のパフォーマンスを実現しながら、解決あたりのコストを約5分の1に抑えることができる、費用対効果の高いフレームワークである。

原著者: Ishaan Bhola, Adithyan Krishnan, Mukunda NS

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Ishaan Bhola, Adithyan Krishnan, Mukunda NS

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターが壊れたソフトウェアを修正するコードを書ける世界を想像してみてください。ただし、そのAIコーダーを雇うのは非常に高価です。これらの「AIコーダー」を、エリート探偵チームのように考えてみてください。中には、どんな謎も解き明かすことができるスーパースターもいれば、価格は数分の一ですが、トリッキーな手がかりを見逃してしまうこともある、賢いが能力はそこそこの探偵もいます。長い間、この分野における大きな疑問は、「特定の案件に対して、どの探偵を雇うべきかをどうやって判断するか?」というものでした。多くの人々は、問題の記述(「イシュー・テキスト」)を読むだけで、安い探偵で十分か、それとも高価なスーパースターを呼ぶ必要があるかを予測しようと、単に推測しようとしてきました。

しかし、ここに落とし穴があります。問題の記述を読むことは、現場を一度も訪れることなく、警察の報告書だけを見て犯罪を解決しようとするようなものです。これから読む論文は、よりスマートなアイデアを探求しています。もし、まず安価で小さな「偵察員」を現場に送り込んだらどうなるでしょうか?この偵察員は謎全体を解こうとするのではなく、ただ周囲を調べ、壊れている箇所を見つけ出し、検証済みの簡単な報告書を作成します。そして、マネージャーがその報告書を使用して、どの探偵を雇うかを決定します。この「スカウティング(偵察)」と呼ばれるアプローチは、問題のタイトルに基づいて推測するよりも、問題の「コンテキスト(文脈)」を知ることの方がはるかに価値があることを示唆しています。


SuperScoutの物語:先に偵察を行う探偵

新しいシステム、SuperScoutを紹介しましょう。これは、予算を使い果たすことなくソフトウェアのバグを修正するために設計されました。開発チームは、従来のAIコーダーの雇い方が非効率であることに気づきました。通常、ルーター(意思決定者)はバグ報告を見て即座にモデルを選択します。しかし、著者たちは驚くべき発見をしました。過去のソフトウェア修正の結果を見ると、「スーパースター」モデルは、安価なモデルが解決できるほぼすべての問題に加え、さらにいくつかの問題も解決しているのです。これは、精度(最高のモデルを選んで解決数を最大化すること)のためにルーティングを試みることは、行き止まりであることを意味します。なぜなら、常に最も高価なモデルを雇い続けることに勝ることはできないからです。

そこで、チームは方針を転換しました。完璧を目指すのではなく、**コスト意識(cost-aware)**を持つことにしたのです。彼らの目標は、最高のモデルよりも多くの問題を解くことではなく、極めてわずかな費用で、最高モデルと同じ数の問題を解決することでした。

三幕劇:偵察、検証、そして派遣

SuperScoutシステムは、3つのステップからなる組み立てラインのように機能します:

  1. 偵察員 (SuperScout-7B): まず、70億パラメータを持つ小さなAIモデル(ジュニア・インターンと考えてください)がソフトウェアのリポジトリに送り込まれます。その仕事はバグを修正することではなく、コードを探索し、関連する特定のファイルを見つけ出し、バグが存在することを証明するテストを記述することです。これによって、「ハンドオフ(引き継ぎ)」と呼ばれる、容疑ファイル、再現テスト、および探偵のメモを含む構造化されたノートが生成されます。
  2. セキュリティゲート (Verify-then-Strip): ここに魔法のトリックがあります。インターンのメモは盲目的に信頼されません。メインの探偵がそれを見る前に、「サンドボックス」(安全で隔離されたテスト環境)がインターンの再現テストを実行します。もしテストが実際にコードを壊せなかった場合(つまり、インターンが幻覚を見ているか、間違っていた場合)、その主張は取り除かれ、破棄されます。検証された真実のみが次のステップへと進みます。
  3. 履歴書ルーター (Résumé Router): 最後に、マネージャーがタスクとインターンの「隠れた思考」(偵察モデルの内部データ状態)を見て、どの「修正担当者(fixer)」を雇うかを決定します。候補となる修正担当者のプールには、安価なものから高価なものまで、4つの異なる最先端AIモデルが含まれています。ルーターは、その仕事をこなせると判断した最も安いモデルを選択します。もしインターンが何も発見できなかった場合は、修正担当者は元のバグ報告のみに基づいて作業を行います。

大発見:ハンドオフこそが主役である

チームが266個の実世界のPythonソフトウェアバグ(SWE-bench Proとして知られる大規模な挑戦)に対してSuperScoutをテストしたところ、結果は衝撃的でした。

  • スコア: SuperScoutは、266個のタスクのうち159個を解決しました。
  • 競合: 単一の最高級かつ最も高価なモデル(Claude Opus 4.6)は、266個のうち158個を解決しました。
  • コスト: SuperScoutはこの結果を、1件の解決につき約0.23ドルで達成しました。一方、高価な単独モデルは1件あたり1.27ドルかかりました。これは、およそ5分の1のコストです!

しかし、最も興味深い発見は、ルーターの意思決定についてではありませんでした。研究者がルーターを完全に取り除き、すべてのタスクをインターンの検証済みハンドオフと共に最も安いモデル(Kimi K2.5)に送ったところ、フル版のSuperScoutシステムと全く同じ159個のタスクを解決しました。

このことは、「検証済みハンドオフ」こそが真のヒーローであることを示唆しています。リポジトリを偵察し、検証済みの報告書を提供して情報を渡すという行為が、安価なモデルの性能を押し上げ、高価なモデルに匹沢するレベルまで高めたのです。ルーティングの決定自体は、それほど魔法のような効果をもたらしていませんでした。ルーターの役割は、安いモデルにハンドオフを確実に渡すことでした。

なぜこれが重要なのか(そして何ではないのか)

論文では、以下の事項を明確に否定しています:

  • 精度を目的としたルーティングは失敗である: 問題のテキストに基づいてモデルを切り替えても、解決できるタスクの数を増やすことはできません。結局、最高のモデルが勝つからです。
  • ハンドオフのテキストはルーターのためのものではない: 興味深いことに、インターンの報告書の「テキスト」をルーターに読み込ませると、逆に性能が悪化しました。ルラーは、テキストよりも偵察モデルの「隠れた状態(内部的な脳活動)」を使用する方がうまく機能します。メモは修正担当者のためのものであり、マネージャーのためのものではありません。
  • あらゆるものに対する魔法の杖ではない: このシステムは、特定の266個のPythonタスクに対してテストされました。偵察モデルは学習していない言語でも動作できることを示しましたが、他のベンチマークにおけるフルシステムの性能はまだテストされていません。

著者らは、これが永遠に続く「解決済み」の問題ではないことも注意深く述べています。結果は、これらの特定のタスクと現在のモデルに特化したものです。しかし、メカニズムは堅牢です。修正担当者を雇う前に、事実を検証するために小さな偵察員を送り込むことで、解決能力を再分配することができます。ハンドオフは安価なモデルの能力を引き上げ、高価なモデルに匹敵するレベルにします。しかも、偵察員のコストは無視できるほど微々たるものです(タスクあたり0.5セント未満)。

要するに、SuperScoutは、AIコーディングの世界において**「コンテキスト(文脈)こそが王である」**ということを教えてくれます。仕事の記述に基づいて誰を雇うかを推測するのではなく、まず現場に偵察員を送り、彼らが見つけた事実を検証し、それから最も能力のある安価な作業者に仕事を任せるのです。これは、よりスマートで、より安価なソフトウェア構築の方法であり、時には、少しの下調べをすることが最大の節約につながることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →