← 最新の論文
🤖 AI

Steer, Don't Solve: Training Small Critic Models for Large Code Agents

本論文は、大規模なコードエージェントに対して軌道内のステアリングを提供するために、小規模な教師あり微調整済みクリティックモデルを訓練することを提案しており、この手法がエンドツーエンドの訓練や事後的なスコアリングと比較して、SWE-bench Verifiedのようなベンチマークにおける性能を大幅に向上させると同時に、計算コストと軌道の長さの両方を削減することを実証している。

原著者: Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きなアイデア:GPS vs ドライバー

ニューヨークからロサンゼルスまで車を運転しようとしている場面を想像してください。あなたには、ハンドルを回し、アクセルを踏み、ギアを変える方法を完璧に知っている非常に熟練したドライバー(コード・エージェント)がいます。しかし、このドライバーは時々、「全体像」を見失うことがあります。彼らは同じ場所をぐるぐる回ったり、標識を読み間違えて道を間違えたり、あるいはドアだと思い込んで壁に向かって突き進もうとしたりすることがあります。

通常、これを修正するために、人々はドライバーをゼロから再学習させようとします。しかし、それはコストがかかり、時間がかかり、さらにドライバーは依然として同じ混乱した道で立ち往生してしまう可能性があります。

この論文は、異なる解決策を提案しています。 ドライバーを再学習させる代わりに、小さくて賢いGPSナビゲータークリティック・モデル)を雇うのです。

  • ドライバー(エージェント): すべての実際の作業(コードを書く、コマンドを実行する)を行います。彼らは全く変わらず、私たちは彼らの脳(モデル)を変更しません。
  • GPS(クリティック): ハンドルには触れません。その代わりに、数分おきにドライバーを観察します。もしドライバーが同じ場所をループしていたり、崖に向かって進んでいたりしたら、GPSはこう言います。「おい、ループしているぞ! 違うファイルを直そうとしている。立ち止まって戦略を練り直せ。」

この論文は、この小さなGPSを雇うことは、超高性能な人間のナビゲーターを雇うよりもずっと安上がりであり、ドライバーが目的地に到達する速度と成功率を大幅に向上させることを示しています。


問題点:なぜ「学習」だけでは不十分なのか

著者たちは、大規模なAIコーディング・エージェントにソフトウェアのバグ解決を学習させると、彼らは「メカニクス(仕組み)」(コードの入力やツールの実行)については非常に上手くなります。しかし、「ストラテジー(戦略)」(正しい計画を立てること)については失敗することが多いことに気づきました。

これは、学生にエッセイの書き方を教えているようなものです。完璧な文法や綴り(メカニクス)を教えることはできますが、もし彼らが思考を整理したり、トピックから逸れないようにしたりする方法(ストラテジー)を知らなければ、エッセイは依然としてめちゃくちゃなままです。

AIにこれら両方を同時に行わせようとすると、「天井」に突き当たります。AIは行き詰まってしまうのです。著者たちは、**失敗の約65%**はAIが悪いコードを書いたからではなく、推論に欠陥があったために起こっていることを発見しました。

解決策:「小さなクリティック(批評家)」

チームは、小さなAIモデル(クリティック)が大きなコーディング・エージェントの隣に座るシステムを構築しました。

  1. セットアップ: 大きなエージェントが問題を解決しようと試みます。5歩または10歩ごとに、エージェントは一時停止します。
  2. チェックイン: 小さなクリティックが、エージェントがこれまでに何を行ったかを確認します。
  3. アドバイス: クリティックは、短くハイレベルなヒントを与えます。
    • 悪いアドバイス: 「42行目を削除して、ここにループを書きなさい。」(これは「バックシート・ドライビング(余計な口出し)」であり、論文では、小さなモデルは大きなモデルよりもコードに詳しいわけではないため、これは良くないとされています)。
    • 良いアドバイス: 「同じコマンドを3回繰り返している。ループに陥っているぞ。別の方法を試せ。」(これが「ステアリング(操舵)」です)。
  4. 再開: 大きなエージェントはアドバイスを読み、作業を続行します。

彼らはどのようにGPSを訓練したのか

小さなクリティックに良いアドバイスを与える方法を教えるために、彼らは単に推測したわけではありません。まず、「ティーチャー(教師)」(Claude-Opus-4.6という非常に高価で巨大なAI)を使用して、アドバイスを生成させました。

  • ティーチャー(教師): 高価なAIがエージェントの作業を観察し、完璧でハイレベルなアドバイスを書き出しました。
  • スチューデント(生徒): 小さな、安価なAI(Qwen3-8B)は、これらのメモを学習しました。それは、ティーチャーと同じほど賢くなる必要はなく、アドバイスの「スタイル」(具体的なコードではなく、戦略に焦点を当てること)を模倣することを学びました。

重要な発見: 論文は、アドバイスの「種類」が最も重要であることを明らかにしました。

  • もしティーチャーが具体的なコードの指示を与えた場合、小さな生徒はそれをうまく学習できませんでした。
  • もしティーチャーがハイレベルな戦略(例:「行き詰まっている」「前提条件を確認せよ」)を与えた場合、小さな生徒はそれを完璧に学習しました。

結果:より速く、より安く、より賢く

チームは、これをSWE-benchと呼ばれる有名なベンチマーク(500件の実世界のソフトウェアバグのテスト)でテストしました。

  1. 異なるドライバーにも機能する: 彼らはある種類のコーディング・エージェント(CWM-32B)を使用してクリティックを訓練しました。その後、その同じクリティックを使用して、一度も見せたことのない2つの異なるコーディング・エージェント(Qwenモデル)を助けました。
    • 結果: 新しいエージェントたちは、クリティックの助言を聞くだけで、バグ解決能力が大幅に向上しました。
  2. コストを削減できる: 「ティーチャー」(Claude-Opus)を動かすのは非常に高価です。「スチューデント」(Qwen3-8B)は極めて小さく、安価です。
    • 結果: 小さなクリティックを使用するシステムは、高価なティーチャーを使用する場合と比較して、30倍から92倍安価でした。
  3. 実際に時間を節約できる: ある大きなエージェントにおいて、クリティックはエージェントを賢くしただけでなく、時間の浪費を止めさせました。エージェントはタスクをより早く完了させたため、さらなるコスト削減につながりました。実際、システム全体(エージェント + クリティック)は、エージェントが単独で動くよりも安価でした。

「秘訣」

この論文は、なぜこれがうまくいったのかについて、主に2つの理由を挙げています。

  1. 関心の分離(Separation of Concerns): エージェントは「実行すること(コーディング)」に集中し、クリティックは「考えること(戦略)」に集中します。彼らはどちらが主導権を握るかで争うことはありません。
  2. バックシート・ドライビングの禁止: クリティックは「この特定の行を書きなさい」と言うことを厳格に禁じられています。それは単に「あなたは間違った方向に進んでいる」と言うだけです。これにより、小さなモデルが、大きなモデルを混乱させるような具体的で不適切な指示を出すことを防いでいます。

まとめ

この論文を、単一の「スーパーヒーロー」を作るのではなく、「チーム」を構築するための設計図と考えてください。一つの巨大で完璧な、すべてを行うAIを作ろうとする(それは困難で高価です)代わりに、強力な作業員を導くための小さく特化したコーチを備えたシステムを構築したのです。

コーチは作業を行いませんが、適切なハイレベルのナッジ(促し)を与えることで、作業員は単独では解決できなかった問題を解決できるようになり、チーム全体としてより速く、より低コストで仕事を完了させることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →