← 最新の論文
🤖 machine learning

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

本論文では、パッチごとの精度を高めるのではなく、評価可能なパッチの網羅性を拡大することによって、SWE-bench Verifiedにおけるコーディングエージェントの性能を大幅に向上させる手法である「probe-and-refine tuning(プローブ・アンド・リファイン・チューニング)」、すなわち、合成されたバグ修正プローブを用いてリポジトリのガイダンスファイル(AGENTS.md)を反復的に最適化する手法を導入する。

原著者: Asa Shepard, Jeannie Albrecht

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Asa Shepard, Jeannie Albrecht

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で古めかしい図書室(コードリポジトリ)を修理するために、優秀だが経験の浅い弟子を雇ったと想像してください。その弟子は本を読み、破れたページを直す能力はありますが、その図書室の「秘密のルール」を知りません。例えば、「どの棚に珍しい地図があるのか」「眠っている猫を起こさずに司書に助けを求める方法」や、「どの梯子が安全に登れるのか」といったことです。

この「ローカルな知識」がないために、弟子は目的もなく彷徨い、間違った梯子に登ったり、間違ったセクションにある本を直そうとしたりして、しばしば事態を悪化させてしまいます。

この論文は、この問題を解決するための**「Probe-and-Refine Tuning(プローブ・アンド・リファイン・チューニング)」**と呼ばれる手法を紹介しています。以下に、シンプルな比喩を用いてその仕組みを説明します。

問題点:「一律の」マニュアル

エンジニアは、AIコーディングエージェントのために「チートシート」(AGENTS.mdファイルのようなもの)を書くことがよくあります。

  • 従来の方法(静的な知識): 彼らは賢いAIに対し、「修正する前に必ず索引を確認すること」や「メインのエントリーポイントを探すこと」といった、汎用的なマニュアルを書かせます。これは、弟子に「世界中のあらゆる図書室の地図」を渡すようなものです。役に立ちではありますが、その「特定の図書室」の隠された秘蔵品がどこにあるのかまでは教えてくれません。
  • 結果: 弟子はそれなりにこなしますが、依然として頻繁に迷子になります。

解決策:「試行錯誤」によるコーチング

著者たちは、**「Probe-and-Refine(プローブ・アンド・リファイン)」**と呼ばれる新しいプロセスを作成しました。マニュアルを一度書いて終わりにするのではなく、間違いを通じてマニュアルを学習させる「生きた文書」として扱うのです。

これは、コーチが新人選手をトレーニングする様子に似ています:

  1. Probes(ドリル/訓練): コーチは、この図書室に特化した10個の架空の、作り物の問題(プローブ)を生成します。
  2. Attempt(試行): 弟子は、現在のマニュアルを使って、これらの架空の問題を解こうと試みます。
  3. Diagnosis(診断): コーチは試行を見守ります。「おっと、君はキッチンの配管を直そうとしたけれど、実際には配管は地下にあるよ。それに、まず設計図を確認することを忘れていたね」
  4. Refinement(洗練): コーチは、即座に具体的なルールを追加してマニュアルを更新します。「この図書室では、配管は地下にあり、常に設計図を確認すること」
  5. Repeat(反復): これを3〜5回繰り返します。マニュアルは、汎用的なガイドから、超具体的な「内部事情に精通した」ガイドへと進化していきます。

重要な点は、このトレーニングプロセス全体が、エージェントが「実際のバグ」を修正することなく行われることです。 これは、AIがマニュアルを書き、それを架空の問題でテストし、その結果に基づいてマニュアルを修正するという、シミュレーションのループなのです。

研究結果

研究者たちは、有名なコーディングベンチマーク(SWE-bench)を用いて、4つの異なる実行テストを行いました。結果は以下の通りです:

  • ガイドなし: 弟子は問題の 25.5% を解決しました。
  • 汎用ガイド: 弟子は問題の 28.3% を解決しました。
  • Probe-and-Refine ガイド: 弟子は問題の 33.0% を解決しました。

大きな秘密:それは「より良く直すこと」ではなく、「正しいドアを見つけること」にある
改善されたマニュアルによって、弟子が「より賢くなった」あるいは「直す能力が上がった」のだと思うかもしれません。しかし、そうではありません。

  • 弟子が何かを修正できたとき、どのマニュアルを使用していたとしても、修正の質(成功率 約59%)は全く同じでした。
  • 真のマジックは「カバレッジ(網羅率)」にありました。 改善されたマニュアルは、弟子が修正すべき「正しいファイル」をより頻繁に見つけられるように助けたのです。
    • 比喩: 汎用マニュアルでは、弟子は100枚のドアを叩きましたが、正解は40枚しかありませんでした。洗練されたマニュアルでは、100枚のドアを叩いたとき、56枚が正解でした。一度正しいドアを見つければ、鍵を直す能力自体は変わらなかったのです。

「ステップ予算」の罠

また、このガイドは、弟子に十分な時間を与えない限り機能しないことも判明しました。

  • もし、問題を解決するために25ステップしか与えられなければ、凝ったマニュアルは役に立ちません。複雑な指示に従う時間が足りないからです。
  • もし、200ステップ与えられれば、この豪華なマニュアルは輝きを放ちます。それは(再現→追跡→修正という)時間を要するものの、確実に機能するワークフローを提示してくれるからです。マニュアルがない場合、彼らは急いで作業して失敗してしまいます。
  • 比喩: もし誰かに「渋滞を避けるために景色の良いルートを通ってください」と言っても、仕事に行くまでの時間が5分しかなければ、彼らはただ道に迷うだけでしょう。景色の良いルートを実際に通るための「時間」が必要なのです。

「モデルのミスマッチ」への警告

最も驚くべき発見は、このガイドは普遍的なものではないということです。

  • 彼らは、あるAIモデル(Qwen)でトレーニングされたガイドを、別の少し性能の低いAIモデル(Nemotron)で使用してみました。
  • 結果: 二番目のモデルはクラッシュしました。特定の指示によって混乱が生じ、動作が完全に停止してしまったのです。
  • 比喩: これは、詳細な高速レース用のマニュアルを、低速の古いセダンを運転するドライバーに渡すようなものです。指示が車に対して複雑すぎるため、ドライバーはフリーズしてしまいます。ガイドは、それを読む「脳(モデル)」に合わせて特別に「チューニング」されなければなりません。

まとめ

この論文は、単に指示を持つことよりも、「どのように指示を書くか」が重要であることを証明しています。
「架空の問題を作り、それを解こうとし、失敗に基づいて指示を修正する」というシンプルなループを用いることで、汎用的なガイドを専門的なエキスパート・マニュアルへと変えることができます。これはAIをコード修正において賢くするものではありません。単に、AIが間違った場所を探すのを防ぎ、問題を解決するための潜在能力を最大限に引き出せるようにするものなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →