CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
本論文は、実行フィードバックと適合リスク制御(Conformal Risk Control)を活用して、コーディングエージェントにおける安価な自己回復とモデルへのエスカレーションを動的に決定し、既存のベースラインと比較して大幅に低いコストで優れた解決率を達成する、予算校正型のリカバリ・ルーティング・フレームワークであるCodeRescueを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: CodeRescue: コーディングエージェントのための予算校正型リカバリ・ルーティング
1. 問題定式化
本論文は、実行可能な環境で動作するコーディングエージェントのデプロイメントにおける課題に対処している。そこでは、失敗した試行が単なる誤った出力ではなく、実行可能なフィードバック(例:コンパイラエラー、テスト失敗、stderrトレース)を生成する。既存のコスト意識の高いシステムは、通常、モデルの失敗をバイナリな決定として扱う。すなわち、即座に、より強力で高価なモデルへとエスカレーションするものである。
著者らは、コーディングにおいてはこのアプローチが最適ではないと主張している。なぜなら、実行フィードバックによって、安価なモデルによるさらなる試行が価値を持つ可能性があるからである。これは予算付きのデプロイメント問題を生み出す。エージェントが失敗したとき、ソリューションを修正するために安価な計算量をさらに投入すべきか(リフレクト)、あるいは計画を練り直すべきか(リプラン)、それともより強力なモデルへエスカレートすべきか、という問いである。
この問題は**ポストフェイラー・リカバリ・ルーティング(失敗後のリカバリ・ルーティング)**として定式化される。安価なモデルによる初期試行が失敗した後、システムは以下の3つの異種のアクションから選択しなければならない:
- Reflect(リフレクト): 実行フィードバに基づき、既存のソリューションを修正する。
- Replan(リプラン): 安価なモデルを用いて、異なる計画から新しいソリューションを生成する。
- Escalate(エスカレート): 問題(およびフィードバック)を、より強力で高価なモデルに委譲する。
目標は、ユーザーが指定した平均リカバリ予算 () の制約に従いつつ、**解決率(solve rate)**を最大化することである。ただし、新しい予算制約ごとにポリシーを再学習させることはしない。
2. メソドロジー
2.1 教師ありリカバリ・ルーター
コアとなるコンポーネントは、オフラインの実行ロールアウトに基づいて学習された教師ありルーターである。
- 入力: 問題文、実行結果、および stderr トレースからなるリカバリ・コンテキスト 。
- ラベル付け: 各失敗したインスタンスに対して、「オラクル」ラベルは、そのインスタンスを解決するアクションの集合 の中で、最も安価な成功アクション () として定義される。どのアクションも成功しないインスタンスは除外される。
- 学習: 言語モデル(例:Qwen3.5-4B)を、最も安価な成功アクションを予測するようにクロスエントロピーを用いてファインチューニングする。ルーターはログ確率に基づいてアクションをスコアリングし、ソフトマックスによって正規化する。
2.2 コスト正則化ポリシー
異なる予算の下でのデプロイを可能にするため、著者らはコスト・ペナルティ を導入している。ポリシー は、以下を最大化するアクションを選択する:
ここで、 はルーターのスコア、 は推定されるデプロイメント・コストである。
- が増加するにつれ、ポリシーはより安価なアクション(リフレクトやリプラン)へとシフトする。
- これにより、単一の学習済みルーターから導出される、離散的な動作点(コスト・品質フロンティア)が作成される。
2.3 コンフォーマル予算校正 (CRC)
特定のユーザー予算 に対して統計的な保証を提供しながら適切な を選択するために、著者らはコンフォーマル・リスク・コントロール (CRC) を適用している。
- メカニズム: ホールドアウトされた校正セットを用いて、様々な 値に対する経験的平均コストを計算する。
- 選択ルール: 有限サンプルの予算制約を満たす、最も制約の少ないペナルティ を選択する:
ここで、 は既知のコスト上限であり、加算項はリーブ・ワン・アウトのコンフォーマル補正を提供する。 - 保証: 交換可能性の仮定の下で、この手順は、展開されたポリシーが将来のテストデータにおいて期待平均リカバリコストが を超えないことを保証する。決定的なのは、この保証は解決率ではなく「コスト」に対して適用される点であり、アクション間で非単調な成功パターンが存在することを許容している。
3. 主な貢献
- ポストフェイラー・リカバリ・ルーティング: 論文は、コーディングエージェントのリカバリを、単純な強力なモデルへのカスケードではなく、異種のアクション(リフレクト、リプラン、エスカレート)にわたるルーティング問題として定式化した。
- 予算制御可能なデプロイメント: CRCによって、単一の学習済みルーターが複数の予算ポイントで動作することを可能にする、校正されたコスト・ペナルティを導入した。これにより、異なる予算制約のために再学習する必要性を排除している。
- 経験的なリカバリ・トレードオフ: 本研究は、安価なリカバリとモデルのエスカレーションが相補的な成功パターン(すなわち、安価なアクションでのみ解決可能な失敗もあれば、エスカレーションでのみ解決可能なものもあり、また両方で解決可能なものもある)を示すという経験的な証拠を提示している。これは、離散的なコスト・品質フロンティアを形成する。
4. 実験結果
システムは、GPT-5.4-NANO を安価なモデル、GPT-5.4 を強力なモデルとして、5つのコーディング・ベンチマーク(APPS, TACO, BigCodeBench, LiveCodeBench, CodeContests)で評価された。
- ルーターの有効性: 学習されたルーターは、固定アクションのベースラインを大幅に上回った。制約のない学習済みルーターは、平均コスト 5.51 m で 68.6% であった「常にエスカレート」する場合と比較して高い数値である。
- 相補性: 「オラクル」の最も安価なアクションの分析により、失敗の 28% は安価なアクションでのみ解決可能であり、45% はエスカレーションでのみ、そして 27% は両方で解決可能であることが明らかになった。この不均一性が、固定されたカスケードよりもルーターが必要であることを正当化している。
- 予算校正: CRC校正されたフロンティアは、予算が 2.56 m$ のとき、システムが 71.7% の解決率を達成したことを示した。これは「常にエスカレート」のベースライン(68.6%)を上回り、かつ「常にエスカレート」戦略の平均コストのわずか 35% しか使用していなかった。
- ベースライン: 学習されたルーターは、プロンプトのみのルーター(ゼロショットLLMによるルーター)やバイナリ・カスケード・ベースラインを凌駕しており、ルーティング信号にはプロンプトエンジニアリングだけでなく、ロールアウトからの学習が必要であることを裏付けている。
5. 意義と主張
本論文は、コーディングの失敗を単純な能力の欠如としてではなく、診断可能な修理問題として扱うことで、より効率的なリソース配分が可能になると主張している。CRCによってルーターの学習とデプロイメント予算を切り離すことで、本システムは予算制御可能な推論のための実用的なメカニズムを提供している。
著者らは、本手法は解決率をコンフォーマルに制御することを目的としているのではなく、あくまでコストの保証を提供し、解決率の向上は経験的な観察に基づくものであることを強調している。彼らの研究は、コーディングにおいては「最も安価で有用な次のステップ」は必ずしも最強のモデルではなく、失敗モードに合わせた特定のリカバリ・アクションであり、その決定は厳格な予算制約の下で動的に行うことができることを示唆している。
著者らが指摘する限界:
- リカバリは単一のポストフェイラー決定としてモデル化されているが、実際のエージェントは複数ラウンドの反復を行う可能性がある。
- 「最も安価な成功」ラベルはプロキシ(代理指標)であり、校正された確率推定ではない。
- CRCは期待コストを制御するものであり、解決率を制御するものではない。そのため、品質の向上は経験的な観察事項にとどまる。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。