← 最新の論文
💬 NLP

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

本論文は、タスク固有のエージェント・ハーネスをオンザフライで自動的に合成および進化させる学習可能なモデルであるJIT-Agentを紹介し、これは様々な基盤モデルの性能を大幅に向上させ、ハーネスのインテリジェンスをエージェント能力の拡張可能かつ直交する次元として確立するものである。

原著者: Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Ya
公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約:Just-in-Time ハーネス進化によるハーネス・インテリジェンスのスケーリング

1. 問題提起

LLMエージェントの能力は、基盤モデルの重みのみによって決定されるのではなく、メモリ管理、プランニング戦略、アクション・プロトコル、およびツール/スキルのオーケストレーションからなる運用的な足場である「エージェント・ハーネス(agent harness)」によって共同に定義される。強力なモデルであっても、不適切なハーネスの下では失敗する可能性がある一方で、堅牢なハーネスは、モデルがそれを解釈し従うことができれば、その潜在能力を解き放つことができる。

現在のハーネス最適化のアプローチは、主にAhead-of-Time (AOT) 手法に依存している。これらのシステムは、将来のタスクに対して汎化するために、経験ストリームを通じて最適化された耐久性のあるアーティファクトとしてハーネスを扱う。しかし、AOTアプローチはインスタンス依存性(instance-dependency)に苦慮する。すなわち、異なるタスク(例:広範な探索を要するもの vs 終端タスク vs 深いリサーチを要するもの)には、根本的に異なるハーネスの事前分布が必要となる。単一のAOTハーネスを異種混合の要求に対して最適化することは煩雑であり、膨大な設計空間と軌跡の蓄積を必要とし、しばれて新しい問題の特定の構造に適合することに失敗する。本論文は、ハーネス設計を、手動の静的なエンジニアリング・タスクから、訓練されたメタエージェントがタスク固有のハーネスを即座に合成するJust-in-Time (JIT) な能力へと移行させるべきだと提唱している。

2. 手法:JIT-Agent

著者らは、任意のオフザシェルフ(既製品)のエージェント的LLMに対して、タスク適応型のハーネスを合成、修復、進化させるために設計されたコンパクトなメタエージェントであるJIT-Agentを提案する。

2.1 定式化:4モジュール・プロトコル

ハーネス生成を可能かつ構造化されたものにするため、本論文ではエージェント・ハーネスを、固定された4モジュール・プロトコル Π=(M,P,A,F)\Pi = (M, P, A, F) に従う、構成可能で機械生成可能なアーティファクトとして定式化している:

  1. メモリ (MM): 履歴を、実現された履歴のビュー (vtv_t) へと圧縮する。
  2. プランニング (PP): ビューをローカルな指令 (dtd_t) へと変換する。
  3. 能力オーケストレーション (FF): 指令に基づき、関連するツール/スキル (CtC_t) を選択およびシーケンス化する。
  4. アクション (AA): アセンブルされたコンテキストを消費して、コントローラーの状態を更新し、次のアクション (ete_t) を出力する。

この因数分解により、異種混合のプログラムを、プロトコルに準拠した空間 HΠH_\Pi 内の比較可能な座標へと変換する。著者らは、シードバンク (B0B_0) として機能させるために、この共通インターフェースの下で13の代表的な現代的スキャフォールド(例:ReAct、Plan-and-Execute、Recursive agents)を実装した統一コードベースであるHarnessFactoryを導入している。

2.2 トレーニング・パイライン

JIT-Agentは、ハーネス・インテリジェンス(適応性、信頼性、および進化可能性)を達成するために、3段階のパイプラインを通じて訓練される:

  • ステージ I:タスク条件付きカスタマイズ

    • 目的: タスク仕様と小さな参照コンテキストから、プロトコルに準拠したハーネスへのマッピングをモデルに教える。
    • 手法: 固定されたより強力なティーチャーモデルが、タスクに適応したハーネスを合成する。訓練データには、有効な生成物に対する教師あり微調整(SFT)と選好学習が含まれる。選好目的関数 (LprefL_{pref}) は、効率(レイテンシやコスト)を損なうことなくタスク報酬を向上させるハーネスを最適化するために、パレート型の選好ルールを使用する。
  • ステージ II:ハーネスの修復

    • 目的: 合成の失敗からの回復を学習させることで、信頼性を確保する。
    • 手法: 生成の失敗(コンパイラエラー、インターフェースの不一致、実行時例外)を、限定された修復軌跡へと変換する。ティーチャーは、ハーネスを修正するための構造化された修正 (Δ\Delta) を提案する。モデルはこれらの修復遷移を模倣するように訓練され、実行フィードバックを使用して、短期間(最大2ラウンド)以内にプロトコルとして有効な実行を復元することを学習する。
  • ステージ III:進化的グループ分離型方策最適化 (Evo-GDPO)

    • 目的: モデルが現在のアーカイブの最前線(フロンティア)を超えるハーネスを提案することを学習する、オンライン進化を可能にする。
    • 手法: 訓練中、モデルは一連の候補ハーネスを提案する。これらは現行のインカンベント(そのタスクにおける現在のバンク内の最良のハーネス)に対して評価される。報酬信号は以下の3つのチャネルに分離される:
      1. 報酬: 主要な信号。候補はインカンベントの報酬と同等またはそれを上回る必要がある。
      2. レイテンシとコスト: 報酬が維持されている場合にのみ活性化される効率信号。
    • 方策は、フロンティアを追い越しながら効率を維持することを報酬とする、正規化された集約アドバンテージを用いたPPOスタイルの目的関数を用いて更新される。ハーネスバンク (BnB_n) は、設計が進展したもののみを保持するように保守的に更新される。

2.3 推論アーキテクメント

JIT-Agentは、2つの推論モードをサポートする:

  • 静的推論 (Static Inference): NN 個のハーネスを並列に生成し、そのうちの1つを選択して実行する。環境へのロールアウトを増やすことなく、候補の多様性を最大化するのに適している。
  • ストリーミング推論 (Streaming Inference): タスクストリーム向けに設計されている。モデルは進化するバンクからリファレンスを検索し、ハーネスを生成し、フィードバックに基づいてバンクを更新する。これにより、展開中のモデルパラメータを更新することなく、経験をタスク間で転送することが可能になる。

3. 主な結果

本論文は、GLM-5.2、DeepSeek-V4-Flash、Qwen3.6、およびMimo-V2.5を含むバックボーンを用い、ディープリサーチ、日常業務、プランニング、およびワークスペースのタスクをカバーする9つのベンチマークにおいてJIT-Agentを評価している。

  • 性能向上: デフォルトのスキャフォールドをJIT生成されたハーネスに置き換えることで、一貫した向上が見られる。

    • GLM-5.2: 9つのベンチマーク全体で平均 +7.7 ポイント の改善。顕著な向上として、DeepPlanning-Travel で +20.2、OdysseyBench で +4.3 が挙げられる。
    • DeepSeek-V4-Flash: 平均 +8.8 ポイント の改善。DeepSearchQA において GPT-5.6 を +9.1 上回る。
    • 汎用性: JIT-Agentは、テストされたすべてのモデルファミリー(DeepSeek、Qwen、Mimo)およびバリアント(Flash/Pro)において性能を向上させており、能力がモデルの重みを横断して転移することを示している。
  • 固定ハーネスとの競争力:

    • JIT生成ハーネスは、OpenCodeClaude Code といった成熟したランタイムと同等の性能を示す。
    • DeepSeek-V4-Flash において、JIT-Agentは最強の固定ハーネスである NanoBot を、DeepSearchQA で +4.7 ポイント、xBench-DS で +4.0 ポイント 上回る。
  • コスト効率:

    • JIT-Agentは、すべての制御された設定において最も低いトークン消費量とAPIコストを達成している。
    • 最も安価な固定ハーネスと比較して、性能を向上させつつ、ケースあたりのコストを 14.9~54.1%(平均 36.0%)削減している。例えば、DeepSeek-V4-Flash xBench-DS では、性能が 78.0 から 82.0 に上昇した一方で、トークン使用量は 527K から 212K へと減少した。
    • パレートフロント分析は、JIT-Agentが(高い性能、低いコストという)左上方向へ動作点をシフトさせていることを示しており、これは利得が長い軌跡によるものではなく、より優れたオーケストレーションによるものであることを証明している。
  • テスト時進化:

    • ストリーミングJIT(タスクストリームにわたってハーネスバンクを更新するもの)は、静的JIT(独立した生成)よりも累積精度において一貫して優れており、実行フィードバックから学習することの価値を実証している。

4. 重要性と主張

本論文は、ハーネス・インテリジェンスを、モデルのスケーリングとは直交する、訓練可能かつ転移可能な、エージェント能力の新しい次元として確立することを主張している。

  • パラダイムシフト: 本研究は、ハーネスエンジニアリングを「Ahead-of-Time(静的なアーティファクトの最適化)」から、「Just-in-Time(タスク固有のスキャフォールドの即時合成)」へと移行させるものである。
  • モデルとしてのハーネス: 訓練されたメタエージェントが、固定されたハーネスを持つより強力なモデルに匹敵、あるいはそれを凌駕する運用スキャフォールドを生成できることを示している。
  • スケーラビリティ: ハーネスを構成可能なプロトコルとして定式化し、それを進化させる生成器を訓練することで、本論文は、モデルのパラメータのスケーリングのみならるのではなく、実行環境自体の最適化を通じてエージェント能力をスケールさせる道筋を示唆している。
  • 今後の方向性: 著者らは、これを**モデルとハーネスの共同設計(Model-Harness Co-Design)**への一歩と考えている。そこでは、基盤モデルが最終的に、自身の実行システムを構築、修正、進化させる能力を内面化することになるだろう。

結論として、ハーネス・インテリジェンスは単なる実装の詳細ではなく、エージェントの性能を決定付ける第一級の要因であり、高価なバックボーンのスケーリングを必要とせずに、相当な能力を回復させることができるものである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →