想像してみてください。ホテルの予約、フライトの予約、交通状況の確認、食事の準備など、国を横断するロードトリップの計画を立てるような、巨大で複雑な問題を解決しなければならないと。
人工知能の世界では、現在のほとんどのシステムは、この問題を以下の2つの不器用な方法のいずれかで処理しています。
- 「万能型ボス」: 飛行機の予約から野菜の切り方まで、すべてを最も高価で超優秀なCEO(巨大なAIモデル)に任せる方法です。これは機能しますが、天気予報を確認するだけの単純なタスクであっても、信じられないほど高価で遅いです。
- 「硬直した組立ライン」: 「まずCEOにフライトを依頼し、次にCEOにホテルを依頼する」といった、事前に書かれたスクリプトに従う方法です。これは柔軟性に欠けます。CEOが忙しい場合やタスクが変更された場合、ライン全体が停止してしまいます。
Uno-Orchestraは、このショーを運営するための新しい、より賢明な方法です。これは、自ら作業を行うのではなく、仕事のあらゆる微小な部分に対して誰を雇うべきかを正確に知っている、卓越したコスト意識の高いツアーマネージャーのようなものです。
核となるアイデア:「選択的委任」
ツアーマネージャー(Uno-Orchestra)は、あなたのリクエストを見て、同時に2つの質問を投げかけます。
- 「これを分解する必要があるか?」(分解)
- 「この特定の部分に最適な人材は誰か?」(ルーティング)
- タスクが単純な場合(例:「2+2 は何か?」)、マネージャーは「誰にも頼む必要はない。即座に自分で答えよう」と言います。これにより、時間とコストが節約されます。
- タスクが複雑な場合(例:「株式データを分析し可視化するPythonスクリプトを作成せよ」)、マネージャーはそれをサブタスクに分解します。「データを見つける」「コードを書く」「コードを実行する」「チャートを作成する」。
- 魔法のトリック: 各サブタスクに対して、マネージャーは完璧な作業者を選びます。「データを見つける」タスクは、高速で安価なインターン(小さく安価なAIモデル)に割り当てられるかもしれません。しかし、「チャートを作成する」タスクは、専門的で高価なアーティスト(高性能で高価なAIモデル)に割り当てられます。
なぜこれほど優れているのかを学んだ方法
この論文では、新しい従業員を教育するプロセスのように、2段階のトレーニング過程が説明されています。
- インターンシップ(教師あり微調整): システムは、「マスターマネージャー」が問題を解決する61,000の事例を観察しました。このマスターマネージャーは、単なる推測ではなく、実際のツールと実際のコード実行を使用していました。システムは、いつ何を分解し、どの作業にどの作業者を選ぶべきかという、これらの成功パターンを模倣することを学びました。
- シミュレーションリーグ(強化学習): その後、システムは「トレーニングアリーナ」に投入され、自ら難しい問題を解決する必要がありました。
- 問題を正しくかつ安価に解決すれば、高いスコアが与えられました。
- 正しく解決したがコストを浪費した場合は、低いスコアとなりました。
- 失敗した場合はゼロ点でした。
- 重要なのは、システムが特定のステップに対して評価(または非難)を与えることを学んだ点です。ステップ3で間違った作業者を選んだ場合、単に最後に「失敗した」という一般的な評価を受けるのではなく、その特定のミスを学習しました。
結果:高速、安価、かつ賢明
研究者たちは、この新しいツアーマネージャーを、数学やコーディングから長文の読解まで、13種類の異なる課題にわたって、他の22のシステム(他の「ルーター」や「組立ライン」を含む)と比較してテストしました。
- スコア: Uno-Orchestraは77%の成功率を達成し、これは次点のシステムよりも約16%優れていました。
- コスト: さらに驚くべきことに、これは重厚なワークフローシステム1回あたりのクエリコストの10分の1で達成されました。
なぜよりうまく機能するのか
この論文は、その秘密は柔軟性にあると主張しています。
- 古いシステムは、巨大な脳一つですべてを行おうとする(高価すぎる)か、硬直したスクリプトに従う(愚かすぎる)かのどちらかでした。
- Uno-Orchestraはジャズミュージシャンのようです。単純な単音(直接の回答)を奏でるべき時と、バンド全体を招き入れるべき時(タスクの分解)を知っており、各音符にどの楽器(AIモデル)が必要かを正確に把握しています。
まとめ
Uno-Orchestraは、賢明なプロジェクトマネージャーになることを学ぶシステムです。単に質問をルーティングするだけでなく、どのように分解し、誰に割り当てるかを決定し、すべてを厳格な予算内で実行します。これは、最も困難な問題を解決するために最も高価なAIが必要なのではなく、適切な時に適切な仕事に適切なAIが必要であることを証明しています。
技術的サマリー:Uno-Orchestra
問題定義
現在の大規模言語モデル(LLM)マルチエージェントシステムは、通常、タスク分解、ワーカー選択、推論予算を統合的に最適化できない硬直的なオーケストレーションパターンに依存しています。既存のアプローチは、一般的に以下の 2 つの並行するが限定的な流れに分類されます:
- モデルルーティング:単一呼び出しのルーターは、クエリ全体を単一の専門家モデルに配信します。このアプローチは、複雑なタスクの並列構造を見落とし、分解の深さと実行予算の間でトレードオフを行うことができません。
- 階層的オーケストレーション:プランナーはタスクをサブエージェントに分解しますが、サブタスクを特定のエクゼキューターに割り当てる作業は、多くの場合、手作業で設計され、プロンプト駆動であるか、単一の独自最先端モデルに紐付いています。
その結果、「タスクを分解するかどうか・どの程度深く分解するか」という 2 つの重要な決定と、「各サブタスクをどの専門家へルーティングするか」という決定が、統一的な目的関数のもとで最適化されていません。これにより、単純なクエリが過剰にオーケストレーションされたり、複雑なタスクが最適ではないモデルへルーティングされたりする非効率が生じます。
手法:Uno-Orchestra
著者らは、選択的委任を単一の因果言語モデル(LM)タスクとして扱う統合オーケストレーションポリシーであるUNO-ORCHESTRAを導入します。このシステムは、単一のアシスタントターン内で、タスク分解計画と、すべてのサブタスクに対する特定の(モデル、プリミティブ)ルーティング決定を同時に生成することを学習します。
コアアーキテクチャ
- 統合ポリシー:分離されたプランナーとディスパッチャーモジュールの代わりに、単一の因果 LM バックボーンが、分解グラフとルーティングペアを同時に生成します。
- アクション空間:ポリシーは、M(異種ワーカーモデルのプール)とS(直接回答、連鎖思考推論、ツール呼び出し、コード実行などの原子行動の「プリミティブ」の閉じた語彙)の積集合M×Sからなる許容ペアの疎な集合P⊆M×Sから選択します。
- 選択的委任:ポリシーは、単純なクエリを単一の直接回答に集約(ゼロ配信コスト)したり、複雑なクエリをサブタスクの有向非巡回グラフ(DAG)に分解したりできます。独立したサブタスクは並列で配信されます。
学習パイプライン
ポリシーは、実世界のワーカー相互作用を用いて 2 段階で学習されます:
検証者ゲート付き教師あり微調整(SFT):
- 38 の公開データセットから構築された 61,201 の教師蒸留軌跡のカリキュラムが作成されます。
- 「検証者ゲート」メカニズムが軌跡をフィルタリングします:コールドスタートルーターによって解決されたタスクは破棄され、強力な教師オーケストレーターによって解決されたタスクは SFT 用に保持され、教師が失敗したタスクは強化学習(RL)用に予約されます。
- 重要なのは、コードおよびツールサブタスクが実際のサンドボックスで実行され、観測値がシミュレートされたトレースではなく、ランタイム出力であることを保証している点です。
Agentic-GRPO(強化学習):
- ポリシーは、「残差ハードプール(教師が失敗したタスク)」に対して、グループ相対方策最適化(GRPO)のマルチターン拡張であるAgentic-GRPOを用いて洗練されます。
- 中間クレジット割り当て:全体軌跡に単一の報酬を割り当てる従来の GRPO と異なり、Agentic-GRPO は個々のターン粒度でクレジットを帰属させます。これは、スキーマの有効性や修復インジケーターなどの有界なターンごとの成形信号をターミナル報酬に付加することで、長期的なクレジット割り当て問題を解決します。
- 目的:コントローラーは、ソース固有の検証者によって検証される正しさとトークンレベルのコストをトレードオフするユーティリティ関数J(θ)を最大化し、冗長な配信を罰します。
主要な貢献
- 統合された選択的委任:タスク分解とサブタスクごとのルーティングを単一の因果 LM ポリシーとして定式化し、分離されたモジュール間の冗長なコンテキスト受け渡しを排除します。
- Agentic-GRPO:マルチターンオーケストレーションのための構造化されたクレジット割り当てを可能にするエージェント適応型 RL 目的関数の導入により、モデルは中間観測に基づいて、いつ修復、分解、または集約を行うかを学習できます。
- 検証者ゲート付きカリキュラム:実世界のサンドボックス実行と厳格な検証を活用して高品質でコスト意識のある軌跡を生成する学習パイプラインにより、ポリシーが実際のランタイム結果から学習することを保証します。
実験結果
著者らは、数学的推論、コード/ソフトウェア工学、知識検索、長文脈読解、エージェント的ツール使用という 5 つの能力ドメインにまたがる 13 のベンチマークスイートで UNO-ORCHESTRA を評価しました。
- 性能:UNO-ORCHESTRA は77.0% のマクロ pass@1を達成し、最強のワークフローベースライン(AgentOrchestra)よりも約16% 高い性能を示しました。
- 効率性:このシステムは、より高い精度を維持しながら、クエリあたりのコストをベースライン(約 1.20 ドル)に対して約1 桁低い(約 0.10 ドル)レベルで動作します。
- コスト - 精度フロンティア:この手法は、精度と効率性のトレードオフにおいて有利な領域を占め、分解できないフラットルーターと、分解から逃れられない階層的オーケストレーターの両方を上回ります。
- 汎化性:性能の向上は、ドメイン内、ニアドメイン、ドメイン外の設定すべてで維持されます。アブレーション研究により、改善は特定の最先端モデルへの依存ではなく、学習されたルーティングポリシーに起因することが確認されました。システムは、オープンウェイトモデルの「より弱い」プールに制限された場合でも、ベースラインを上回ります。
意義と主張
本論文は、単一の目的関数のもとで分解を行うことと分解を控えることの両方を行う能力である選択的委任が、コスト意識のあるマルチエージェントシステムを進展させるための重要な組織原理であると主張しています。
- 構造的効率性:分解と配信を単一の共有バックボーンに集約することで、Uno-Orchestra はモジュール式システムに固有の調整オーバーヘッドを回避します。
- 動的適応:システムは、単純なクエリに対しては分解を「控えて」(単一の安価なワーカーに集約し)、真に複合的なタスクに対してのみマルチ呼び出しオーケストレーションを予約することを学習します。
- スケーラビリティ:このアプローチは、高精度が高価で単一のワークフローを必要とするものではなく、タスクの複雑さに基づいて異種リソースを動的に割り当てる学習されたコントローラーから生み出されることを示しています。
著者らは、Uno-Orchestra が精度と効率性のフロンティアを前進させ、コントローラーが単に多くのワーカーを呼び出すのではなく、適切なワーカーを選択するために容量を割り当てるスケーラブルなパラダイムを提供すると結論付けています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録