← 最新の論文
🤖 AI

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Uno-Orchestra は、堅牢なマルチエージェントシステムに比べて多様なベンチマークにおいて著しく高い精度と低いコストを実現するために、タスク分解の深さ、ワーカーの選択、推論予算を同時に最適化する統合された強化学習ベースのオーケストレーション方針を導入する。

原著者: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

公開日 2026-05-07
📖 1 分で読めます☕ さくっと読める

原著者: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。ホテルの予約、フライトの予約、交通状況の確認、食事の準備など、国を横断するロードトリップの計画を立てるような、巨大で複雑な問題を解決しなければならないと。

人工知能の世界では、現在のほとんどのシステムは、この問題を以下の2つの不器用な方法のいずれかで処理しています。

  1. 「万能型ボス」: 飛行機の予約から野菜の切り方まで、すべてを最も高価で超優秀なCEO(巨大なAIモデル)に任せる方法です。これは機能しますが、天気予報を確認するだけの単純なタスクであっても、信じられないほど高価で遅いです。
  2. 「硬直した組立ライン」: 「まずCEOにフライトを依頼し、次にCEOにホテルを依頼する」といった、事前に書かれたスクリプトに従う方法です。これは柔軟性に欠けます。CEOが忙しい場合やタスクが変更された場合、ライン全体が停止してしまいます。

Uno-Orchestraは、このショーを運営するための新しい、より賢明な方法です。これは、自ら作業を行うのではなく、仕事のあらゆる微小な部分に対して誰を雇うべきかを正確に知っている、卓越したコスト意識の高いツアーマネージャーのようなものです。

核となるアイデア:「選択的委任」

ツアーマネージャー(Uno-Orchestra)は、あなたのリクエストを見て、同時に2つの質問を投げかけます。

  1. 「これを分解する必要があるか?」(分解)
  2. 「この特定の部分に最適な人材は誰か?」(ルーティング)
  • タスクが単純な場合(例:「2+2 は何か?」)、マネージャーは「誰にも頼む必要はない。即座に自分で答えよう」と言います。これにより、時間とコストが節約されます。
  • タスクが複雑な場合(例:「株式データを分析し可視化するPythonスクリプトを作成せよ」)、マネージャーはそれをサブタスクに分解します。「データを見つける」「コードを書く」「コードを実行する」「チャートを作成する」。
  • 魔法のトリック: 各サブタスクに対して、マネージャーは完璧な作業者を選びます。「データを見つける」タスクは、高速で安価なインターン(小さく安価なAIモデル)に割り当てられるかもしれません。しかし、「チャートを作成する」タスクは、専門的で高価なアーティスト(高性能で高価なAIモデル)に割り当てられます。

なぜこれほど優れているのかを学んだ方法

この論文では、新しい従業員を教育するプロセスのように、2段階のトレーニング過程が説明されています。

  1. インターンシップ(教師あり微調整): システムは、「マスターマネージャー」が問題を解決する61,000の事例を観察しました。このマスターマネージャーは、単なる推測ではなく、実際のツールと実際のコード実行を使用していました。システムは、いつ何を分解し、どの作業にどの作業者を選ぶべきかという、これらの成功パターンを模倣することを学びました。
  2. シミュレーションリーグ(強化学習): その後、システムは「トレーニングアリーナ」に投入され、自ら難しい問題を解決する必要がありました。
    • 問題を正しくかつ安価に解決すれば、高いスコアが与えられました。
    • 正しく解決したがコストを浪費した場合は、低いスコアとなりました。
    • 失敗した場合はゼロ点でした。
    • 重要なのは、システムが特定のステップに対して評価(または非難)を与えることを学んだ点です。ステップ3で間違った作業者を選んだ場合、単に最後に「失敗した」という一般的な評価を受けるのではなく、その特定のミスを学習しました。

結果:高速、安価、かつ賢明

研究者たちは、この新しいツアーマネージャーを、数学やコーディングから長文の読解まで、13種類の異なる課題にわたって、他の22のシステム(他の「ルーター」や「組立ライン」を含む)と比較してテストしました。

  • スコア: Uno-Orchestraは77%の成功率を達成し、これは次点のシステムよりも約16%優れていました。
  • コスト: さらに驚くべきことに、これは重厚なワークフローシステム1回あたりのクエリコストの10分の1で達成されました。

なぜよりうまく機能するのか

この論文は、その秘密は柔軟性にあると主張しています。

  • 古いシステムは、巨大な脳一つですべてを行おうとする(高価すぎる)か、硬直したスクリプトに従う(愚かすぎる)かのどちらかでした。
  • Uno-Orchestraはジャズミュージシャンのようです。単純な単音(直接の回答)を奏でるべき時と、バンド全体を招き入れるべき時(タスクの分解)を知っており、各音符にどの楽器(AIモデル)が必要かを正確に把握しています。

まとめ

Uno-Orchestraは、賢明なプロジェクトマネージャーになることを学ぶシステムです。単に質問をルーティングするだけでなく、どのように分解し、誰に割り当てるかを決定し、すべてを厳格な予算内で実行します。これは、最も困難な問題を解決するために最も高価なAIが必要なのではなく、適切な時に適切な仕事に適切なAIが必要であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →