← 最新の論文
💬 NLP

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

本調査は、検索器やエージェントなどの外部コンポーネントと大規模言語モデルを統合する新興パラダイムとして「複合 AI システム」を定義し、現在の断片化に対処し、システムレベルの人工知能における将来の研究を導くために、RAG や LLM エージェントなどの基盤パラダイムに対する統一的な分類体系と分析を提案する。

原著者: Jiayi Chen, Junyi Ye, Guiling Wang

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: Jiayi Chen, Junyi Ye, Guiling Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「LLM(大規模言語モデル)」という名前の、非常に優秀で読書量の多い司書がいると想像してください。この司書は、ある特定の時点までに書かれたほぼすべての本を読み尽くしています。物語を書くこと、質問に答えること、会話することにおいて、驚くほど高速です。しかし、彼には3つの大きな問題があります。

  1. 物事を忘れること:学習を停止した後に起きた事実を記憶できません(知識が「古くなっている」状態です)。
  2. 嘘をつくこと:答えがわからないとき、自信を持って架空の事実を捏造することがあります(これを「ハルシネーション」と呼びます)。
  3. 計算やツールの使用ができないこと:話すことは得意ですが、複雑な方程式を計算したり、リアルタイムのインターネットを検索したり、ロボットアームを制御したりすることはできません。

この論文は、コンパウンドAIシステム(CAIS)と呼ばれる新しいAIの構築方法を紹介します。CAISは、たった一人の司書に頼るのではなく、これらの問題を解決するために司書の周りにチームオーケストラを構築します。

以下は、この論文が単純なアナロジーを用いてこの「チーム」を分解したものです。

1. 4人の主要なチームメンバー(軸)

この論文は、この新しいAIの世界を、協力して働く4つの主要な役割に整理しています。

  • リサーチャー(RAG:検索拡張生成)

    • 問題点:司書は今日のニュースや貴社の機密ファイルを知りません。
    • 解決策:司書が回答する前に、リサーチャーが図書館の棚(またはインターネット)へ走り、特定の最新ドキュメントを見つけます。彼らはこれらのメモを司書に渡し、推測ではなく事実に基づいて回答できるようにします。
    • アナロジー:試験の直前に司書にカンニングペーパーを与えるようなものです。
  • プロジェクトマネージャー(LLMエージェント)

    • 問題点:司書は単一のタスクは得意ですが、多くのステップを要する長く複雑なプロジェクトには混乱してしまいます。
    • 解決策エージェントは計画を立てられる司書のバージョンです。大きなタスク(例:「休暇を計画する」)を小さなステップ(フライトの予約→ホテルの検索→天候の確認)に分解します。また、旅行APIを呼び出したり計算を行ったりするなどのツールを使用し、その後、自分の作業をチェックして間違いを修正することもできます。
    • アナロジー:レンガを積むだけでなく、設計図を描き、資材を注文し、作業を検査する現場監督のようなものです。
  • マルチモーダル専門家(MLLMs:マルチモーダル大規模言語モデル)

    • 問題点:司書はテキストしか読めません。壊れたエンジンの写真や嵐の動画を見せると、彼らは盲目です。
    • 解決策 これらは目と耳を与えられた司書たちです。画像を見て、音声を聞き、動画を視聴し、それを見て何を説明するか、あるいはそれについて質問に答えることができます。
    • アナロジー:司書に眼鏡とヘッドフォンを与えて、書かれた言葉だけではない世界を理解できるようにするようなものです。
  • 指揮者(オーケストレーション)

    • 問題点:リサーチャー、プロジェクトマネージャー、マルチモーダル専門家が揃っても、互いに話し合いが被ったり、誰が何をするか混乱したりする可能性があります。
    • 解決策 指揮者はチーム全体を管理するシステムです。いつリサーチャーを呼ぶか、いつエージェントに計画を依頼するか、そして彼らの回答をどのように1つの最終結果に統合するかを決定します。チームがスムーズに連携して働くように保証します。
    • アナロジー:交響楽団を想像してください。司書はバイオリニストですが、指揮者はドラム、フルート、バイオリンが音楽を作るために、騒音ではなく、正しいタイミングで演奏されるようにします。

2. 彼らがどのように連携するか(パイプライン)

この論文は、現実世界のコンパウンドAIシステムはこれらの中の1つだけではなく、通常はこれらすべてが同時に機能するものであると説明しています。

あなたがシステムに「この壊れた機械の写真を分析し、修理するためのマニュアルを見つけてください」と尋ねたと想像してください。

  1. マルチモーダル専門家が写真を見て、その機械が何かを理解します。
  2. リサーチャーが外に出て、その機械のモデルに特化したマニュアルを見つけます。
  3. プロジェクトマネージャー(エージェント)が修理手順を特定し、部品が在庫にあるか確認するためにツールを使用することを決定します。
  4. 指揮者(オーケストレーション)がフローを管理し、写真の分析がマニュアル検索の前に実行されるようにし、すべてを明確な回答として統合します。

3. 現在の課題

この論文は、この「チーム」アプローチが強力である一方で、現在はまだ混乱していることも認めています。

  • 複雑であること:1人を雇うよりもチームを構築する方が困難です。もし一部の部分が壊れれば、システム全体が失敗する可能性があります。
  • 共通言語がないこと:異なるツールやエージェントはしばしば異なる形式を使用するため、それらを接続することが困難です(ヨーロッパの充電器をアメリカのコンセントに差し込もうとするようなものです)。
  • テストが難しいこと:特に画像を見ながらツールと対話しているような状況において、チーム全体がうまく機能しているかどうかを確認する完璧なテストはまだ存在しません。

4. 未来:標準化

この論文は、人々が**モデルコンテキストプロトコル(MCP)**のような「ユニバーサルアダプター」を作り始めていることを強調しています。これらは、あらゆるAIツールをあらゆるAIシステムに簡単に接続できる、ユニバーサル電源タップのようなものです。目標は、すべての接続ごとにカスタムブリッジを構築するのをやめ、代わりにこれらすべてのAIコンポーネントが互いに会話するための標準的な方法を持つことです。

まとめ

要約すると、この論文はこう述べています:すべてを完璧に行う1つの巨大な脳を作ろうとするのをやめなさい。代わりに、脳(LLM)を記憶バンク(検索)、プランナー(エージェント)、目/耳(マルチモーダル)、そして管理者(オーケストレーション)に接続するスマートなシステムを構築しなさい。この「コンパウンド」システムは、単一のモデルの限界を克服するため、AIの未来です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →