← 最新の論文
🤖 AI

ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox

本論文は、300 以上の相互依存ツールと動的環境シミュレーションに基づきモデルコンテキストプロトコル上で構築された厳密なベンチマークである ComplexMCP を導入し、ツール検索の飽和、過信、戦略的敗北感といったボトルネックにより、現在の LLM エージェントが複雑なワークフローにおいて人間よりも著しく低いパフォーマンスを示すことを明らかにする。

原著者: Yuanyang Li, Xue Yang, Longyue Wang, Weihua Luo, Hongyang Chen

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Yuanyang Li, Xue Yang, Longyue Wang, Weihua Luo, Hongyang Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、教養のあるロボットアシスタントを雇い、複雑なビジネスを運営するのを手伝ってもらうと想像してみてください。あなたは「株をいくつか買う」「フライトを予約する」「友人にメッセージを送る」といったタスクのリストを与えます。

過去には、研究者たちはこれらのロボットを「2+2 を計算する」や「天気を調べる」といった単純で孤立したタスクを与えてテストしていました。ロボットたちはこれらのタスクでは非常に優秀でした。しかし、現実世界ではタスクは厄介です。それらは互いに依存しています(誰が旅行するか分からない限り、フライトを予約できません)。システムは不具合を起こす可能性があります(インターネットが遅延するかもしれません)。また、作業中に環境が変化する可能性があります(友人があなたをブロックしたかもしれないし、ショッピングカートにはすでに商品が入っているかもしれません)。

問題:「ラストマイル」のギャップ
この論文『ComplexMCP』の著者たちは、私たちの AI エージェントは簡単なことは得意だが、「ラストマイル」、つまり現実世界の仕事を実際に完了させるための最終的な困難なステップにおいて失敗すると主張しています。彼らは、空き地では完璧に並列駐車ができる運転手ですが、穴ぼこや他の車が混雑する忙しい都市の通りを運転しようとしたときに衝突してしまうようなものです。

解決策:AI 向けの「シミュレートされた都市」
これらのロボットが現実の混沌をどれだけうまく処理するかをテストするために、チームはComplexMCPを構築しました。これは単純なクイズではなく、7 つの異なる地区(ソーシャルメディアの町、株式市場、オンラインストア、旅行代理店など)を持つ巨大なシミュレートされたビデオゲームの都市だと考えてください。

  • ツール: この都市の中には、AI が使用する 300 種類以上の異なる「ツール」(ボタン、レバー、API)があります。
  • 混沌: 重要なのは、これらのツールが相互に接続されていることです。単にボタンを押すだけでは済みません。ツールが機能する前に、まずネットワークを修復したり、残高を確認したり、ユーザーの身元を確認したりする必要があるかもしれません。
  • 「シード」メカニズム: テストを公平かつ現実的なものにするため、彼らは「シード」(乱数発生器のようなもの)を使用します。これにより、テストを実行するたびに都市はわずかに異なるように見えます(異なるユーザー、異なる価格、異なるネットワーク速度など)が、ルールは同じままです。これにより、AI が単に答えを暗記することを防ぎます。

大規模テスト:ロボット対人間
研究者たちは、トップクラスの AI モデル(GPT-5、Gemini、Claude など)をこの都市に入れ、47 の複雑なミッションを与えました。また、同じツールを使用して、実際の人間にも同じタスクを行わせました。

結果:厳しい現実のチェック
結果は驚くべきものであり、かつ戒めとなりました。

  • 人間は約**94%**の成功率でした。
  • 最高性能の AI(Gemini-3-Flash)は約**55%**の成功率でした。
  • 最も高度なモデルでさえ、60% 以上の成功率を達成するのは困難でした。

なぜロボットは失敗するのか?
この論文は、これらの賢いエージェントが現実世界でつまずく 3 つの主な理由を特定しています。

  1. 「ツールの過負荷」(検索飽和): 30 万冊の本がある図書館で特定の 1 冊の本を見つけなければならない司書を想像してください。カタログを与えずに本を見つけるよう頼めば、彼らは圧倒されてしまいます。同様に、AI が数百のツールから選択しなければならない場合、適切なツールを忘れたり、選択肢の膨大な数に混乱したりすることがよくあります。
  2. 「クリーンスレート」バイアス(過信): これが最も一般的な間違いです。AI は世界が空っぽで新鮮であると仮定します。まるで新しいゲームのレベルのようです。しかし実際には、「ショッピングカート」にはすでに商品が入っていたり、「ネットワーク」が壊れていたりする可能性があります。AI は現在の状態を確認するのを飛ばして、ただ行動しようとするため、誤り(すでに持っているものを買おうとするなど)につながります。これは、スペースがあるか確認せずに、満杯のスーツケースに新しいアイテムを入れようとするようなものです。
  3. 戦略的敗北主義: AI が小さなエラー(一時的なネットワークの不具合など)に遭遇すると、それを修正しようとする(「ネットワークアクセラレーター」というツールを呼び出すなど)のではなく、しばしば諦めてしまいます。問題を解決するための別の経路を試す代わりに、高度な言語能力を使って丁寧に「これできません」と言います。これは、穴ぼこを見て、それを避けて運転するのではなく、すぐに車を引き返す運転手のようなものです。

「検索」(RAG)についてはどうでしょうか?
研究者たちは、AI にすべての 300 のツールを一度に見せるのではなく、適切なツールを見つけるための「検索エンジン」を与えることで改善されるかもテストしました。メモリを節約することはできましたが、実際にはこれらの複雑なタスクにおいて AI の性能を低下させました。なぜでしょうか?検索エンジンが次のステップに必要な「隠れた」ツールを見つけられなかったからです。これは、司書に「料理に関する本」を尋ねたが、実際に必要な本が「ケーキの焼き方」というタイトルで、司書はつながりが明白でないと考えてそれを提案しなかったようなものです。

結論
この論文は、AI がより賢くなっている一方で、複雑で厄介な現実世界の環境において、完全に自律的な労働者として準備が整っているわけではないと結論付けています。世界の現在の状態を認識し、小さなエラーから回復し、複雑な依存関係の連鎖を navigate する能力が欠けています。ComplexMCPは、AI 向けの新しい「運転免許試験」となり、これらの弱点を発見し、次の世代のロボットが衝突することなく都市を走行することを学べるように設計されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →