← 最新の論文
🤖 AI

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

本論文は、MCPサーバーにおける動的なツールセットの進化に対するLLMエージェントの適応性を評価する新しいベンチマークであるMCPEvol-Benchを紹介し、現実的なインターフェースの変化をシミュレートすることで、最先端のモデルであってもそのような適応に苦戦し、大幅な性能低下を招くことを明らかにしている。

原著者: Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットアシスタントを構築していると想像してみてください。あなたは、電卓やカレンダー、検索エンジンといった道具を使って問題を解決する方法を、そのロボットに教え込みます。人工知能の世界では、これらの道具は「Model Context Protocol(MCP)」と呼ばれる標準的なシステムを通じて接続されていることが多く、これは万能なプラグアンドプレイ・アダプターのように機能し、ロボットが膨大なデジタル道具箱から必要な道具を自由に手に取れるようにします。長い間、科学者たちはロボットに固定された一連の道具を与え、それを使ってパズルを解けるかどうかをテストしてきました。それは、道路標識が動かず、信号機も変わらないコースでドライバーをテストするようなものでした。しかし、現実世界では、道具は混沌としており、生き物です。道具は常にアップデートされ、名前が変更されたり、置き換えられたりしています。大きな疑問は、もしロボットが作業している最中に道具箱が変わってしまったら、ロボットは混乱してクラッシュしてしまうのか、それとも適応して作業を続行できるのか、ということです。

これこそが、研究者たちが「MCPEvol-Bench」を通じて知りたかったことです。彼らは、従来のテストは道具が進化することを考慮していなかったため、簡単すぎると気づきました。これを解決するために、彼らは「MCPEvol-Bench」という、動的な新しいテスト環境を構築しました。静止したコースではなく、ロボットが使用する道具がタスクの途中で変化する「生きている」環境を作り出したのです。彼らは123個の実際のツールサーバーを調査し、現実世界では、約20%のリモートサーバーがオフラインになり、半分以上のツールが時間の経過とともに削除または置換されることを発見しました。この混沌を模倣するために、彼らは11種類の「ミューテーション・オペレーター(変異演算子)」を考案しました。これは、デジタルな変異ウイルスのようなもので、自動的にツールを微調整します。ソフトウェア開発者がアップデート中に行うように、新しいボタンを追加したり、パラメータの名前を変更したり、機能を完全に削除したりします。

結果は、一種の警鐘となりました。研究者たちは、GPT-5.4やClaude-Sonnet-4-6といった強力なモデルを含む、利用可能な最も高度な12のAIモデルをテストしました。最初は、ツールが安定しているとき、これらのモデルは優れたパフォーマンスを発揮しました。しかし、ツールが進化し始めると、ロボットたちはつまずきました。最も賢いモデルであっても、ツールが変化すると、成功率は大幅に(約13.7%から14.4%)低下しました。研究によると、ロボットは必ずしもツールの使い方を忘れたわけではなく、代わりに「計画」と「推論」の段階で行き詰まっていました。それは、玉ねぎの切り方を完璧に知っているシェフが、突然ナイフがスプーンに置き換わっていることに気づいたようなものです。彼らはレシピをどう調整すべきか分からず、結局料理を台無しにしてしまいます。研究者は、新しいツールが追加されたり説明が変更されたりすることがエージェントを最も混乱させる一方で、不要なツールを取り除くことはむしろ助けになることを発見しました。また、エージェントに「記憶」や「内省」といった「認知」的な機能を追加することで、適応力が向上することも分かりました。これは、AIの未来が単に賢くなることだけでなく、周囲の世界が変わったときに、より柔軟になれることにあることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →