← 最新の論文
🤖 AI

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

本論文は、長期的な生存タスクにおけるオープンエンドなマルチエージェント協調を評価するためのJAXベースのベンチマークである*alem*を紹介し、最先端のLLMは個別のタスクには長けているものの、コミュニケーションが極めて重要となる協調において著しく苦戦すること、そしてその性能がモデル間で大きく異なることを明らかにしている。

原著者: Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある探検家グループが、絶えず変化する広大な荒野で生き残ろうとしている場面を想像してください。彼らは薪を割り、石を採掘し、シェルターを築き、モンスターと戦う必要があります。しかし、ここには落とし穴があります。彼らはただ一人でこれらを行うことはできません。時には、木を倒すために「全く同じ瞬間」に木を叩かなければならないこともあります。また別の時には、一人が穴を掘り始め、もう一人が数秒以内にそれを終わらせなければならない場合もあります。さもなければ、穴は崩れてしまうのです。

この論文は、AIエージェントがこのような混沌とした長期的なサバイバルゲームにおいて、どれほど上手く協力できるかをテストするための新しい「訓練場」であるALEM(アムハラ語で「世界」を意味する)を紹介しています。

問題点:ソロのスター vs チームプレイヤー

これまで、AIのテストの多くは、まるで一人用ビデオゲームのようでした。「このAIはパズルを解けるか?」あるいは「迷路を通り抜けられるか?」といった問いです。しかし、現実世界では、AIはチームで働く必要があります。著者らは、既存のチームワークのテストは単純すぎると指摘しました。それらは短期的であったり、ルールが固定されていたり、あるいはチームメンバー間でコミュニケーションを取る必要がほとんどなかったりしたのです。

彼らは、現代のAI(大規模言語モデル、LL-M)が**長期的なコーディネーション(調整・連携)**を扱えるかどうかを知りたかったのです。50ステップ前に行った計画を覚えているか? 「私は左へ行くから、君は右へ行け」とチームメイトに伝えることができるか? 状況が変わったときに適応できるか?

解決策:ALEM(サバイバル・シミュレーター)

著者らは、Craftaxというゲームに基づいたデジタル世界、ALEMを構築しました。これはハイテク版のMinecraftTerrariaのようなものですが、次のような特徴があります。

  • プロシージャル生成(手続き型生成): ゲームが開始されるたびに、マップと特定のチームワークの課題がランダムに生成されます。これにより、AIが答えを単に「暗記」することを防ぎます。
  • 「コーディネーション・スペクトラム(連携の度合い)」: ゲームには、チームワークの難易度を制御するダイヤルがあります。
    • イージー: 基本的に一人で作業が可能です。
    • ミディアム: 壁を築いている人にハンマーを手渡すように、道具を互いに受け渡す必要があります。
    • ハード: シンクロナイズドスイミングのチームのように、完璧に動作を合わせなければならず、そうでなければタスクは失敗します。
  • ソフトな専門化: この世界では、誰でもどんな仕事もできますが、もしあなたがその仕事の「スペシャリスト」でなければ、失敗する可能性があります。これにより、チームは現場で即座に「誰が何をすべきか」を判断することを強いられます。

実験:13のAIエージェント vs 世界

研究者たちは、13種類の異なる最新AIモデルをこの世界に投入しました。彼らに遊び方を教えたわけではなく、ただ放り込んだのです(これは「ゼロショット」と呼ばれます)。また、可能な限界値を示すベンチマークとして、標準的な強化学習を用いた「ロボット」エージェントも用意しました。

結果は驚くべきものでした:

  1. AIは苦戦した: 平均して、AIエージェントは可能なスコアのわずか**6%**程度しか達成できませんでした。彼らはゲームを攻略するには程遠い状態でした。
  2. 単独での賢さは、チームとしての賢さを意味しない: 一部のAIモデルは、単独のタスク(薪を集めるなど)には非常に優れていましたが、コーディネーションに関しては極めて劣っていました。あるモデル、GPT-5.4は、基本的なタスクには非常に強かったものの、チームメイトと同期する必要がある場面では無残にも失敗しました。一方で、Gemini-3.1はチームワークにおいてより優れており、最も困難なシナリオにおいて、訓練されたロボットエージェントさえも上回る成績を収めました。
  3. サイズがすべてではない: より大きなAIモデル(より多くの「脳の力」を持つもの)が、必ずしもチームとして優れた成果を出すとは限りませんでした。時には、巨大なモデルよりも小さなモデルの方がうまく連携できることもありました。

「なぜか」:何がチームワークを困難にするのか?

研究者たちは、AIエージェントを分解して、何が失敗の原因となっているのかを探りました。そこで、3つの主要な要素が見つかりました。

  • コミュニケーションこそが王様: エージェントが互いに会話する能力をオフにすると、チームワークのスコアは急落しました。AIエージェントはチャットを通じて、「今から木に行くから、君はここで待ってて」「木をちょうだい」といったやり取りを行っていました。これがないと、彼らはただ推測するしかなくなります。
  • 記憶は計画のためにある: AIには「スクラッチパッド(メモ帳)」がありました。最も優れたパフォーマンスを出したモデルは、将来の計画(例:「ステップ1:石を掘る。ステップ2:炉を作る」)を書き留めるためにこのメモ帳を使用していました。弱いモデルは、単に「今見ていること」を繰り返すためだけにメモ帳を使っており、それは先を見通して計画を立てる助けにはなりませんでした。
  • 推論が助けになる: AIが行動する前に「考える」ことを強制されると、単独タスクにおいてもチームワークにおいても、より良い結果を出しました。

「混合チーム」の驚き

研究者たちは、異なるAIモデルを一つのチームに混ぜる実験(例:GeminiエージェントとGPTエージェントの混合チーム)も行いました。彼らは、チームの性能が最も賢いメンバーと同等になることを予想していました。しかし、実際にはチームの成績は両者の平均となりました。たとえ超知能なチームメイトがいたとしても、もう一方が計画やコミュニケーションスタイルを理解していなければ、チームとしては機能しないことが分かったのです。

結論

この論文は、コーディネーション(連携)は現在のAIがまだ習得できていない独自のスキルであることを示しています。AIが単独で質問に答えたりパズルを解いたりすることに長けているからといって、チームとして働けるとは限らないのです。

ALEMは、この特定の「チームワークのボトルネック」を測定するための制御された方法を提供しています。現実世界で人間や他のAIと真に協力できるAIを構築するためには、単に単独タスクにおける知能を高めるだけでなく、コミュニケーション、共同計画、そして互いに信頼する方法を教えることに焦点を当てる必要があることを、この研究は示唆しています。

この「サバイバル・シミュレーター」のコードは、他の研究者が利用し、改良できるように公開されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →