← 最新の論文
💻 computer science

Closed-Loop Vision-Language Planning for Multi-Agent Coordination

本論文は、コードベースのスキル洗練と構造化された通信を用いた分散型クローズドループ計画を実現するために視覚言語モデルを活用する新たなマルチエージェントフレームワークである COMPASS を紹介し、従来の MARL ベースラインを大幅に上回る性能を発揮することで SMACv2 ベンチマークにおいて最先端の成果を達成した。

原著者: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

5 人の友人に、『スタークラフト』のような複雑でテンポの速いビデオゲームを、5 人の敵チーム相手にプレイさせることを想像してみてください。ただし、条件があります。各友人は自分自身の周りにある小さな円しか見ることができません。彼らは全マップを見ることはできず、混乱を招くことなく自由に会話することもできず、勝利するためには瞬時の判断を下さなければなりません。

これが、この論文が取り組む課題です。従来の AI 手法(「マルチエージェント強化学習」など)は、これらの友人にゲームを何百万回もプレイさせ、最終的に勝利の戦略にたどり着くことを期待して指導しようとするようなものです。それは遅く、非効率的であり、なぜ彼らが特定の動きをしたのかを理解するのが困難です。

著者たちは、COMPASSと呼ばれる新しいシステムを導入しました。COMPASS を想像してください。それは、ゲーム画面を見てテキストログを読み取ることができる、超知的で視覚に優れたコーチ(ビジョン・ランゲージモデル)に導かれる 5 人の友人のチームのようなものです。COMPASS の仕組みを、3 つの簡単な部分に分解して説明します。

1. 「スキルブック」を持つコーチ(プランナーとスキルライブラリ)

コーチが「左へ進め!」や「攻撃せよ!」といった無作為な指示を叫ぶのではなく、コーチにはスキルライブラリがあります。これは、特定の戦術のための事前作成されたレシピ(Python コード)のレシピ本のようなものです。例えば、「集中攻撃(すべてのユニットが同じ敵を攻撃する)」や「キティング(撃ちながら逃げること)」などが含まれます。

  • 学習方法: コーチはゼロから始めません。まず、ゲームをプレイする人間のエキスパートの「ビデオリプレイ」を読み取ります(これが「ウォームスタート」です)。エキスパートの動きをコードに変換し、それをレシピ本に追加します。
  • 適応方法: ゲーム中、コーチは現在のレシピが機能していない状況に遭遇すると、その場で新しいレシピを作成します。例えば、チームが特定の戦闘で負けている場合、コーチは「積極的な側面攻撃」という新しいスクリプトを作成し、即座に本に追加します。
  • ループ: コーチは画面を見てレシピを選び、エージェントがそれを実行し、その後コーチが結果を確認します。失敗した場合、コーチは反省し、より良いレシピを作成して再試行します。これが「クローズドループ」の部分であり、リアルタイムで調整し続けます。

2. 「ささやきネットワーク」(構造化されたコミュニケーション)

多くのゲームでは、エージェントがランダムに会話すると、混乱したり、事実無根のことを言ったり(ハルシネーション)します。COMPASS は厳格な「ささやきネットワーク」を使用します。

  • 問題点: エージェント A が敵を見ています。エージェント B は壁の後ろにいて、敵を見ることができません。
  • 解決策: エージェント A がエージェント C にささやき、C が B にささやきます。これをマルチホップ伝播と呼びます。
  • アナロジー: 「電話」ゲームを想像してください。ただし、メッセージが歪むのではなく、エージェントは正確な事実を伝達します。「敵 #1 は東に 5 メートル」。これにより、単一のエージェントがすべてを見ることはできなくても、チーム全体が戦場の共有されたメンタルマップを構築できます。

3. 「自己修正」(反省)

すべての動きの後、コーチは自分に問いかけます。「それはうまくいったか?」

  • チームが敵を取り囲むことに成功した場合、コーチは「素晴らしい、そのレシピを保存せよ」と言います。
  • チームが全滅した場合、コーチは「それは攻撃的すぎた。次はより慎重になるための新しいルールを書こう」と言います。
    この絶え間ない自己反省により、チームは同じ過ちを繰り返すのではなく、ゲームが進むにつれてより賢くなります。

結果:どれほどうまくいったか?

チームは、SMACv2と呼ばれる『スタークラフト』の非常に難しいバージョンで COMPASS をテストしました。

  • 大きな勝利: 両チームが 5 つのプロトスユニットを持つ特定のシナリオ(バランスの取れた戦い)において、COMPASS は**57%の勝率を記録しました。これまでにあった最高の AI 手法(QMIX)の勝率は27%**でした。これは劇的な向上です。
  • 限界: このシステムは「ズール」種族(速く弱いユニットの群れ)には苦労しました。コーチは画面を確認し、ゲーム時間にして 10〜20 秒ごとに新しいコードを作成するため、瞬時の反応が必要なズールのユニットには遅すぎたのです。これは、ゆっくり動く交通整理員で蜂の群れを指揮しようとするようなもので、蜂の動きが指示に追いつきません。

まとめ

COMPASSは、以下の方法で AI エージェントが協力することを可能にするシステムです。

  1. 人間のように(視覚とテキストを使用して)ゲームを読み解く
  2. エキスパートの例から始め、プレイしながら自分たちの取扱説明書(コード)を作成する
  3. 構造化されたチェーンを通じて情報を共有し、誰もが見ることができないことでも全員が何が起こっているかを知る。

これは、大規模 AI モデルの推論能力と、情報を共有しコードを作成するための構造化された方法を組み合わせることで、ロボット(またはゲームエージェント)は、以前よりもはるかに速く、より賢く協力して学習できることを証明しています。ただし、ゲームが AI が追いつくには速すぎる動きをしていないことが条件です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →