← 最新论文
💻 computer science

Closed-Loop Vision-Language Planning for Multi-Agent Coordination

本文介绍了 COMPASS,这是一种新颖的多智能体框架,它利用视觉 - 语言模型进行去中心化的闭环规划,结合基于代码的技能优化与结构化通信,在 SMACv2 基准测试中显著超越传统多智能体强化学习基线,从而实现了最先进的性能。

原作者: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教五位朋友玩一款像《星际争霸》那样复杂且快节奏的电子游戏,对手也是五名玩家。难点在于?每位朋友只能看到自己周围的一小圈区域。他们无法看到整张地图,无法自由交谈以免陷入混乱,而且必须做出瞬间决策才能获胜。

这正是该论文所解决的挑战。传统的 AI 方法(如“多智能体强化学习”)就像是通过让这五位朋友玩数百万次游戏来教他们,希望他们最终能偶然发现获胜策略。这种方法既缓慢又浪费,而且很难理解他们为何会做出某个特定动作。

作者们引入了一种名为COMPASS的新系统。你可以将 COMPASS 想象成由五位朋友组成的团队,他们受一位超级聪明、精通视觉的教练(视觉 - 语言模型)指导,这位教练能够看到游戏屏幕并阅读文本日志。以下是 COMPASS 的工作原理,分为三个简单部分:

1. 拥有“技能书”的教练(规划器与技能库)

教练不会像喊“向左走!”或“攻击!”那样发出随机指令,而是拥有一本技能库。这就像一本包含特定战术预制食谱(Python 代码)的烹饪书,例如“集火”(所有人攻击同一敌人)或“风筝”(边跑边射击)。

  • 如何学习:教练并非从零开始。它首先阅读人类专家玩游戏时的“视频回放”(这是“预热启动”)。它将那些专家的操作转化为代码,并放入烹饪书中。
  • 如何适应:在游戏过程中,如果教练发现当前的食谱行不通,它会即时编写食谱。例如,如果团队在某场战斗中失利,教练可能会立即编写一个名为“激进侧翼”的新脚本,并将其加入书中。
  • 循环:教练观察屏幕,选择食谱,智能体执行该食谱,然后教练检查结果。如果失败,教练会反思,编写更好的食谱,并再次尝试。这就是“闭环”部分——它实时不断调整。

2. “耳语网络”(结构化通信)

在许多游戏中,如果智能体随意聊天,它们会感到困惑或编造信息(产生幻觉)。COMPASS 使用严格的“耳语网络”。

  • 问题:智能体 A 看到了敌人。智能体 B 在墙后,看不见敌人。
  • 解决方案:智能体 A 向智能体 C 耳语,智能体 C 再向智能体 B 耳语。这被称为多跳传播
  • 类比:想象一个“传话”游戏,但智能体传递的不是被扭曲的信息,而是精确的事实:“1 号敌人在东边 5 米处。”这使得整个团队能够构建战场的共享心理地图,即使没有任何单个智能体能看到一切。

3. “自我修正”(反思)

每次行动后,教练都会自问:“那奏效了吗?”

  • 如果团队成功包围了敌人,教练会说:“太好了,保存那个食谱。”
  • 如果团队全军覆没,教练会说:“那太激进了。让我们写一条新规则,下次更谨慎些。”
    这种持续的自我反思使团队能够随着游戏进程变得更聪明,而不是仅仅重复同样的错误。

结果:他们表现如何?

团队在名为SMACv2的《星际争霸》挑战的极难版本上测试了 COMPASS。

  • 重大胜利:在一个双方都有 5 个神族单位(平衡对战)的特定场景中,COMPASS 的胜率为57%。而最好的先前 AI 方法(QMIX)的胜率仅为27%。这是一个巨大的飞跃。
  • 局限性:该系统在应对“虫族”(一群快速但脆弱的单位)时遇到了困难。因为教练每 10-20 秒(游戏时间)检查一次屏幕并编写新代码,这对于需要瞬间反应的虫族单位来说太慢了。这就像试图用一位行动缓慢的交警来指挥一群蜜蜂;蜜蜂移动得太快,指令跟不上。

总结

COMPASS是一个让 AI 智能体通过以下方式协作的系统:

  1. 像人类一样阅读游戏(利用视觉和文本)。
  2. 在游戏过程中编写自己的操作手册(代码),从专家示例开始。
  3. 通过结构化链条共享信息,以便每个人都知道发生了什么,即使他们看不见。

它证明,通过将大型 AI 模型的推理能力与结构化的信息共享及代码编写方式相结合,机器人(或游戏智能体)能够比以前更快、更智能地学习协作——前提是游戏的速度不会快到让 AI 跟不上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →