想象一下,你正试图教五位朋友玩一款像《星际争霸》那样复杂且快节奏的电子游戏,对手也是五名玩家。难点在于?每位朋友只能看到自己周围的一小圈区域。他们无法看到整张地图,无法自由交谈以免陷入混乱,而且必须做出瞬间决策才能获胜。
这正是该论文所解决的挑战。传统的 AI 方法(如“多智能体强化学习”)就像是通过让这五位朋友玩数百万次游戏来教他们,希望他们最终能偶然发现获胜策略。这种方法既缓慢又浪费,而且很难理解他们为何会做出某个特定动作。
作者们引入了一种名为COMPASS的新系统。你可以将 COMPASS 想象成由五位朋友组成的团队,他们受一位超级聪明、精通视觉的教练(视觉 - 语言模型)指导,这位教练能够看到游戏屏幕并阅读文本日志。以下是 COMPASS 的工作原理,分为三个简单部分:
1. 拥有“技能书”的教练(规划器与技能库)
教练不会像喊“向左走!”或“攻击!”那样发出随机指令,而是拥有一本技能库。这就像一本包含特定战术预制食谱(Python 代码)的烹饪书,例如“集火”(所有人攻击同一敌人)或“风筝”(边跑边射击)。
- 如何学习:教练并非从零开始。它首先阅读人类专家玩游戏时的“视频回放”(这是“预热启动”)。它将那些专家的操作转化为代码,并放入烹饪书中。
- 如何适应:在游戏过程中,如果教练发现当前的食谱行不通,它会即时编写新食谱。例如,如果团队在某场战斗中失利,教练可能会立即编写一个名为“激进侧翼”的新脚本,并将其加入书中。
- 循环:教练观察屏幕,选择食谱,智能体执行该食谱,然后教练检查结果。如果失败,教练会反思,编写更好的食谱,并再次尝试。这就是“闭环”部分——它实时不断调整。
2. “耳语网络”(结构化通信)
在许多游戏中,如果智能体随意聊天,它们会感到困惑或编造信息(产生幻觉)。COMPASS 使用严格的“耳语网络”。
- 问题:智能体 A 看到了敌人。智能体 B 在墙后,看不见敌人。
- 解决方案:智能体 A 向智能体 C 耳语,智能体 C 再向智能体 B 耳语。这被称为多跳传播。
- 类比:想象一个“传话”游戏,但智能体传递的不是被扭曲的信息,而是精确的事实:“1 号敌人在东边 5 米处。”这使得整个团队能够构建战场的共享心理地图,即使没有任何单个智能体能看到一切。
3. “自我修正”(反思)
每次行动后,教练都会自问:“那奏效了吗?”
- 如果团队成功包围了敌人,教练会说:“太好了,保存那个食谱。”
- 如果团队全军覆没,教练会说:“那太激进了。让我们写一条新规则,下次更谨慎些。”
这种持续的自我反思使团队能够随着游戏进程变得更聪明,而不是仅仅重复同样的错误。
结果:他们表现如何?
团队在名为SMACv2的《星际争霸》挑战的极难版本上测试了 COMPASS。
- 重大胜利:在一个双方都有 5 个神族单位(平衡对战)的特定场景中,COMPASS 的胜率为57%。而最好的先前 AI 方法(QMIX)的胜率仅为27%。这是一个巨大的飞跃。
- 局限性:该系统在应对“虫族”(一群快速但脆弱的单位)时遇到了困难。因为教练每 10-20 秒(游戏时间)检查一次屏幕并编写新代码,这对于需要瞬间反应的虫族单位来说太慢了。这就像试图用一位行动缓慢的交警来指挥一群蜜蜂;蜜蜂移动得太快,指令跟不上。
总结
COMPASS是一个让 AI 智能体通过以下方式协作的系统:
- 像人类一样阅读游戏(利用视觉和文本)。
- 在游戏过程中编写自己的操作手册(代码),从专家示例开始。
- 通过结构化链条共享信息,以便每个人都知道发生了什么,即使他们看不见。
它证明,通过将大型 AI 模型的推理能力与结构化的信息共享及代码编写方式相结合,机器人(或游戏智能体)能够比以前更快、更智能地学习协作——前提是游戏的速度不会快到让 AI 跟不上。
技术摘要:面向多智能体协调的闭环视觉 - 语言规划(COMPASS)
问题陈述
协作多智能体强化学习(MARL)在样本效率、可解释性和泛化能力方面面临重大挑战,尤其是在复杂、部分可观测的环境中。尽管大语言模型(LLM)已展现出强大的规划能力,但其在多智能体系统中的应用主要受限于以下两个因素:
- 仅文本输入:现有的基于 LLM 的智能体往往仅依赖文本观测,未能利用对实时战术决策至关重要的多模态(视觉)信息。
- 开环局限性:许多方法采用开环规划,无法充分处理多智能体任务中非马尔可夫、部分可观测的特性,在这些任务中,智能体必须动态适应随机环境和不完全信息。
此外,传统的 MARL 方法在因通信开销导致集中式控制器不可行时,往往难以扩展;而分布式方法则受限于局部观测与全局状态之间的差异。
方法论:COMPASS 框架
作者提出了COMPASS,这是一个去中心化的闭环框架,通过集成视觉 - 语言模型(VLM)来实现鲁棒的多智能体协调。该架构由三个协同组件构成:
1. 基于 VLM 的闭环规划器
受认知架构启发,该规划器采用四个专门的 VLM 模块,以迭代的方式进行感知、推理、反思和行动:
- 感知:处理多模态输入(视觉截图和文本描述),以构建全面的环境理解。它在两个层面运行:直接观测处理以及通过通信协议进行协作信息合成。
- 任务推理:根据当前的环境反馈和团队目标,将高层目标(例如“击败所有敌方单位”)分解为具体、可执行的子任务。
- 自我反思:持续评估已执行技能的质量和任务完成情况,生成语言反馈以优化未来的决策。
- 执行器:根据提出的子任务和反思反馈,从动态技能库中选择并执行最合适的技能。
2. 自适应技能合成
COMPASS 利用一个包含可执行 Python 代码的动态技能库,这些代码代表战术行为。该库通过两种机制演进:
- 演示引导(Demonstration Bootstrapping):为了避免从零开始进行低效探索,系统通过分析专家演示视频(通过 MAPPO 收集)来初始化技能库。VLM 提取战略模式并将其转化为有文档记录的 Python 函数。
- 增量合成:在任务执行过程中,如果现有技能不足以完成提出的子任务,VLM 将生成新的 Python 脚本。这些脚本遵循结构化的接口,包含用于动态优先级的
score_target(unit) 和用于行为协调的 control_logic()。系统根据自我反思和执行结果不断细化这些技能。
3. 结构化通信协议
为了解决部分可观测性问题,同时避免无约束自然语言通信中常见的幻觉问题,COMPASS 实施了一种基于实体的结构化协议:
- 多跳传播:智能体通过全局内存共享对实体(盟友和敌人)的局部观测。信息通过中间盟友(多跳)进行传播,使智能体能够推断其直接视野之外实体的状态和位置。
- 全局内存:一个所有智能体均可访问的共享存储库,使得即使在分布式执行的情况下,也能构建对环境连贯、整体的理解。
主要贡献
- 去中心化闭环规划:与以往通常依赖集中式规划或开环执行的基于 LLM 的多智能体工作不同,COMPASS 实现了一个完全去中心化的闭环系统,其中 VLM 根据实时的视觉和文本反馈不断调整策略。
- 代码即策略与动态库:该框架超越了固定的原始动作,通过即时生成和细化可执行的 Python 代码(技能)。这种方法增强了可解释性,并允许积累可重用的战术知识。
- 基于实体的结构化通信:本文提出了一种通信协议,通过专注于实体信息的结构化多跳传播,减轻了无意义闲聊和幻觉的风险,有效解决了部分可观测性挑战。
- 从专家数据引导:该方法展示了如何从离线专家演示中初始化复杂的技能库,显著降低了发现可行策略所需的样本复杂度。
实验结果
该框架在SMACv2(星际争霸多智能体挑战 v2)基准上进行了评估,与原始 SMAC 相比,该基准具有更高的复杂度和部分可观测性。
- 性能:在对称的神族(Protoss)5v5 场景中,COMPASS 显著优于最先进的 MARL 基线(包括 QMIX、MAPPO、HAPPO、HASAC 和 MAT),获胜率达到57%,而 QMIX 为 27%(高出 30 个百分点)。
- 鲁棒性:该系统在人族(Terran)场景中保持了中等性能,并有效处理了非对称(5v6)设置,证明了技能库和通信协议在弥补数量劣势方面的效用。
- 局限性:在虫族(Zerg)场景中性能受限(获胜率为 16%),特别是在对抗如自爆蚊(Banelings)和跳虫(Zerglings)等虫群单位时。作者将此归因于 VLM 的查询频率(每 10–20 个时间步)与近身虫群协调所需的亚秒级战术窗口之间的不匹配。
- 消融研究:
- 通信:移除多跳通信导致胜率急剧下降(从 57% 降至 6%),突显了其在部分可观测性中的关键作用。
- 视觉输入:省略图像输入导致性能下降 10%,证实了视觉基础对空间理解的必要性。
- 自我反思:移除自我反思模块导致性能下降 10%。
- 引导:仅使用初始化的技能库(不含增量合成)产生了非微不足道的性能,但显著低于完整的 COMPASS 系统,验证了动态技能演进的必要性。
意义与主张
本文主张,COMPASS 证明了在部分可观测条件下,利用视觉 - 语言模型生成可解释的战术行为以进行协作多智能体控制的可行性。它确立了当 VLM 与结构化通信和闭环反馈集成时,能够有效合成和细化基于代码的策略。
然而,作者对这些发现的适用范围持谨慎态度。他们明确承认,由于 VLM 的推理延迟,当前方法不适用于需要快速、连续反应控制的领域(如虫群机制)。本文提出,VLM 基于的规划在战略协调占主导地位且动作在多个时间步内保持有效的场景中最为有利。未来的工作建议专注于降低推理延迟,或开发混合架构,将高频决策委托给学习到的反应策略,同时保留 VLM 用于战略监督。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。