想象一群无人机试图扑灭两场独立的火灾。在标准场景中,如果这些无人机都盯着同一个起点,它们可能都会决定:“我要去左边的火场!”和“我也要往左边的火场去!”结果,它们会挤在一处火场,而另一处却在燃烧,因为它们只是在复制过去的行为或眼前的景象。它们并没有真正弄清楚自己在团队中究竟应该扮演什么角色。
本文提出了一种新方法,让 AI 智能体团队(如上述无人机)学会更好地协同工作。作者将这种方法称为R3DM(基于动态模型的角色发现与多样性)。
以下是核心思想的拆解,辅以简单的类比:
问题:“向后看”与“向前看”
大多数现有的 AI 团队是通过观察它们的过去来学习角色的。这就像教练说:“你上一场比赛防守得很好,所以你是防守者。”问题在于,如果大家的过去都一样,那么所有人都会获得相同的角色,做相同的事情。它们缺乏多样性。
本文认为,角色不应仅仅是基于历史的标签,而应成为未来的计划。如果你是“侦察兵”,你的未来路径就应与“坦克”不同。
解决方案:“水晶球”方法
R3DM 赋予智能体一个“水晶球”(即动态模型)。系统不再只问“我做了什么?”,而是问“如果我承担这个特定角色,我的未来会是什么样子?”
- 水晶球(动态模型): AI 学习根据当前的行动预测接下来会发生什么。它在模拟未来。
- 测试: 系统检查:“如果智能体 A 承担角色 X,水晶球是否显示出一条独特的未来路径?如果智能体 B 承担角色 Y,它是否显示出一条不同的独特路径?”
- 奖励: 如果智能体选择了能导致独特且不重叠未来的角色,它们就会获得特殊的“加分”(即内在奖励)。如果它们选择了导致完全相同行为的角色,则没有加分。
两步舞
为了实现这一目标,R3DM 采用了一个两步过程,就像跳舞一样:
- 第一步:镜子(对比学习): 首先,智能体观察它们过去的行为,并根据迄今为止所做的事情将它们分组为“团队”或角色。这就像根据球衣颜色将球员分组。
- 第二步:未来愿景(动态模型): 然后,系统利用水晶球来观察这些分组是否真的能导致不同的未来。它鼓励智能体选择那些迫使它们探索地图不同区域或处理不同任务的角色。
为何有效(消防类比)
让我们回到那两架无人机和两场火灾。
- 旧方法: 两架无人机都看到了火灾。它们都心想:“我要去左边。”结果它们在左边的火场撞在一起。
- R3DM 方法: 系统说:“无人机 A,如果你选择‘左火’角色,你的未来路径将是独特的。无人机 B,如果你选择‘右火’角色,你的未来路径也将是独特的。”
- 因为系统奖励它们拥有不同的未来路径,无人机 A 自然会选择左边的角色,而无人机 B 选择右边的角色。它们完美地分头行动,无需人类指示谁去哪里。
结果
作者在复杂的电子游戏战斗场景(具体为《星际争霸》地图)中测试了这种方法。
- 他们发现,与现有最佳方法相比,R3DM 帮助 AI 团队的胜率提高了20%。
- AI 学会了更好地协调,避免了所有人同时做同一件事的错误。
一句话总结
R3DM 教导 AI 团队停止仅仅复制过去,转而规划未来。通过利用“水晶球”预测接下来会发生什么,它迫使团队成员发现能够互补的独特角色,将混乱的人群转变为协调有序的小队。
以下是论文《R3DM:通过多智能体强化学习中的动力学模型实现角色发现与多样性》的详细技术总结。
1. 问题陈述
多智能体强化学习(MARL)在交通控制和机器人等复杂领域取得了成功,通常采用集中训练分散执行(CTDE)范式(例如 QMIX、MAPPO)。然而,标准的 CTDE 方法依赖于共享的策略参数,这往往阻碍了有效协调所必需的多样化行为的学习。
现有的基于角色的 MARL方法试图通过从智能体的过去观测中学习涌现角色来鼓励互补行为,从而解决这一问题。但本文指出了这些方法的一个关键缺陷:
- 局限性:仅从过去经验中推导角色,无法考虑角色如何影响智能体的未来轨迹。
- 后果:具有相似初始观测的智能体可能在早期采用相同的角色,导致行为冗余(例如,两架无人机都飞向同一处火灾),而非实现有效的分布与协调。
- 洞察:智能体的角色应主动塑造其未来行为。如果一个智能体采用了特定角色,其未来的观测和行动应自然地与采用其他角色的智能体产生分化,以确保有效协调。
2. 方法论:R3DM
作者提出了通过动力学模型实现角色发现与多样性(R3DM),这是一个利用信息论和世界模型将智能体的当前角色与其预期未来行为联系起来的框架。
核心目标
R3DM 最大化三个变量之间的互信息(MI):
- 智能体在时间 t 的角色 (mit)。
- 截至时间 t 的观测轨迹 (τit)。
- 预期未来轨迹 (τit+1:t+k)。
目标函数表述为:
I(τit+k;mit∣τit)
由于直接最大化该目标不可行,作者推导出了一个可处理的分解为两个组件的下界:
- 角色嵌入学习:从观测 - 行动历史中学习中间角色嵌入 (zit)。
- 未来行为多样性:最大化这些角色嵌入与未来轨迹之间的互信息。
关键组件
A. 中间角色嵌入学习(对比学习)
- 利用基于 ACORM 的对比学习框架,根据智能体过去的观测 - 行动历史将其聚类为不同的角色。
- 使用轨迹编码器 (θe) 和角色编码器 (θr) 生成嵌入。
- 优化对比损失,确保具有相似行为模式的智能体被归为一组,而不同的模式则被分离。
B. 通过动力学模型生成的内在奖励
为了确保角色能够塑造未来行为,R3DM 引入了源自互信息下界的两种内在奖励:
策略内在奖励 (rpol):
- 鼓励基于角色的动作选择多样性。
- 计算为角色条件策略与平均(角色无关)策略之间的 Kullback-Leibler (KL) 散度。
- 公式:ri,pol=∑DKL(SoftMax(Qi(⋅∣τ,z))∣∣p(⋅∣τ))。
动力学内在奖励 (rdyn):
- 这是本文的创新贡献。它量化了角色嵌入对预测未来观测的影响程度。
- 它采用了两个循环状态空间模型(RSSM)(基于 DreamerV3):
- 角色条件模型 (qψ):根据轨迹和角色嵌入预测未来观测。
- 角色无关模型 (pϕ):仅根据轨迹(无角色)预测未来观测。
- 奖励是这两个模型对数似然值的差值。如果角色条件模型比无关模型显著更好地预测了未来,该智能体将获得高奖励,从而激励角色对未来行为具有预测性。
- 公式:ri,dyn=∑[logqψ−logpϕ]。
C. 最终学习目标
MARL 智能体的总奖励是任务奖励 (rt) 和内在奖励的组合:
rtotal=rt+αrint
其中 rint=β3rpol+rdyn。该组合奖励用于通过标准 TD 学习更新 Q 网络。
3. 主要贡献
- 新颖的信息论目标:提出了一个最大化角色、过去轨迹与预期未来轨迹之间互信息的目标,将焦点从基于过去的角色推断转向塑造未来的角色。
- 动力学驱动的内在奖励:引入了一种利用世界模型(RSSM)生成内在奖励的机制,以强制执行特定角色的未来行为,在探索与角色专业化之间取得平衡。
- 与 CTDE 的集成:成功将该框架集成到现有的基于角色的 MARL 方法(特别是 ACORM/QMIX)中,且未牺牲样本效率。
- 实证验证:在具有挑战性的基准测试中展示了最先进的性能。
4. 实验结果
作者在 SMAC(星际争霸多智能体挑战)和 SMACv2 环境中评估了 R3DM。
- 性能:R3DM 优于最先进的基线方法(包括 QMIX、ACORM、CIA、GoMARL、CDS 和 EMC)。
- 在困难地图(例如 3s5z vs 3s6z、Corridor、6h vs 8z)上,胜率提升了高达 20%。
- 显示出更优越的样本效率和更快的收敛速度。
- SMACv2:在随机环境(变化的初始条件)中,R3DM 保持了稳健的性能,在不对称场景(例如 Protoss 10 vs 11)中优于基线方法。
- 定性分析:在 3s5z vs 3s6z 地图中的可视化显示,虽然 ACORM 智能体收敛于大规模攻击行为,但 R3DM 智能体学会了分裂成专业化的子团队(例如,一个智能体引诱敌人,而其他智能体进行侧翼包抄),展示了真正的角色分化。
- 消融研究:
- 想象视界:较短的视界(k=1 或 $2$)效果最佳;较长的视界引入了累积预测误差。
- 角色基数:中等数量的角色(例如 3 个)在协调和专业化之间取得了比高基数更好的平衡。
- 组件:对比学习和内在奖励均被证明是实现最佳性能所必需的。
5. 意义与影响
- 范式转变:R3DM 将基于角色的 MARL 领域从回顾性角色分配(基于已发生的事)转变为前瞻性角色分配(基于将要发生的事)。
- 协调机制:通过将角色与未来动力学联系起来,该方法自然地解决了具有相似历史的智能体无法协调的“冗余”问题。
- MARL 中的基于模型的强化学习:本文成功弥合了无模型 MARL 与基于模型方法(利用世界模型进行内在动机)之间的差距,为在复杂随机环境中实现更复杂的协调策略铺平了道路。
- 实际应用:该方法与无人机群、自动驾驶车队和机器人团队等现实世界多智能体系统高度相关,在这些系统中,必须动态分配不同的角色以同时处理多个目标。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。