想象一下,你正带领一支自主无人机团队,执行探索一座迷雾笼罩的未知城市的任务。在理想世界中,每架无人机都会与其他所有无人机持续通信,即时共享位置和计划。但在现实世界中——尤其是在深空或水下等环境——通信可能中断、缓慢或代价高昂。你的无人机可能超出通信范围,或者电量过低,无法每秒发送一条消息。
本文介绍了一种让这些机器人协同工作的新方法,称为AsynCoMARL。可以将其理解为教导一群探险者如何利用“耳语网络”进行协调,而非依赖持续的无线电广播。
以下是其工作原理的简要说明,辅以简单类比:
1. 问题:“同步”陷阱
传统的机器人团队就像合唱团,要求所有成员在同一时刻唱出完全相同的音符。如果一名歌手迟到,整首歌曲就会崩溃。在计算机术语中,这被称为“同步”学习。它假设每个机器人能即时向其他所有机器人发送消息。
- 问题所在:在太空或深海环境中,消息可能延迟或丢失。如果机器人依赖完美同步,它们会陷入混乱、相互碰撞,甚至任务失败。
2. 解决方案:“动态图”
作者创建了一个系统,机器人无需持续通信,而是使用动态图。
- 类比:想象机器人是拥挤派对上的人群。旧方式要求每个人每秒都向所有人喊出自己的名字;而新方式(AsynCoMARL)则只让你与身边最近的人交谈。
- 工作原理:“图”本质上是一张地图,显示当前谁与谁足够接近、可以通信。
- 如果机器人 A 靠近机器人 B,地图上就会有一条线(边)连接它们。
- 如果机器人 A 移开,这条线就会消失。
- 如果机器人 A 正忙于其他事务(异步),它不会迫使其他人等待;它只需等到自己准备好再次发言即可。
3. 大脑:“图 Transformer"
为了理解这些零散的对话,机器人使用一种特殊的大脑,称为图 Transformer。
- 类比:可以将其想象为派对上一位超级聪明的翻译。当机器人 A 终于有机会与机器人 B 交谈时,这位翻译不仅听取话语内容,还会审视上下文。
- 谁在说话?(是朋友还是陌生人?)
- 他们相距多远?
- 他们过去交谈的频率如何?
- 该系统学会更加关注附近且活跃的机器人,同时忽略那些遥远或沉默的机器人。它认识到“接近度”和“接触频率”都是重要线索。
4. 结果:更少交谈,更好成效
研究人员在两种场景中测试了该方法:
- 协同导航:卫星在太空中尝试会合。
- 漫游车 - 塔楼:行星上的漫游车在静止塔楼的协助下寻找目标。
研究发现:
- 效率:新系统在完成相同任务时,发送的消息比现有最佳方法减少了 26%。这就像用更少的线索解出谜题,因为你确切知道哪些线索至关重要。
- 成功率:尽管交谈更少,机器人仍达到了与“健谈”机器人相同的高成功率,并同样有效地避免了碰撞。
- 灵活性:即使机器人能力不同(如漫游车与塔楼)或移动速度各异,该系统也能自适应,无需为每种类型单独训练。
5. 秘诀:奖励共享
论文还发现,机器人如何获得奖励至关重要。
- 旧方式:只要机器人停留在目标处,每秒都给予奖励。这会导致它们变得懒惰,或困惑于何时停止。
- 新方式:仅在机器人首次抵达目标时给予奖励,但前提是该步骤中它曾与团队进行过通信。这鼓励它们真正协作抵达目标,而非仅仅坐在那里积累分数。
总结
AsynCoMARL 如同教导一支探险队既保持独立又相互连接。它不再要求所有人齐声呐喊,而是教导它们倾听最近的人,仅在必要时发言,并利用智能系统判断该信任谁。其结果是:团队更高效、能耗更低(消息更少),即使在通信线路不稳定的情况下也能完成任务。
技术摘要:受限通信下的异步协作多智能体强化学习
问题陈述
本文解决了在未知且通信受限的环境中协调多个自主智能体的挑战。传统多智能体强化学习(MARL)方法通常假设同步通信,即智能体在每个时间步同时广播状态并执行动作。然而,在太空或水下作业等极端环境中,通信往往受限于功率约束、延迟或物理遮挡。在这些场景中,智能体在独立的时间尺度上运行,无法频繁或同步地进行通信。现有的异步 MARL 方法通常通过增加通信频率来弥补缺乏同步的问题,这违背了在受限环境中运行的初衷。核心问题在于开发一种 MARL 框架,能够在最小化通信开销并适应异步、低频交互的同时,实现有效的协作。
方法:AsynCoMARL
作者提出了AsynCoMARL,这是一种利用图 Transformer从动态图中学习通信协议的异步 MARL 框架。该方法基于以下组件构建:
- 异步公式化:与所有智能体在每个全局时间步 t 都采取行动的标准 MARL 不同,AsynCoMARL 为每个智能体 i 引入了特定的时间尺度 τ(i)。智能体根据随机延迟参数 μ 确定的不同间隔采取行动。经验回放缓冲区是基于这些特定于动作的时间步而非全局时间步构建的。
- 动态图表示:环境被建模为动态的、带权的有向图。节点代表智能体、障碍物和目标。边的形成基于两个条件动态进行:
- 邻近性:智能体必须位于特定的通信半径 λ 内。
- 活动性:仅当两个智能体在同一时间步均处于活动状态(执行动作)时,它们之间才存在边。
这导致了一个掩码邻接矩阵,其中不活动的智能体或超出通信范围的智能体在消息传递过程中被排除在图结构之外。
- 图 Transformer 架构:通信协议的核心是基于统一消息传递模型(UniMP)的图 Transformer。它处理节点特征(位置、速度、目标位置、实体类型)和边特征(欧几里得距离)。该 Transformer 使用多头点积注意力机制,根据相关性选择性地优先处理来自邻近智能体的消息。
- 集中训练,分散执行(CTDE):
- 评论家(Critic):集中式评论家接收完整的图嵌入(通过全局平均池化)以评估价值函数,利用全局状态和完整的图上下文。
- 演员(Actor):每个智能体都有一个独立的演员网络,其策略基于其局部观测值及其局部图邻域聚合的消息进行条件化。
- 奖励结构:本文实验了多种奖励公式。确定的最有效配置是“单次目标达成奖励 + 活动智能体共享”,即智能体在达成目标时获得一次性奖励,而协作奖励仅在该特定时间步处于活动通信状态的智能体之间共享。这防止了智能体在达成目标后“隐藏”,并鼓励积极的协调。
主要贡献
- AsynCoMARL 的提出:引入了一种专为异步 MARL 设计的基于图 Transformer 的通信协议,利用动态图来捕捉低频和异步交互。
- 实证评估:该方法在两个基准测试上进行了评估:协作导航(模拟卫星动力学)和漫游车 - 塔(模拟行星探索)。
- 减少通信下的性能:研究表明,AsynCoMARL 在显著减少智能体间传递消息数量的同时,实现了与领先基线相当的成功率和碰撞率。
实验结果
作者在协作导航环境中进行了不同数量智能体(N=3,5,7,10)的实验,并在漫游车 - 塔环境中进行了 4 辆漫游车/4 座塔的场景实验。
- 通信效率:AsynCoMARL 实现了与
asyncMAPPO 和 Actor-Attention-Critic 等基线相似的成功率,但智能体间传递的消息数量减少了 26%。
- 可扩展性:在 N=10 的协作导航任务中,AsynCoMARL 在极低的通信频率(fcomm=0.05)下保持了高成功率(86%)。相比之下,如
GCS 等基线在没有额外训练时间的情况下难以扩展,而 TransfQmix 尽管碰撞率低,但成功率较低。
- 漫游车 - 塔性能:在更复杂的漫游车 - 塔环境中,AsynCoMARL 在通信频率为 0.14 时达到了 50% 的成功率,在通信效率和回合完成时间方面优于
Actor-Attention-Critic(56% 成功率,0.21 频率),尽管它使用单个网络处理两类智能体,而非分别使用网络。
- 消融研究:
- 图 Transformer:移除图 Transformer 导致碰撞率显著升高,成功率降低,特别是在活动智能体数量较少时,证实了注意力机制在动态图中的重要性。
- 奖励公式:“单次目标达成奖励 + 活动智能体共享”结构产生了最佳结果(N=3 时成功率为 97%),突显了将奖励限制在活动且正在通信的智能体上,可以防止智能体在达成目标后停止协作。
意义与主张
本文声称,AsynCoMARL 有效地解决了异步设置中通信频率与协调性能之间的权衡。通过利用动态图和图 Transformer,该方法使智能体能够学习何时与谁通信,而不是依赖持续广播或同步更新。作者指出,他们的方法使智能体能够在不同的时间尺度上独立运行,同时仍能获得足够的信息进行有效协调。这项工作表明,如果通信协议是基于智能体交互的动态拓扑自适应学习的,异步协调并不一定需要增加通信开销。本文结论认为,该框架是迈向更真实的太空和行星探索多智能体系统的一步,在这些系统中通信本质上受到限制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。