想象一个机器人、无人机或自动驾驶汽车群体需要像完美的编舞舞团一样协同工作的世界。它们不仅仅是在遵循剧本;它们在边做边学,试图弄清楚谁做得对,谁搞砸了,同时还要在一个动作不仅仅是“左”或“右”,而是可以在两者之间进行任何微小、精准移动的世界中穿行。这就是多智能体强化学习(MARL)的领域。把它想象成一场高风险的捉迷藏游戏,玩家在玩的过程中也在学习规则。巨大的挑战在于:当动作是连续的(比如平滑地转动方向盘,而不是直接切入新车道)时,要公平地为每个成员在团队成功中所做的贡献进行“信用分配”会变得极其困难。如果团队赢了,是因为领队转向完美,还是因为跟随者只是运气好?如果团队撞车了,又是谁的错?准确实现这种“信用分配”是教会这些数字团队在没有人类持续监督的情况下进行协作的关键。
于是,一种名为 SAFE(基于经验的自进化默认动作,Self-evolving default Action From Experiences)的新型框架应运而生,这是一个旨在帮助这些机器人团队学习得更好、更快、更公平的巧妙解决方案。SAFE 背后的研究人员注意到,以往的方法试图猜测如果一个机器人采取了不同的行动会发生什么,但当动作是连续的时候,这些猜测往往基于随机的、未经训练的样本。这就像是在问一个刚学会骑自行车的人,如果尝试骑独轮车会怎么做一样;那个答案并不会很有帮助。SAFE 通过使用一种“自进化的默认动作”改变了游戏规则。它不再进行随机猜测,而是观察机器人自身的历史动作,以找到一个代表其平均行为的“默认”动作。通过将机器人的实际动作与其个性化的平均值进行比较,系统可以准确计算出该特定动作对团队的贡献或损害。
论文证明,这种方法在协作驾驶任务中表现出色,在这些任务中,车辆必须在充满障碍物的公路上行驶而不发生碰撞。在涉及多达七辆车和两个障碍物的模拟场景中,SAFE 始终优于现有的最先进模型,如 VDN、QMIX 和 COMA。研究人员从数学上证明了他们的方法不会在学习过程中引入“偏差”,这意味着机器人被保证会收敛到一个好的解决方案,而不是陷入一个坏的方案中。至关重要的是,他们表明这种成功来自于他们分配信用的新方式,而不仅仅是因为系统能够处理连续动作。更有趣的是,他们的实验表明,使用来自机器人记忆的一个经过精心挑选的“默认”动作,实际上比尝试平均化大量不同的动作效果更好。简而言之,SAFE 给机器人团队提供了一种更聪明的方式来反思过去的动作,帮助它们学会如何共同起舞,而不至于互相绊脚。
技术摘要:SAFE(基于经验的自演化默认动作)
问题陈述
多智能体强化学习(MARL)在离散动作空间(如《星际争霸II》)中取得了成功,但在现实世界的连续控制任务(如自动驾驶车辆网络)中面临重大障碍。现有方法主要遭遇以下三个挑战:
- 连续动作空间: 许多信用分配方案是为离散空间设计的,无法直接应用于连续控制。
- 去中心化需求: 现实应用通常需要完全去中心化的策略以保证安全性和低延迟,然而许多可扩展方法依赖于无法随智能体数量增加而有效扩展的中心化输入。
- 连续域中的信用分配: 虽然反事实多智能体策略梯度(COMA)通过对智能体动作进行边缘化处理,能有效地在离散空间中分配信用,但通过蒙特卡洛采样将该方法扩展到连续空间时会引入偏差。连续空间中的采样动作往往训练不足,这意味着中心化评论家(Critic)尚未充分学习其价值。因此,在联合策略下,基准期望值不为零,这会导致策略梯度产生偏差,并缺乏收敛至局部最优解的保证。
方法论
本文提出了 SAFE(Self-Evolving Default Action From Experiences,基于经验的自演化默认动作),这是一种旨在解决中心化训练、去中心化执行(CTDE)范式下上述局限性的新型 MARL 框架。
- 核心机制: SAFE 引入了一个以自演化默认动作为条件的反事实基准(Counterfactual Baseline)。与以往依赖用户定义的默认动作或额外模拟的方法不同,SAFE 直接从每个智能体的经验回放缓冲区(Dt)中采样该默认动作(aˉi)。
- 基准构建: 对于给定智能体 i,通过在中心化评论家的输入中,将智能体的实际动作 ai 替换为采样的默认动作 aˉi(t),同时保持其他智能体的动作(a−i)不变,来计算基准 bi:
bi=Q(s,a−i,aˉi(t)),aˉi(t)∼Dt
- 自演化: 随着训练的推进,采样的默认动作会自然演化,以反映智能体的平均表现。缓冲区中采样动作的分布会向智能体最频繁执行的动作偏移,从而确保基准值源自经过充分训练的价值函数。
- 理论保证: 作者通过数学证明(引理 0.1)表明,该基准在确定性策略梯度中引入了零偏差。通过将确定性策略视为随机策略的一个极限情况,他们证明了基准项的期望值为零,从而确保了向局部最优解的收敛。
- 架构: 该框架利用以全局状态和联合动作-观测历史为条件的中心化评论家,而去中心化的执行器(Actor)仅以其局部历史为条件。在协作角色中采用了参数共享机制。
核心贡献
- 连续空间的扩展: SAFE 自然地将反事实信用分配扩展到了连续动作空间,无需额外的模拟、奖励模型或特定环境的先验知识。
- 无偏收敛: 本文提供了理论证明,表明自演化默认动作基准不会给确定性策略梯度引入偏差,从而保证了向局部最优解的收敛——这是朴素蒙特卡洛扩展方法通常缺乏的特性。
- 动态适应: 基准能够随智能体行为的变化而动态调整,采样的默认动作会日益反映出智能体在训练期间的平均表现。
- 实证验证: 在协作式高速公路驾驶任务(Highway-Env)上的广泛实验表明,在车辆和障碍物数量变化的场景下,SAFE 的表现始终优于最先进的模型(VDN, QMIX, IQL, COMA, MAPPO)。
实验结果
- 性能表现: 在协作式高速公路驾驶场景(2V1O 至 7V2O)中,SAFE 取得了优于基准模型的性能。由于离散元动作(Meta-actions)的粒度过粗,离散动作模型(VDN, QMIX, IQL)在复杂场景中无法避免碰撞。COMA 和 MAPPO 未能收敛到最优策略,这主要归因于其在策略梯度(On-policy)训练中的样本效率低下。
- 消融研究:
- 信用分配 vs. 连续性: 与适配连续空间但使用不同信用分配方案的基准(如
Centralized_critic, COMA_cont)进行对比,证实了 SAFE 的性能提升专门源于其信用分配机制,而非仅仅因为其处理连续动作的能力。
- 单样本 vs. 多样本: 参数分析显示,使用单个采样默认动作(
SAFE1)比使用多个样本的平均值(SAFE30 到 SAFE100)效果更好。使用多个样本的平均值会引入额外的偏差并降低估计精度。
- 默认动作来源: 将经验采样动作替换为固定零动作(
SAFE_a=0)或批次均值(SAFE_batch_mean)会导致性能下降,这验证了基于经验的自演化选择的必要性。
- 行为分析: 默认动作概率密度的可视化显示,采样动作随时间演化以匹配智能体习得的策略(例如,从中性转向进行特定的避障动作),证实了基准与智能体实际策略的一致性。
意义
本文将 SAFE 定位为解决需要连续控制的现实世界多智能体系统的有效方案。通过解决连续领域中与反事实信用分配相关的偏差和收敛问题,SAFE 使得在复杂环境(如自动驾驶车辆网络)中部署可扩展、去中心化的协作策略成为可能。这项工作确立了可以通过基于经验的自演化,而非外部建模或模拟,来实现连续空间中的精确信用分配。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。