想象一群自动驾驶玩具车试图在赛道上一起竞速。在计算机模拟的完美世界里,这些车可以像心灵感应的双胞胎一样瞬间彼此交流。如果一辆车看到坑洼,它会立即告知其他车辆,所有人都会在同一时刻做出反应。
但在现实世界中,情况并非如此。真实车辆通过 Wi-Fi 交流,而信号传输需要时间。有时很快,有时很慢,有时消息会延迟几分之一秒到达。如果你训练车辆期待瞬间的心灵感应,当把它们放到真实赛道上时,它们就会发生碰撞,因为它们正在对已经过时的信息做出反应。
本文介绍了一种名为RSR-RSMARL(读起来拗口,但你可以将其理解为“真实 - 模拟 - 真实智能驾驶”)的新训练方法,以解决这一确切问题。以下是其工作原理,分解为简单的概念:
1. “现实世界延迟”训练
研究人员没有假装车辆可以瞬间交流,而是测量了他们的玩具车彼此发送消息实际所需的时间。他们发现,这需要大约 10 到 20 毫秒(眨眼之间,但对高速行驶的汽车来说却是一段很长的时间)。
随后,他们将这种“延迟”直接构建到计算机模拟中。他们教导 AI 车辆在驾驶时,要意识到同伴的消息可能会稍有延迟。这就像训练一支篮球队,教练发出指令时带有轻微延迟,迫使球员学会在信号不完美时如何预判和反应。这样,当车辆从计算机环境进入现实世界时,它们已经习惯了这种延迟。
2. “安全卫士”(守门员)
即使经过良好的训练,AI 有时仍可能做出冒险的举动。为了防止碰撞,研究人员添加了一个“安全护盾”。你可以将其想象成夜总会里严格的守门员,或是体操运动员的安全网。
- 教练(AI): AI 决定车辆应该做什么(例如:“现在变道!”)。
- 守门员(安全护盾): 在车辆实际移动之前,安全护盾会检查该计划。它会问:“考虑到其他车辆此刻的位置以及如果它们的消息延迟了可能所在的位置,这样做安全吗?”
- 结果: 如果 AI 的计划风险过高,安全护盾会温和地引导车辆采取更安全的行动(例如减速),而不是发生碰撞。这一过程在每一秒都实时发生。
3. “即插即用”刹车
该系统设计灵活。AI 可以与不同类型的“底层”控制器(实际负责踩油门或刹车的部件)进行通信。
- PID 控制器: 像简单的快速反射。适用于快速、轻微的反应。
- MPC 控制器: 像国际象棋棋手。它会提前思考几步以使行驶更平稳,尽管这需要一点点更多的计算能力。
研究人员表明,他们的系统与这两种类型都能完美配合,证明这是一个通用的框架。
4. 大考:从模拟到现实
团队通过两种方式测试了该系统:
- 在计算机中(CARLA 模拟器): 他们在不同级别的“延迟”和障碍条件下进行了数千次比赛。
- 在真实硬件上: 他们将训练好的 AI 部署到一组 1/10 比例的自动驾驶汽车上(大小约相当于一个大鞋盒),这些车辆配备了摄像头和激光雷达。
结果:
- 零碰撞: 采用“现实世界延迟”方法和“安全护盾”训练的车辆完成了赛道,没有撞到任何东西,即使其他车辆移动不可预测。
- “心灵感应”的失败: 未考虑延迟(假设即时通信)而训练的车辆,在放到真实赛道上时,碰撞频率要高得多。
- “无法交流”的失败: 完全无法彼此交流的车辆速度更慢,且更容易发生碰撞。
- “时变”获胜者: 最佳结果来自用变化的延迟(有时快,有时慢)训练车辆,就像真实的 Wi-Fi 一样。这使它们最具适应性和安全性。
核心结论
本文证明,要使自动驾驶汽车在现实世界中安全运行,不能仅仅在完美、即时通信的模拟环境中训练它们。你必须教导它们应对消息延迟的混乱现实,并赋予它们一个能够覆盖错误决策的“安全卫士”。通过这样做,它们可以在计算机中学习,然后立即在真实赛道上安全行驶,而无需额外的练习。
技术摘要:面向自动驾驶车辆的鲁棒且安全的通信多智能体强化学习
问题陈述
深度多智能体强化学习(MARL)在仿真中已展现出连接自动驾驶的潜力;然而,仿真性能与真实世界硬件部署之间存在显著差距。 prior 工作通常假设智能体间通信是瞬时且完美同步的,这未能考虑车对车(V2V)系统固有的延迟和异步性。在实际环境中,共享信息会受到可测量的延迟和传输变异性的影响。此外,现有的测试平台往往缺乏必要的组件,以验证具有形式化安全保证的端到端多智能体框架,而标准的仿真到现实(sim-to-real)迁移技术(如域随机化)通常无法解决通信延迟、感知不确定性和安全关键约束相结合的具体挑战。
方法论:RSR-RSMARL
作者提出了RSR-RSMARL(鲁棒且安全的真实 - 仿真 - 真实多智能体强化学习),这是一个旨在通过显式建模通信约束来弥合仿真与硬件之间差距的框架。该架构包含三个核心组件:
通信感知 MARL 公式化:
- 真实到仿真设计: 该框架不再假设理想的信息交换,而是将实测的真实世界 V2V 延迟统计直接纳入状态表示中。
- 延迟状态建模: 智能体接收来自邻居(Ni)的局部观测和共享观测,这些观测被视为延迟且可能异步的。共享状态包括源自车载传感器(激光雷达、摄像头)的互补感知特征(例如障碍物存在、车道边界)。
- 训练策略: 策略在固定延迟和时间变化延迟模型下均进行训练。这使智能体暴露于时间上未对齐的邻居信息中,迫使策略学习不依赖同步数据的鲁棒协调策略。
基于 CBF 的安全护盾:
- 为确保训练和部署期间的形式化安全保证,集成了模块化的安全护盾。该护盾利用通过二次规划(QP)执行的控制屏障函数(CBF)。
- 机制: MARL 策略生成的高级动作通过安全护盾,该护盾在命令到达低级控制器之前过滤掉不安全指令。
- 延迟感知安全: CBF 约束被保守地膨胀,以考虑由通信延迟和异步更新引起的状态不确定性。邻居车辆被建模为具有有界延迟的动态障碍物,确保即使邻居状态估计过时,也能保证避免碰撞。
- 控制器无关性: 该框架支持可插拔的低级控制器,具体包括 PID(用于轻量级执行)和模型预测控制(MPC)(用于更平滑的基于优化的轨迹),而无需更改学习公式。
真实 - 仿真 - 真实管道:
- 系统采用集中训练与分散执行(CTDE)方法。策略在 CARLA 仿真器中使用实测延迟分布进行训练,然后零样本迁移到物理硬件。
- 硬件平台: 验证在一组配备激光雷达、摄像头和惯性测量单元(IMU)的 1/10 比例 F1TENTH 自动驾驶车辆车队上进行,通过 Wi-Fi 通信,具有实测延迟(测试平台中为 10–20 毫秒,训练时从更广泛的分布中采样以模拟生产环境的变异性)。
主要贡献
- 框架提出: 引入 RSR-RSMARL,这是一个专为真实 - 仿真 - 真实策略迁移设计的鲁棒 MARL 框架,它集成了延迟感知训练和基于 CBF 的安全护盾,以解决通信延迟、模型不确定性和状态估计误差问题,同时保持形式化安全保证。
- 延迟建模策略: 开发了一种通信感知训练策略,将随机延迟(包括固定延迟和时间变化延迟)显式注入 MARL 学习过程。这使得在部署前即可实现延迟鲁棒的协调,超越了理想通信的假设。
- 广泛验证: 在 CARLA 和物理硬件平台上进行了全面评估。该研究包括在不断增加的通信延迟下的结构化消融研究,并展示了仿真训练的策略成功零样本迁移至安全真实世界操作。
实验结果
该框架在两个场景中进行了评估:三车道微型高速公路和双车道环形高速公路,障碍物密度各不相同。
- 安全性与零样本迁移: 提出的 RSR-RSMARL 变体(使用时间变化(TV)和固定延迟(F-2)模型)在所有障碍物水平下,在硬件和仿真中均实现了零碰撞。相比之下,没有安全护盾(RSR-MARL)或没有通信(No-Comm)的基线随着障碍物密度的增加表现出碰撞率上升。
- 效率与安全性的权衡: 虽然时间变化延迟模型导致完成时间略长于某些基线,但它保持了无碰撞记录。时间变化模型在协调效率和稳定性方面始终优于固定延迟模型,表明使用随机延迟进行训练能更好地使智能体适应真实世界的抖动。
- 控制器性能: 该框架成功地在 PID 和 MPC 后端上运行。MPC 的集成进一步增强了轨迹平滑度,尽管计算成本更高。
- 消融研究: 移除安全护盾导致学习动态不稳定和碰撞率显著升高,证实仅靠延迟建模不足以保障安全。与域随机化(MARL-DR)的比较显示,MARL-DR 的碰撞率更高且效率更低,表明对于此特定问题,显式延迟建模优于通用噪声注入。
- 通信影响: 实验表明,V2V 通信显著减少了对反应式安全覆盖(CBF 干预)的需求,将干预率从 18.7%(无通信)降低至 11.4%(有通信)。
意义与主张
本文声称,RSR-RSMARL 为将基于 MARL 的协作决策从仿真迁移到物理系统提供了一条结构化且可靠的途径。作者强调,他们的方法通过将训练建立在实验观测的延迟统计之上并强制执行形式化安全约束,解决了关键的“仿真到现实”差距。
这项工作的意义在于证明了基于硬件的通信建模对于可扩展且可靠的多智能体自主系统至关重要。通过将延迟感知学习与形式化安全执行相结合,该框架支持向真实世界平台的零样本迁移,即使在现实、异步和延迟的通信约束下,也能保持强大的安全性 - 性能权衡。作者将此定位为迈向鲁棒、通信感知的多智能体网联自动驾驶(CAV)实际部署的一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。