← 最新论文
💻 computer science

Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware

本文提出了 RSR-RSMARL,这是一个鲁棒且安全的多智能体强化学习框架,它集成了通信、面向零样本仿真到现实迁移的鲁棒策略训练以及基于控制障碍函数的安全防护机制,并在硬件自主车辆上成功展示了增强的协调性与安全性。

原作者: Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群自动驾驶玩具车试图在赛道上一起竞速。在计算机模拟的完美世界里,这些车可以像心灵感应的双胞胎一样瞬间彼此交流。如果一辆车看到坑洼,它会立即告知其他车辆,所有人都会在同一时刻做出反应。

但在现实世界中,情况并非如此。真实车辆通过 Wi-Fi 交流,而信号传输需要时间。有时很快,有时很慢,有时消息会延迟几分之一秒到达。如果你训练车辆期待瞬间的心灵感应,当把它们放到真实赛道上时,它们就会发生碰撞,因为它们正在对已经过时的信息做出反应。

本文介绍了一种名为RSR-RSMARL(读起来拗口,但你可以将其理解为“真实 - 模拟 - 真实智能驾驶”)的新训练方法,以解决这一确切问题。以下是其工作原理,分解为简单的概念:

1. “现实世界延迟”训练

研究人员没有假装车辆可以瞬间交流,而是测量了他们的玩具车彼此发送消息实际所需的时间。他们发现,这需要大约 10 到 20 毫秒(眨眼之间,但对高速行驶的汽车来说却是一段很长的时间)。

随后,他们将这种“延迟”直接构建到计算机模拟中。他们教导 AI 车辆在驾驶时,要意识到同伴的消息可能会稍有延迟。这就像训练一支篮球队,教练发出指令时带有轻微延迟,迫使球员学会在信号不完美时如何预判和反应。这样,当车辆从计算机环境进入现实世界时,它们已经习惯了这种延迟。

2. “安全卫士”(守门员)

即使经过良好的训练,AI 有时仍可能做出冒险的举动。为了防止碰撞,研究人员添加了一个“安全护盾”。你可以将其想象成夜总会里严格的守门员,或是体操运动员的安全网。

  • 教练(AI): AI 决定车辆应该做什么(例如:“现在变道!”)。
  • 守门员(安全护盾): 在车辆实际移动之前,安全护盾会检查该计划。它会问:“考虑到其他车辆此刻的位置以及如果它们的消息延迟了可能所在的位置,这样做安全吗?”
  • 结果: 如果 AI 的计划风险过高,安全护盾会温和地引导车辆采取更安全的行动(例如减速),而不是发生碰撞。这一过程在每一秒都实时发生。

3. “即插即用”刹车

该系统设计灵活。AI 可以与不同类型的“底层”控制器(实际负责踩油门或刹车的部件)进行通信。

  • PID 控制器: 像简单的快速反射。适用于快速、轻微的反应。
  • MPC 控制器: 像国际象棋棋手。它会提前思考几步以使行驶更平稳,尽管这需要一点点更多的计算能力。
    研究人员表明,他们的系统与这两种类型都能完美配合,证明这是一个通用的框架。

4. 大考:从模拟到现实

团队通过两种方式测试了该系统:

  1. 在计算机中(CARLA 模拟器): 他们在不同级别的“延迟”和障碍条件下进行了数千次比赛。
  2. 在真实硬件上: 他们将训练好的 AI 部署到一组 1/10 比例的自动驾驶汽车上(大小约相当于一个大鞋盒),这些车辆配备了摄像头和激光雷达。

结果:

  • 零碰撞: 采用“现实世界延迟”方法和“安全护盾”训练的车辆完成了赛道,没有撞到任何东西,即使其他车辆移动不可预测。
  • “心灵感应”的失败: 未考虑延迟(假设即时通信)而训练的车辆,在放到真实赛道上时,碰撞频率要高得多。
  • “无法交流”的失败: 完全无法彼此交流的车辆速度更慢,且更容易发生碰撞。
  • “时变”获胜者: 最佳结果来自用变化的延迟(有时快,有时慢)训练车辆,就像真实的 Wi-Fi 一样。这使它们最具适应性和安全性。

核心结论

本文证明,要使自动驾驶汽车在现实世界中安全运行,不能仅仅在完美、即时通信的模拟环境中训练它们。你必须教导它们应对消息延迟的混乱现实,并赋予它们一个能够覆盖错误决策的“安全卫士”。通过这样做,它们可以在计算机中学习,然后立即在真实赛道上安全行驶,而无需额外的练习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →