← 最新论文
💻 computer science

Scaling Self-Play for End-to-End Driving

本文介绍了 Gigapixel,这是一种高吞吐量模拟器,能够支持基于像素观测的端到端自动驾驶大规模自博弈训练,该模拟器结合自博弈 DAgger 蒸馏与感知适配技术,在无需人类轨迹监督的情况下实现了具有竞争力的现实世界性能。

原作者: Luke Rowe, Roger Girgis, Rodrigue de Schaetzen, Daphne Cornelisse, Alaap Grandhi, Felix Heide, Eugene Vinitsky, Christopher Pal, Liam Paull

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Luke Rowe, Roger Girgis, Rodrigue de Schaetzen, Daphne Cornelisse, Alaap Grandhi, Felix Heide, Eugene Vinitsky, Christopher Pal, Liam Paull

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在教导一辆自动驾驶汽车。传统的方法就像是给一名学员驾驶员展示数千小时完美人类驾驶的视频资料。你会说:“完全模仿这个人的动作。”这被称为行为克隆(Behavior Cloning)

问题在于:如果学员驾驶员遇到了视频中从未出现过的场景——比如一场奇怪的交通拥堵或一个突发的绕行路段——他们就会陷入僵局或发生碰撞。因为他们只是一直在“看”,从未进行过“练习”,所以他们从未学会如何从错误中恢复。

这篇论文提出了一种新方法:自我博弈(Self-Play)。与其仅仅观察人类,汽车通过与自己的副本进行一场大规模、高速的“国际象棋”比赛来学习。

以下是作者如何实现这一目标的,分为几个简单的概念:

1. 在现实世界中“玩游戏”的问题

要通过“玩游戏”来学习,你需要一个模拟器(一款电子游戏)。但大多数驾驶模拟器要么:

  • 太简单: 它们向汽车展示的是带有箭头和点的地图(矢量数据)。这很快,但现实中的自动驾驶汽车需要通过“像素”(来自摄像头的图像)来工作。
  • 太慢: 它们看起来非常逼真(像电影一样),但运行速度极慢,以至于汽车需要花费数年时间才能学到任何东西。

2. 解决方案:“Gigapixel”(快速、方块化的游戏)

作者构建了一个新的模拟器,名为 Gigapixel

  • 类比: 想象一款像《我的世界》(Minecraft)或《罗布乐思》(Roblox)那样的视频游戏。汽车只是一个个方块,道路是平坦的条带,树木是简单的形状。它看起来不像真实的摄影照片,而更像是一个示意图。
  • 为什么有效: 因为图形非常简单,计算机可以在单个显卡上同时运行 50,000 辆车。它极其迅速。
  • 神奇之处: 尽管这个世界看起来像个方块化的玩具,但道路的“规则”(交通灯、车道、其他车辆)被完整保留了下来。汽车利用其“摄像头之眼”(像素)而非仅仅依靠地图,来学习如何在这一方块世界中导航。

3. “教师-学生”技巧(Self-Play DAgger)

这里有一个难点:即使有了快速的模拟器,仅靠“试错法”(强化学习)来教导一个复杂的 AI 驾驶也太昂贵了。它需要进行数十亿次的尝试才能变好。

因此,他们使用了一个教师-学生系统:

  • 教师(矢量专家): 一个简单的、快速的 AI,它使用“地图和箭头”视图来玩游戏。它玩了数百万场游戏,犯错,并从错误中学习,最终成为了大师级驾驶员。因为它在闭环中进行,所以它了解每一个动作带来的“后果”。
  • 学生(像素驾驶员): 这是一个复杂的 AI,它需要看到真实的摄像机图像。它无法通过自己玩游戏来学习(因为太慢了,无法从零开始学习)。
  • 教学过程: 教师进行游戏,学生进行观察。学生在方块化世界中驾驶汽车的同时,尝试模仿教师的动作。如果学生犯了错,教师会立即进行纠正。
  • 结果: 学生吸收了教师数百万场游戏的“智慧”,但由于它是在模仿一位大师而非盲目猜测,所以学习速度要快得多。

4. 弥合差距(Sim-to-Real,从模拟到现实)

现在学生成为了大师级驾驶员,但它仅在那个“方块化”的视频游戏中如此。我们如何让它驾驶真实的汽车?

  • 类比: 想象学生是一名演员,他完美地背下了剧本,但舞台灯光从“方块蓝”变成了“写实的日落”。演员不需要重新学习台词,他只需要调整眼睛去适应新的光线。
  • 解决方法: 作者将学生的“大脑”(规划部分)保持冻结状态。他们只微调了“眼睛”(感知部分),使其能将真实的摄像机照片转化为方块化游戏大脑能够理解的语言。

5. 结果

当他们测试这种新方法时:

  • 在方块化游戏中: 汽车的表现优于以往任何依赖模仿人类驾驶轨迹的方法。
  • 在现实世界中: 当他们在真实世界的基准测试(HUGSIM 和 NAVSIM-v2)中进行测试时,汽车表现出了极强的竞争力,尽管在主要训练阶段,它从未见过哪怕一段人类驾驶的轨迹。它是纯粹通过与自己博弈而学会驾驶的。

总结

这篇论文表明,与其仅仅模仿人类驾驶员(这会产生脆弱的机器人),我们可以通过让自动驾驶汽车在快速、简化的游戏中进行自我博弈,来训练其鲁棒性。通过使用“教师”来引导“学生”,他们使这一过程变得高效,足以应对复杂的现实世界摄像头。其结果是,这种驾驶方式已经通过在训练中“预演”了数百万种奇怪的场景,从而学会了如何应对突发状况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →