← 最新论文
💻 computer science

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR 引入了一种用于端到端自动驾驶的可扩展闭环强化学习框架,该框架通过异构仿真流水线,在预训练的视觉-语言-动作模型之上训练残差路点策略,通过克服传统模仿学习的分布偏移限制,在挑战性基准测试中实现了最先进的性能。

原作者: Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在教一辆自动驾驶汽车。很长一段时间以来,教导它的最佳方式是模仿学习(Imitation Learning)。这就像一名学生司机坐在由完美专家驾驶的汽车后座上。学生只是在模仿专家的行为。如果专家向左转,学生也向左转。

问题在于?这只适用于“闭卷”考试。如果学生看到了专家从未展示过的场景,或者学生犯了一个微小的错误,他们就会感到困惑。在现实世界(或复杂的模拟环境)中,一个微小的错误就可能导致碰撞,而学生不知道如何恢复,因为他们被教导的只是去复制,而不是去“思考”或“适应”。

最近,研究人员开始使用视觉-语言-动作(Vision-Language-Action, VLA)模型。这些模型像是超级聪明的驾驶教练,能够同时“看到”道路、“读懂”交通标志并“说出”驾驶指令。但即使是这些聪明的教练,大多也是通过“复制专家”的方法进行训练的,这使得它们在遇到问题时显得很脆弱。

于是,CLEAR 出现了。

核心理念:“残差”教练

该论文的作者构建了一个名为 CLEAR 的系统来解决这个问题。他们不仅仅是让 AI 复制,而是教会 AI 成为一名纠正学员教练

  1. 预训练的“学员”: 首先,他们采用一个非常聪明的 VLA 模型(学员),并利用海量的专家驾驶数据来教授它基础知识。这个学员擅长预测一个大致路径,就像 GPS 说:“500 英尺后左转。”
  2. “教练”(强化学习/RL): 然后,他们引入了强化学习(RL)。想象一位教练站在学员身边。学员做出一个预测(“基础路径”),然后教练说:“实际上,再向左多转一点点,以避开那个坑洼。”
    • AI 并不需要从零开始重新学习如何驾驶(这会消耗巨大的计算资源)。
    • 相反,它学习的是一种残差策略(residual policy)。这就像是在学习“一个好的计划”与“一个完美的计划”之间的差异。它只学习为了修正学员错误所需的那些细小的“修正量”。

“异构流水线”:解决交通拥堵问题

训练这些 AI 教练对数据有着极高的需求。你需要运行数百万次的驾驶模拟来教导它们。

这里存在一个瓶颈:

  • 模拟器(道路): 运行一个真实的驾驶模拟器(如 CARLA)非常消耗计算机图形性能。这就像是在运行一款高端电子游戏。
  • 学习者(大脑): AI 模型也非常庞大,需要强大的图形处理器(GPU)来进行思考。

如果你尝试在同一台电脑上同时运行模拟器和大脑,它们会争夺图形显卡。这就像试图在同一个狭小的健身房里同时进行一场马拉松和一场重型举重比赛;一切都会变慢甚至崩溃。

CLEAR 的解决方案: 他们构建了一个异构流水线(heterogeneous pipeline)

  • 他们将**模拟器(道路)**放在一组较旧、较便宜的计算机上。
  • 他们将 AI 大脑(学习者) 放在另一组超强大的计算机集群上。
  • 他们通过数字隧道(SSH)将两者连接起来。

这就像拥有一个由远程赛车场(模拟器)组成的车队,向中央总部(大脑)发送数据。赛车场不需要很高级,只要能运行即可。大脑可以获得它所需的所有数据,而不会被图形渲染所拖累。这使得他们能够同时运行 64 个模拟过程,并在 1 亿个样本上进行训练。

结果:从“失败”到“获胜”

论文在一些极具挑战性的驾驶测试(如 “longest6” 和 “Bench21Drive” 基准测试)中测试了这个系统。

  • 使用 CLEAR 之前: 之前的各种方法,即使是那些聪明的模型,在这些困难路段上的失败率几乎是 100%。它们会发生碰撞或陷入困境,因为它们无法从微小的错误中恢复。
  • 使用 CLEAR 之后: 系统学会了自我纠错。它不再仅仅是遵循剧本,而是学会了绕过障碍物并处理复杂的交通状况。
    • 在一个基准测试中,成功率从 0%(完全失败)跃升至 25%
    • 在另一个基准测试中,它取得了有史以来最高的评分,在驾驶效率和安全性方面超越了所有以往的方法。

总结

可以将 CLEAR 理解为:将一名聪明但刻板的学生司机,交给一位超级聪明的教练,这位教练学会了在学生开始偏离航线时,通过轻微的引导将其带回正轨;同时构建了一个大规模的分布式训练设施,以便他们在计算机崩溃之前,能够进行数百万英里的练习。其结果是,产生了一个在应对混乱、不可预测的现实道路方面表现得显著更出色的自动驾驶系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →