← 最新论文
🤖 machine learning

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD 是一个将模仿学习与强化学习集成在潜空间世界模型中的协作-竞争框架,通过解耦目标并利用想象出的展开过程进行离线训练,旨在增强端到端自动驾驶在长尾场景和跨城市设置下的鲁棒性与泛化能力。

原作者: Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在教一辆自动驾驶汽车学习。传统上,我们通过向它展示成千上万小时的专家驾驶视频,并告诉它:“完全复制他们的做法。”这被称为模仿学习 (Imitation Learning, IL)。这种方法在熟悉的道路上表现出色,但如果汽车遇到奇特的、罕见的状况(比如在它从未见过的城市里突然跳出一只鹿),它往往会陷入恐慌或发生碰撞,因为它在训练视频中从未见过这种特定的场景。

为了解决这个问题,研究人员尝试引入了强化学习 (Reinforcement Learning, RL)。把强化学习想象成一款电子游戏,汽车通过安全驾驶获得积分,通过碰撞丢分。汽车通过不断尝试并观察结果来进行学习。

问题所在:
论文指出一个主要的障碍:你无法轻易地在真实的道路上用真实的自动驾驶汽车来玩“电子游戏”。你不能让它们为了学习而进行成千上万次的碰撞。因此,我们必须仅利用现有的视频数据进行“离线”训练。但问题在于,现有的数据几乎全部是由完美的专家驾驶组成的。这里没有“糟糕”驾驶的案例供其学习,而且由于它从未见过其他选择,它也不知道如何探索新的路径。如果你只是让汽车在这些有限的数据中去尝试“博取”奖励系统,它往往会感到困惑、高估自己的能力,并导致危险驾驶。

解决方案:CoIRL-AD
作者提出了一种名为 CoIRL-AD 的新系统。他们使用了一种巧妙的“双策略”方法,这就像是在虚拟模拟器中雇佣了两个不同的驾驶员共同训练。

以下是其工作原理的拆解,分为几个简单的概念:

1. 两位驾驶员 (双策略)

他们没有让一个大脑承担所有工作,而是将任务拆分了:

  • “学生”驾驶员(模仿): 这个驾驶员的任务仅仅是完美地复制专家视频。它保持安全并遵守规则。
  • “探索者”驾驶员(强化): 这个驾驶员被允许尝试新事物。它会构思不同的路径,并试图寻找比单纯模仿更优的驾驶方式。

2. 水晶球 (潜在世界模型)

由于无法在真实道路上进行测试,他们需要一个模拟器。但构建一个完美的 3D 模拟器非常困难。因此,他们构建了一个**“水晶球”**(潜在世界模型,Latent World Model)。

  • 当“探索者”驾驶员思考“如果我在这里左转会怎样?”时,水晶球会瞬间预测几秒钟后道路看起来会是什么样子。
  • 这使得“探索者”能够在计算机的大脑内部“想象”未来的场景,并观察自己是会撞车还是成功,而无需接触真实的汽车。

3. 向后思考 (逆向因果关系)

通常,规划是按步骤进行的:“我要去这里,然后去那里,再到那里。”
论文建议了一种更聪明的方法:先想结果,再想过程。
想象你在开车并看到了目的地。你先决定你想在 3 秒钟后处于什么位置,然后再推算出实现这一目标的第一个动作。论文发现,这种“目标优先”的思维方式比“步进式”方法能让“探索者”找到更优、更平滑的路径。

4. 友好的竞争

这是成功的秘诀。学生和探索者不断地相互竞争。

  • 他们互相竞赛。
  • 如果“探索者”找到了比模仿更优、更安全的驾驶方式,那么“学生”就会向它学习。
  • 如果“探索者”因为产生了幻觉奖励而变得过于疯狂,开始危险驾驶,那么“学生”就会作为一个锚点,将“探索者”拉回到安全、符合专家行为的轨道上。
  • 他们不断交换知识,但“探索者”绝不会被允许跑得太远,以至于忘记如何安全驾驶。

实验结果

当他们在 nuScenes 数据集(一个巨大的真实世界驾驶数据集合)上测试时:

  • 更高的安全性: 与以往的方法相比,该车的碰撞频率更低。
  • 新城市适应性: 当他们在新加坡进行训练并在波士顿进行测试时(一个完全不同的城市),它处理新环境的能力比仅靠模仿专家的汽车要好得多。
  • 罕见事件: 在“长尾”场景(奇特的、罕见的事故或障碍物)中,该车表现得更加稳健。

总结:
论文指出,通过让一个“安全的模仿者”和一个“冒险的探索者”在“水晶球”模拟器中相互竞争并共同学习,即使我们只有有限的真实世界数据,也能教会自动驾驶汽车变得更安全、更具适应性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →