← 最新论文
🤖 AI

A Simple Approach to Constraint-Aware Imitation Learning with Application to Autonomous Racing

本文提出了一种将安全约束引入模仿学习的简单方法,该方法在利用全状态和图像反馈的自主赛车任务中,通过实证证明了其相比于传统的行为克隆,在约束满足度和性能一致性方面均有所提升。

原作者: Shengfan Cao, Eunhyek Joa, Francesco Borrelli

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengfan Cao, Eunhyek Joa, Francesco Borrelli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在自动驾驶赛车的高风险世界中,胜利与灾难之间的差距往往以毫米和毫秒来衡量。为了让一辆自动驾驶汽车参与竞争,它不仅仅要简单地遵循路径;它必须将车辆推向其物理极限的边缘,在最大化抓地力而不滑向崩溃的极窄界限上寻求平衡。这是一个传统编程难以应对的领域,因为变量变化得太快,人类工程师无法为每一种可能出现的情景编写规则。相反,研究人员转向了一种称为“模仿学习”的方法,即计算机程序通过观察专家驾驶员来进行学习。其核心思想很简单:如果机器能够紧密地模仿专家的动作,它就应该能表现得同样出色。然而,这种方法存在一个关键缺陷。如果专家犯了错,或者机器误解了某种情况并哪怕只是向错误的方向产生了微小的偏差,后果都可能是灾难性的。机器可能会学会开得很快,但由于缺乏内置的安全理解,它很容易驶离赛道。

这就是研究人员 Shengfan Cao、Eunhyek Joa 和 Francesco Borelli 着手解决的挑战。他们意识到,当任务涉及在机器操控极限附近运行时,仅仅模仿专家是不够的。在他们的研究工作中,他们开发了一种新的教学方式,既能让自动驾驶汽车渴望模仿专家,又具备严格的内在安全感。他们并没有仅仅告诉计算机去复制专家转动方向盘的动作,而是创建了一个系统,在汽车执行动作之前,还会询问:“这个动作安全吗?”通过将这种安全检查直接嵌入到学习过程中,他们训练出了一种策略,这种策略不仅学会了如何开得快,还学会了如何避免导致碰撞的具体错误类型。他们的这种方法在一个复杂的赛车计算机模拟环境中进行了测试,要求车辆必须连续完成五十圈且不撞墙。结果显示,虽然标准方法经常失败,或者需要过多的训练时间才能变得可靠,但这种全新的具备安全意识的方法能更快地学会稳定且安全地驾驶,证明了机器可以学会在极限状态下赛车而不失控。

问题的核心在于这些学习系统通常是如何运作的。在标准的设置中,计算机观看专家驾驶员的视频,并试图预测驾驶员在任何给定情况下会做出什么反应。如果驾驶员向左转动方向盘,计算机就会学习向左转。当汽车处于计算机曾经见过的场景时,这套机制运作良好。但赛车充满了新的、意想不到的时刻。如果汽车遇到一个与训练数据略有不同的情况,计算机可能会产生微小的误差。在普通的驾驶场景中,一个小误差可能只是意味着车辆稍微偏离航线。但在比赛中,同样的微小误差可能会将赛车推向墙壁或导致侧滑。研究人员发现,仅仅尝试更准确地模仿专家并不是解决方案。即使是完美的模仿,该系统也缺乏理解安全边界的能力。它不知道某些动作即便看起来和专家做的一样,也是危险的,因为它们违反了汽车的物理极限。

为了解决这个问题,作者引入了一个“安全过滤器”,它就像是专家驾驶员身边的第二位老师。想象一下,一名学生在学习驾驶时,身边有一位知道如何赛车的名师,同时还有一位了解交通规则和车辆极限的安全官。学生试图模仿导师,但如果学生即将做出会导致碰撞的行为,安全官就会介入。在这个新系统中,计算机同时从两个来源进行学习。它试图模仿专家的表现,但也学习识别哪些状态是安全的,哪些是不安全的。研究人员开发了一种巧妙的方法,无需精确的汽车物理数学模型即可教会计算机什么是“安全”。他们使用了一种技术,让计算机观察许多驾驶尝试,其中既有成功的也有失败的。通过分析成功的尝试,系统构建了一张“安全区域”的地图——即所有车辆仍能在不发生碰撞的情况下完成比赛的位置和速度的集合。然后,它会学习避开任何会将车辆推离该安全区域的动作。

实验是在一个模拟真实赛车物理特性的环境(包括摄像头视角和速度传感器,就像真实的车辆一样)中进行的。目标是让汽车连续完成五十圈而不触碰赛道边界。研究人员将他们这种全新的具备安全意识的方法与没有安全过滤器的标准模仿学习方法进行了对比。结果令人震惊。标准方法甚至难以在不发生碰撞的情况下完成十圈,其失败的原因通常是由于产生了训练数据中并未明确惩罚的微小且不安全的偏差。相比之下,这种新方法学会了安全且一致地驾驶。在一项测试中,具备安全意识的赛车在不到八十次训练课内就完成了完整的五十圈,而标准方法甚至无法突破十圈。新系统学会了在保持高速行驶的同时与墙壁保持安全距离,这证明了它不仅学会了模仿专家,还理解了环境的约束。

这种方法之所以特别强大,是因为即使在汽车无法完美感知一切的情况下也能奏效。在现实世界中,汽车可能只有摄像头和一些速度传感器,而不是一个拥有完美、全知视角的系统。研究人员在这些限制条件下测试了他们的方法,仅向计算机输入摄像头图像和速度数据,就像真实的汽车所经历的那样。即便在这种部分信息获取的情况下,具备安全意识的系统依然表现优于标准方法,能更快地恢复出安全的驾驶策略。缺乏安全引导的标准方法则表现得不稳定且容易失败。这表明安全过滤器有助于计算机更好地进行泛化,使其能更有效地处理现实世界传感器中的不确定性和噪声。研究人员指出,该系统不仅学会了避免碰撞,还学会了保持一致性。圈速变得更加可预测,车辆的行为也变得更加可靠,这对于任何需要在现实世界中运行的自动驾驶系统来说都是至关重要的。

这项研究还强调了一个关于如何教机器执行复杂任务的关键洞察:仅仅向它们展示正确答案是不够的,我们还必须教它们错误答案长什么样,尤其是当错误答案会导致灾难时。通过在学习过程中加入安全惩罚,研究人员创建了一个优先考虑留在安全区域而非完美模仿专家每一个动作的系统。这并不意味着汽车会开得缓慢或谨慎;相反,它学会了如何在不跨越危险界限的前提下,尽可能地压榨性能极限。研究人员发现,这种方法比追求完美的模仿更为高效,因为它允许汽车在显著减少的训练步骤内,学会一套既安全又高性能的策略。

展望未来,研究人员承认尽管目前的结果令人鼓舞,但它们是基于模拟环境的。现实世界更加复杂,存在着不可预测的天气、多变的路况以及计算机模拟无法完全捕捉的机械缺陷。他们计划将这种方法应用于实体车辆,并进一步完善安全过滤器以应对现实世界的这些不确定性。他们还打算探索这种具备安全意识的方法如何应用到赛车之外的其他类型的学习任务中。最终目标是创造出不仅足够聪明以执行困难任务,而且足够明智以了解自身极限的自动驾驶系统。在自动驾驶赛车这个高速运转的世界里,打破纪录的圈速与一场毁灭性事故之间的区别往往仅在于几英寸,这种模仿与安全的结合不仅是一项技术改进,更是让自动驾驶车辆真正实现可靠运行的必经之路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →