End2Race: An End-to-End Learning Framework for Multi-Vehicle Autonomous Racing
本文介绍了 End2Race,这是一个用于多车自主赛车的端到端学习框架,该框架实现了亚毫秒级的推理延迟,并通过在面对面竞争中展示出鲁棒的泛化能力、高车速和自适应超车能力,超越了现有的基于规则的方法和单车学习方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
自动驾驶汽车的世界常被想象成在笔直的高速公路上进行的一次安静旅程,车辆只需识别停止标志或行人即可。但自主系统智能性的真正考验在于赛车场的混乱环境。在这里,车辆高速移动,在动态环境中不断对彼此做出反应,而在这种环境下,哪怕是瞬时的延迟也可能意味着一次成功的超越与一次碰撞之间的差别。为了在不冒着破坏昂贵真实车辆风险的情况下研究这种高风险环境,研究人员使用了一种被称为 F1Tenth 的缩放平台。这些车辆的大小仅为真实汽车的十分之一,配备了能像雷达一样扫描周围环境的传感器,使其能够在接近每秒 18 米的速度下进行赛道导航。挑战不仅在于开得快,还在于如何在决定何时加速、何时减速以及如何挤过竞争对手车辆而不发生碰撞的同时,保持高速行驶并做出复杂的决策。
多年来,这些竞赛中最成功的策略一直依赖于僵化的、预先编程的规则。工程师在比赛开始前构建赛道的数字地图,计算出车辆应遵循的完美路线。虽然这在已知赛道上效果良好,但一旦车辆遇到新的布局或不按预期路径行驶的对手,这种方法就会失效。其他方法试图对车辆当前所见到的事物做出即时反应,但它们往往缺乏规划平滑动作的前瞻性,导致驾驶过程颠簸且不稳定。第三种方法使用机器学习,即计算机通过观察专家或通过试错来进行学习。然而,大多数此类学习系统仅在单车独自驾驶的情况下进行过测试,或者反应速度太慢,迫使它们以远低于竞争水平的速度行驶。差距依然存在:没有人成功地教会计算机如何在高速行驶的同时,通过实时反应进行一对一的对抗性比赛。
为了弥补这一差距,一个研究小组推出了一种名为 End2Race 的新系统。该框架旨在教导一辆自动驾驶汽车如何实时超越另一辆车,其使用的学习过程模仿了人类驾驶员的学习方式:首先观察专家,然后进行自主练习。研究人员搭建了一个虚拟训练场,让一辆被称为“自我车辆”(ego vehicle)的赛车与一名对手配对。他们创建了 72_个不同的场景,其中对手沿着不同的路径和以不同的速度行驶,迫使学习中的赛车去寻找间隙、切入间隙并安全通过。该系统并不依赖预先绘制的赛道地图;相反,它完全基于传感器的原始数据和自身引擎的速度来学习驾驶。
该系统的核心是一个神经网络,这是一种旨在识别模式的计算机程序,其设计极其迅速。在自动驾驶赛车领域,时间是以毫秒来衡量的,即使是零点几秒的延迟也可能导致赛车错过弯道或发生碰撞。研究人员设计了他们的网络,使其能在不到一毫秒内做出决策,这一速度足以跟上比赛的快速变化。为了训练这个网络,他们首先使用了一种称为“行为克隆”的方法,通过分析 720 个八秒钟的专家演示,来学习转向和速度的基础知识。然而,仅仅模仿专家是不够的,因为专家有时会犯错,或者无法适应移动对手的不可预测性。为了解决这个问题,团队随后让计算机在这些场景中进行 500 次自我对决,使用了名为“强化学习”的技术。在这个阶段,赛车因快速前进而获得奖励,并因碰撞而受到惩罚,从而使其能够优化自己的策略,并学会处理专家从未遇到过的状况。
训练结果令人瞩目。当在从未见过的赛道上进行测试时,学习后的赛车平均时速超过 8.5 米,显著高于以往基于学习的方法(这些方法通常被限制在低于 3 米每秒的速度)。更重要的是,在与对手进行头对头比赛时,新系统在近 97% 的尝试中成功超越了对手,同时保持了近 98% 的安全性。这一表现远优于旧有的基于规则的系统和其他学习方法,后者要么频繁碰撞,要么根本无法超越对手。该系统证明了其能够适应不同的对手,即使那些对手以计算机从未见过的驾驶方式(例如使用不同的算法来避障)进行行驶。
研究人员还详细检查了赛车是如何做出决策的。在一种场景中,赛车会发现前方较慢的对手,平滑地向侧方移动以对准间隙,然后加速超越。在另一种场景中,它会在急转弯前轻微刹车以保持控制,然后在驶出曲线后立即剧烈加速,这种动作模仿了职业人类赛车手的技巧。该系统并非完美;在极少数情况下,当两辆车并排行驶时赛道突然变窄,赛车会发生碰撞,因为它无法预测赛道的未来形状。然而,这些失败的情况远比其他方法要少,且整体表现证明了该车已经学会了一种稳健且具有适应性的驾驶风格。
这项工作表明,自动驾驶赛车——以及潜在的高速自动驾驶——的未来在于能够从经验中学习的系统,而非依赖静态规则。通过将快速、高效的神经网络与两阶段训练过程相结合,研究人员展示了机器可以学习如何在复杂、动态的交互中进行导航,并达到此前无法实现的速度与安全性水平。该系统不需要地图来指引方向;它只需要观察世界,理解交通流,并在眨眼之间做出反应。随着研究人员准备在现实世界的竞赛中测试该系统,其影响已延伸至赛道之外,为自动驾驶汽车未来如何自信且熟练地应对共享道路上不可预测的混乱局面提供了预见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。