✨ 要点🔬 技术摘要
想象一个汽车不仅仅是在行驶,而是在跳舞的世界。在胜负难分的一级方程式赛车(Formula 1)竞技场上,车手紧贴内侧线路,让轮胎紧贴地面以尽可能快地行驶。但在拉力赛中,在松散的碎石或雪地上,顶尖的车手会做一些疯狂的事情:他们故意失去抓地力。他们让赛车侧向旋转,像冰上的花样滑冰运动员一样滑过弯道。这被称为“漂移”。这听起来很危险,事实也确实如此,因为赛车正在与自身的物理特性作斗争。但如果做得好,它实际上能帮助赛车转弯更快,并更早完成比赛。
让计算机做到这一点对工程师来说是一场噩梦。通常,你教机器人驾驶的方法是向它展示具体该怎么做,或者给它一套严格的规则。但漂移是混乱的。赛车的轮胎在打滑,转向感觉很奇怪,物理特性也极其难以预测。如果你只是告诉计算机“让车滑行”,它可能会失控旋转并撞车。如果你试图为每一种可能的滑动编写一个完美的数学公式,计算机也会感到困惑,因为现实世界太复杂了。因此,科学家们转向了一个不同的技巧:强化学习(Reinforcement Learning)。把这想象成通过让一个游戏角色玩成千上万次游戏,在一次又一次失败中不断尝试,直到他们最终掌握如何获胜。问题在于,从零开始教一个机器人如何漂移,就像教一个蹒跚学步的幼儿做后空翻三周一样;他们起初通常只会摔个狗吃屎。
这篇论文介绍了一种巧妙的新方法,利用一种被称为“赛道引导的分层强化学习”(Track-Guided Hierarchical Reinforcement Learning)的方法,来教自动驾驶汽车如何漂移并赢得比赛。作者赵胜及其团队意识到,与其直接把机器人扔进深水区,不如像玩带有关卡的游戏一样,分阶段地教它。首先,他们使用一个超级精确的数学模型来计算绕赛道行驶的最快可能路径,即使这条路径包含剧烈的滑动。他们称之为“最短圈速”(Minimum-Lap-Time)计划。这个计划就像是一个参考或地图。
然后,他们让机器人进行学习。但他们并没有只说“出发”。他们使用了一种“赛道引导”的方法。在第一阶段,机器人在一条直线上学习,仅仅是弄清楚如何在不撞车的情况下让赛车滑动。在第二阶段,它学习如何绕过急转弯。最后,在第三阶段,它在完整的赛道上将这一切结合起来,看它能跑多快。机器人会因为保持在路径上、以正确的角度滑动以及快速完赛而获得积分。他们的计算机模拟结果显示,这种循序渐进的方法比尝试一次性学习所有内容的效果要好得多。机器人学会了有效地漂移,在保持车辆稳定的同时进行滑动,并且能够比他们测试的其他人工智能方法显著更快地完成圈数。虽然这一切目前都在计算机模拟中进行的,尚未在真实赛道上的真实赛车上进行测试,但这表明,只要有合适的训练指南,机器人很快就能像职业拉力赛车手一样,在弯道中完成漂移。
技术摘要:用于自主驾驶车辆漂移的轨迹引导分层强化学习与最小圈速规划
问题陈述 自主驾驶车辆的漂移面临着复杂的双重目标控制挑战:既要稳定高度非线性的漂移动力学,又要严格最小化圈速。不同于赛车手在轮胎抓地力极限内优化赛车线(Racing Lines)的 F1 赛车,拉力赛在松散或低附着力路面上通常需要故意打破牵引力来进行漂移。这种动作能够使车辆更好地为出弯做准备,从而缩短圈速,但也由于轮胎和底盘动力学的强非线性特性,引入了显著的控制难度。现有的强化学习(RL)方法面临两个主要障碍:(1)严重依赖昂贵的、针对特定车辆的专家演示数据集进行动作级监督;(2)缺乏结构化机制来引导智能体在训练早期学习具有物理意义的漂移策略,这往往导致次优或不安全的策略。
方法论 本文提出了一种**最小圈速(MLT)漂移规划与轨迹引导强化学习(TgRL)**框架。该方法集成了一个基于模型的轨迹规划器和一个深度强化学习控制器,以解决专家数据匮乏以及直接学习极端动力学难度大的问题。
最小圈速(MLT)漂移规划:
使用高保真、非线性的三自由度(3-DoF)车辆模型和 Magic Formula 轮胎模型(模拟综合侧滑条件),构建一个最优控制问题(OCP)。
其目标是最小化圈速,通过生成动力学可行且激进的参考轨迹,包括车辆位置、姿态、速度、侧滑角和横摆角速度。
约束条件包括道路边界、状态限制(例如侧滑角 β ∈ [ − π / 6 , π / 6 ] \beta \in [-\pi/6, \pi/6] β ∈ [ − π /6 , π /6 ] )以及控制输入限制。
生成的轨迹作为强化学习控制器的优质先验数据(参考路径),从而消除了对人类专家演示的需求。
轨迹引导强化学习(TgRL):
算法: 作者采用了 Soft Actor-Critic (SAC) 算法,这是一种适用于连续控制的离策(off-policy)、基于熵正则化的 Actor-Critic 方法。
课程学习: 为了克服直接学习具有大侧滑角的极端动力学难度的困难,实施了一种渐进式的三阶段训练策略:
第一阶段(基础策略): 在简化的直线赛道上进行训练,以学习基础的漂移控制(诱导轮胎侧滑并管理大侧滑角)。
第二阶段(弯道策略): 在发卡弯上进行训练,学习漂移过弯,重点在于如何发起漂移、维持侧滑角以及执行平滑的出弯。
第三阶段(竞赛策略): 在完整的封闭赛道(Lkarting)上进行训练,以整合各项技能,在保持稳定性的同时实现圈速最小化。
状态空间: 包括横向/航向/侧滑误差、速度误差以及未来的参考轨迹点。
动作空间: 包括连续的转向角和油门输入,通过自适应动作平滑(AAS)策略进行平滑处理,以防止高速行驶时的翻车。
奖励函数: 多目标奖励结合了:
瞬时奖励: 对横向偏差、航向、侧滑及速度误差进行惩罚。速度加权项鼓励高速过弯。
结束奖励: 在回合结束时发放的离散奖励。正向奖励根据圈速与 MLT 规划最优值的接近程度进行缩放;负向奖励则针对碰撞或翻车行为,并与生存时间成反比。
核心贡献
新颖框架: 本文引入了一个层次化规划-控制框架(MLT-TgRL),将基于最优控制的轨迹生成与深度强化学习无缝集成,使自主智能体能够在无需专家数据的情况下执行极端的漂移动作。
MLT 漂移规划: 开发了一种特定的 OCP 公式,用于生成激进且动力学可行的漂移轨迹,作为强化学习智能体的先验,有效地取代了高成本的人类演示。
渐进式训练方法: 引入了一种创新的课程学习方法,智能体通过逐步训练(从基础漂移控制到弯道控制,再到完整赛车)来提升能力,该过程由轨迹信息引导,并由结合了瞬时追踪项和 MLT 派生结束奖励的专门奖励函数进行强化。
结果 该框架在 CARLA 模拟器中的三个赛道(Lkarting、Willow Springs 和 Nelson Ledges)上进行了验证。
性能对比基准: 所提出的 MLT+TgRL 控制器在圈速表现上始终优于标准的 SAC 基准和之前的强化学习漂移控制器(Cai 等人)。在 Lkarting 赛道上,MLT+TgRL 框架实现了 45.4 秒 的平均圈速,比 Cai_DRIFT 基准(51.2 秒)提升了约 11% 。
与规划器的比较: 虽然 MLT 规划器达到了理论下限(Lkarting 上的最小圈速为 33.1 秒),但 TgRL 控制器取得了具有竞争力的结果,最小圈速为 37.2 秒 ,平均圈速为 45.4 秒 ,证明了其在实时控制环境下逼近最优轨迹的能力。
稳定性与动力学: 智能体成功维持了大侧滑角(在 Lkarting 上平均为 15.9° ,相比之下人类驾驶员为 10.4° ,基准模型为 16.3° ),证实了其维持漂移状态的能力。控制器还保持了较低的横摆角追踪误差和极小的横向偏移波动。
消融实验: 去除 MLT 引导(改用中心线参考)或移除渐进式课程会显著降低性能,证实了模型化先验和分阶段训练方法的必要性。引入结束奖励和自适应动作平滑进一步提高了圈速的一致性和漂移精度。
意义与主张 本文的主旨在于弥合理论最优规划与实际漂移执行之间的差距。通过利用基于模型的规划器提供动力学可行的参考路径,并结合强化学习控制器来适应未建模动力学和执行延迟,该方法实现了激进的漂移动作,并提高了稳定性和重复性。这项工作通过证明结构化、基于课程的学习(由最优轨迹引导)可以克服学习极端车辆动力学时固有的数据稀缺和探索挑战,为在现实世界自主赛车系统中使用强化学习奠定了基础。作者指出,虽然目前的方法行之有效,但未来的工作将侧重于将控制器推广到不同的车辆模型、道路条件,并实现硬件在环(HIL)实验。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。