← 最新论文
💻 computer science

Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning

本文提出了一种轨迹引导的分层强化学习框架,该框架利用最小圈时规划轨迹,逐步训练自主车辆控制器,使其能够在松散路面上实现稳定且高效的漂移。

原作者: Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个汽车不仅仅是在行驶,而是在跳舞的世界。在胜负难分的一级方程式赛车(Formula 1)竞技场上,车手紧贴内侧线路,让轮胎紧贴地面以尽可能快地行驶。但在拉力赛中,在松散的碎石或雪地上,顶尖的车手会做一些疯狂的事情:他们故意失去抓地力。他们让赛车侧向旋转,像冰上的花样滑冰运动员一样滑过弯道。这被称为“漂移”。这听起来很危险,事实也确实如此,因为赛车正在与自身的物理特性作斗争。但如果做得好,它实际上能帮助赛车转弯更快,并更早完成比赛。

让计算机做到这一点对工程师来说是一场噩梦。通常,你教机器人驾驶的方法是向它展示具体该怎么做,或者给它一套严格的规则。但漂移是混乱的。赛车的轮胎在打滑,转向感觉很奇怪,物理特性也极其难以预测。如果你只是告诉计算机“让车滑行”,它可能会失控旋转并撞车。如果你试图为每一种可能的滑动编写一个完美的数学公式,计算机也会感到困惑,因为现实世界太复杂了。因此,科学家们转向了一个不同的技巧:强化学习(Reinforcement Learning)。把这想象成通过让一个游戏角色玩成千上万次游戏,在一次又一次失败中不断尝试,直到他们最终掌握如何获胜。问题在于,从零开始教一个机器人如何漂移,就像教一个蹒跚学步的幼儿做后空翻三周一样;他们起初通常只会摔个狗吃屎。

这篇论文介绍了一种巧妙的新方法,利用一种被称为“赛道引导的分层强化学习”(Track-Guided Hierarchical Reinforcement Learning)的方法,来教自动驾驶汽车如何漂移并赢得比赛。作者赵胜及其团队意识到,与其直接把机器人扔进深水区,不如像玩带有关卡的游戏一样,分阶段地教它。首先,他们使用一个超级精确的数学模型来计算绕赛道行驶的最快可能路径,即使这条路径包含剧烈的滑动。他们称之为“最短圈速”(Minimum-Lap-Time)计划。这个计划就像是一个参考或地图。

然后,他们让机器人进行学习。但他们并没有只说“出发”。他们使用了一种“赛道引导”的方法。在第一阶段,机器人在一条直线上学习,仅仅是弄清楚如何在不撞车的情况下让赛车滑动。在第二阶段,它学习如何绕过急转弯。最后,在第三阶段,它在完整的赛道上将这一切结合起来,看它能跑多快。机器人会因为保持在路径上、以正确的角度滑动以及快速完赛而获得积分。他们的计算机模拟结果显示,这种循序渐进的方法比尝试一次性学习所有内容的效果要好得多。机器人学会了有效地漂移,在保持车辆稳定的同时进行滑动,并且能够比他们测试的其他人工智能方法显著更快地完成圈数。虽然这一切目前都在计算机模拟中进行的,尚未在真实赛道上的真实赛车上进行测试,但这表明,只要有合适的训练指南,机器人很快就能像职业拉力赛车手一样,在弯道中完成漂移。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →