← 最新论文
⚡ electrical engineering

A Hybrid End-to-End and Modular Control Architecture Toward Safe Vehicle Lateral Control: Combining Soft Actor-Critic with Model Predictive Control

本文提出了一种混合车辆横向控制架构,该架构通过单调混合系数将软行为者-评论家(Soft Actor-Critic)强化学习策略与受约束的模型预测控制器相结合,在保持基于模型的控制的安全性保证与可解释性的同时,实现了端到端学习的适应性。

原作者: Farzaneh Tatari

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Farzaneh Tatari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

驾驶汽车涉及的是车辆与道路之间持续且微妙的博弈。为了保持在车道内行驶,车辆必须不断调整转向,以应对曲线、风力和轮胎抓地力的不均匀。几十年来,工程师们一直依赖两种主要方式来教会计算机如何完成这项工作。第一种是基于规则的方法,即汽车遵循一套严格的物理方程和预设限制。这种方法具有可预测性和安全性,但可能显得僵化;如果道路状况发生了规则未曾预见的改变,汽车可能会陷入困境。第二种方法是基于学习的方法,即计算机程序通过观察成千上万个驾驶案例,自行摸索出最佳动作。这种方法具有极高的灵活性,能够处理复杂的混乱情况,但它是一个“黑箱”:很难知道它为何做出特定的选择,也无法保证它在遇到从未见过的场景时不会犯下危险的错误。

自动驾驶的未来挑战在于如何结合两者的优点。我们需要一个既像人类学习者一样具有适应性,又像规则驱动型工程师一样可靠且易于理解的系统。独立研究员法尔扎内·塔塔里(Farzaneh Tatari)的一项新研究正是在解决这一问题,她为汽车的横向运动创建了一个混合控制器。该研究并非依赖单一方法,而是将基于学习的策略与基于规则的安全网进行融合。其目标是观察汽车是否能在受到安全系统约束、确保绝不超出物理极限或做出异常动作的同时,学会平稳且精准地驾驶。

为了测试这一想法,研究人员构建了一个以 15 米/秒恒定速度行驶的汽车数字模拟环境。在这个虚拟世界中,她设置了四种不同的“驾驶员”来观察它们的表现。第一个是多年来在汽车中广泛使用的标准简单控制器。第二个是先进的基于规则的系统,它在遵守转向速度严格限制的同时,不断计算最佳路径。第三个是纯学习系统,从零开始训练,旨在最小化误差而不依赖任何预设规则。第四个,也是最重要的,是全新的混合系统。该系统获取学习型人工智能的转向指令和基于规则的计算器的转向指令,并将两者融合为一条单一指令。它使用一个单一的旋钮来调节混合比例:将旋钮向一侧转动,会赋予灵活的学习型人工智能更多权重;向另一侧转动,则会赋予安全的规则型计算器更多权重。

模拟结果显示,学习型人工智能在保持车辆位于车道中心方面最为精准,其误差比传统的基于规则的系统更少。然而,纯学习型人工智能存在弱点:在极少数与其训练数据差异巨大的极端情况下,它偶尔会犯错,导致车辆过度偏离航线。混合系统既保留了学习型人工智能的高精度,又确保了每一条转向指令都处于汽车的安全物理极限之内。在绝大多数测试中,混合动力汽车的表现几乎与纯学习型人工智能一样出色。然而,在纯学习型人工智能出现失败的那些极少数极端案例中,混合系统也继承了完全相同的失败。由于学习型人工智能在混合比例中占据主导地位,规则型安全组件无法足够迅速地对其进行干预,从而无法阻止错误发生。

研究还探讨了当汽车遇到未经训练的情况(如湿滑路面或初始位置出现巨大偏差)时的情况。混合系统表现出了鲁棒性,即使在轮胎抓地力弱于预期或汽车初始出现显著横向漂移时,仍能保持其准确性。然而,研究人员发现这种安全性存在特定的局限。在极少数非常罕见的极端案例中,当汽车起始位置存在巨大偏差,且学习型人工智能试图向一个已达到其物理极限的方向转向时,这种混合机制无法及时纠正错误。这是因为学习型人工智能在混合比例中过于强势,导致规则型安全组件无法足够迅速地覆盖它,从而导致碰撞。

这一发现引出了关于此类系统在现实世界中应如何运作的关键洞察。研究人员提出,控制混合比例的“旋钮”不应该是固定的。相反,它应该与外部信息(如来自其他车辆或道路传感器的数据)相连。如果系统检测到汽车正在进入一个从未见过的场景,或者路况变得危险,旋钮应自动转向,从而赋予安全的规则型计算器更多权力。这将使汽车在普通道路上保持灵活性和高效性,而在情况变得不确定时,能立即变得更加保守和可预测。

这项工作证明,构建一个既能从经验中学习,又不丢失传统工程安全性保障的车辆控制器是可能的。混合方法成功地保留了学习系统的平滑、精准追踪能力,同时将汽车维持在物理边界之内。虽然目前的版本只是两种信号的简化融合,但研究指向了一个未来,即更高级的版本可以解决剩余的罕见失效问题。通过将控制器连接到车辆网络和道路基础设施,系统可以动态调整其行为,确保汽车即使在面对从未见过的复杂路况时也能保持安全。这代表了向着更智能、且更懂得何时依赖安全规则的车辆迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →