← 最新论文
🔢 mathematics

Real-Time Rulebook-Aware Nonlinear MPC for Autonomous Driving with Priority-Biased Tiered Slacks

本文提出了 W-SQP,一种实时、可审计的非线性模型预测控制器,它通过采用一种优先级偏向的分层松弛公式来系统地优先处理规则违规行为,同时维持执行器边界,从而解决自动驾驶中安全、规制、舒适度与效率之间的冲突。

原作者: Hadi Hajieghrary, Benedikt Walter, Chaitanya Shinde, Paul Schmitt, Miguel Hurtado

发布于 2026-07-14
📖 1 分钟阅读🧠 深度阅读

原作者: Hadi Hajieghrary, Benedikt Walter, Chaitanya Shinde, Paul Schmitt, Miguel Hurtado

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。你给了它一本巨大的规则手册:“不要撞到任何人”、“遵守限速”、“不要猛打方向盘”以及“尽快到达”。但当这些规则发生冲突时会发生什么呢?比如,为了避开一辆停下的车,你可能不得不稍微加速,这违反了“舒适度”规则;或者为了绕过障碍物,你可能不得不跨越车道线,这违反了“保持在车道内”的规则。

这篇论文的作者构建了一个新的驾驶大脑,叫做 W-SQP。把它想象成一个非常严格但公正的裁判,必须做出瞬息万钟的决策。它的核心技巧是一个“分层松弛”(tiered slack)系统。想象一下规则手册是一把有四个横档的梯子。顶层是安全性(不要撞车),下一层是法规(遵守标志),接着是舒适度(平稳驾驶),底层是效率(尽快到达)。

当机器人陷入困境时,它被允许打破规则,但 W-SQP 裁判被编程为只允许打破较低层级的规则。它会乐于牺牲平稳的驾驶体验或一点点速度,以确保车辆的安全和合法。这就像一位家长,为了帮助处于困境中的朋友(高优先级),可以允许你不做作业(低优先级),但绝不会为了完成作业而让你不去帮助朋友。

重大发现:“模仿者”陷阱

这是论文中最令人惊讶的部分。研究人员将这个新的机器人驾驶员与一个“金标准”驾驶员进行了对比测试:即一段人类专家在同一路线上驾驶的录像。

通常,当我们测试自动驾驶汽车时,我们会问:“你与人类的路径有多接近?”如果机器人行驶在一条略有不同但完全安全的车道上,它会得到一个低分,因为它没有完全模仿人类。作者称之为**“模仿溢价”(Imitation Premium)**。

他们发现,如果你将“安全规则”与“模仿规则”混合在一起,机器人的表现看起来会非常糟糕。在他们的测试中,仅仅因为机器人没有完全遵循人类的精确路径,就会受到严厉惩罚,尽管它的驾驶同样安全。这就像一个学生因为使用了与老师示例不同的有效解题方法,而在数学考试中得了不及格。

论文认为这是不公平的。他们提出了一种新的评分方式:将“安全得分”与“模仿得分”分开。当他们这样做时,机器人的表现非常出色。在涉及安全和法律的 16 条规则(如不撞车或不闯红灯)上,机器人的表现几乎与人类专家完全一致。之前它看起来表现较差,仅仅是因为它拒绝做一个盲目的模仿者。

它做不到的事(现实检查)

了解这个机器人不是什么非常重要。

  • 它不是一种神奇的安全保证。 论文明确指出这是一个原型,而不是准备好投入街道使用的成品。它并不具备那种通过数学证明永远不会出车祸的“形式化安全保证”。
  • 它并不总是完美的。 在最困难、最复杂的场景中(例如在密集的交通流中,机器人必须做出与人类截然不同的选择),它确实比人类犯了一些更多的错误,特别是在保持车道线内或遵守限速方面。但这些都是罕见的“恢复瞬态”(recovery transients),而非彻底失败。
  • 它不是一个“硬实时”系统。 这个机器人是在一台强大的工作站上解决其数学问题的。论文测量显示,它通常在 28 毫秒内完成驾驶规划(这非常快),但有时会耗时高达 104 毫秒。如果计算机过于繁忙,机器人可能无法在截止时间内完成数学计算,因此它有一个备份方案,即仅仅进行平缓减速。它是“随时可用”(anytime-capable)的(即在截止日期前给出它能找到的最佳答案),但不能保证在每一毫秒都完美无缺。

他们是如何测试的

他们并没有仅仅靠猜测;他们运行了一个大规模模拟。他们从 Waymo Open Motion Dataset(一个庞大的真实驾驶数据库)中提取了 150 个真实的驾驶场景。他们将他们的机器人与另外两种类型的驾驶员进行了对决:一种是简单的“跟随道路”型驾驶员,另一种是更复杂的“择优选择”型驾驶员。

结果是在闭环中测量的,这意味着机器人在模拟中实际驾驶车辆,且其他车辆会对它做出反应。他们发现,虽然机器人的“模仿得分”比人类低了约 10.1 个百分点(因为它采取了不同的路径),但其“安全得分”仅相差 0.04 个百分点。这基本上是不分伯仲。

总结

论文的结论是,我们需要停止根据自动驾驶汽车模仿人类录像的程度来给它们评分。如果一辆车驾驶安全且合法,但采取了与人类不同的路径,它不应该受到惩罚。W-SQP 机器人证明了你可以构建一个理解优先级(安全 > 舒适度)并能做出可审计决策(你可以查看日志并准确看到它违反了哪条规则以及违反了多少)的系统,同时还能运行得足够快以满足实时驾驶的需求。

这是一个强有力的进步,但作者也谨慎地表示:“我们拥有一个在模拟中表现良好的优秀原型,但在我们可以说它对道路安全可靠之前,我们仍需在配备真实传感器和真实交通环境的真实汽车上进行测试。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →