DriveSafer: End-to-End Autonomous Driving with Safety Guidance
DriveSafer 是一种面向端到端自动驾驶的新型安全框架,它通过训练阶段的约束和推理阶段的引导,明确将生成式规划器导向安全行为,与最先进模型相比,在 NAVSIM 基准测试中显著降低了灾难性故障和合规性违规。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个全新且极具天赋的机器人驾驶员在城市街道上行驶。这个基于“端到端”人工智能构建的机器人,就像一个观看了数百万小时驾驶视频的天才儿童。它能处理复杂的交通状况、汇入高速公路,并对行人做出反应,表现几乎胜过任何人。
然而,有一个问题:虽然这个机器人在“平均”驾驶表现上非常出色,但它偶尔会出现“大脑空白”,导致灾难性的事故。它可能会突然决定开上人行道、撞向行人,或者无视“右转”标志,径直驶入对向车道。这些并非小错误,而是灾难性的故障,使得该机器人无法安全地用于现实世界。
本文介绍了DriveSafer,这是一个新系统,其设计目的不仅仅是让机器人整体成为“更好”的驾驶员,而是专门阻止这些危险的“大脑空白”。可以将 DriveSafer 想象为一位安全教练,它在两个截然不同的阶段与机器人协同工作:在其“ schooling"(训练)期间,以及在其实际“驾驶”(推理)期间。
问题所在:“平均”陷阱
作者们注意到,以往的安全检查就像只根据学生的平均考试成绩来评分。一个学生可能平均分为 95%,但依然会在最重要的一场考试中不及格:即“不要撞墙”测试。即使是现有最好的机器人驾驶员(例如名为DiffusionDrive的机器人),虽然平均得分很高,但在罕见且危险的情况下仍会发生碰撞。
解决方案:DriveSafer
DriveSafer 像一位严厉但乐于助人的导师,主要使用两种工具:
1. 训练时间:“安全作业”
当机器人学习时,DriveSafer 会在其课程中加入特殊的“安全作业”。
类比:想象教一个孩子骑自行车。与其只是让他们骑,不如给他们装上辅助轮(约束),并在他们倾斜过度时给予轻微的推动(损失函数)。
工作原理:该系统教导机器人遵守三条具体规则:
- 留在道路上:不要驶离路面或开上人行道。
- 保持距离:不要过于靠近其他车辆或行人。
- 平稳行驶:不要做出会让乘客晕车的突然、 jerky 动作。
如果机器人试图学习违反这些规则的路径,它将会受到“惩罚”(数学得分下降),从而迫使它从一开始就养成更安全的习惯。
2. 推理时间:“安全双重检查”
即使经过良好的训练,机器人在实际驾驶时仍可能产生瞬间的犹豫或困惑。DriveSafer 在机器人执行动作之前增加了一个“第二意见”步骤。
- 类比:想象你正准备穿过一条繁忙的街道。你向左看,然后向右看,接着心想:“等等,如果我向左迈一步会怎样?那样可能更安全。”在迈出一步之前,你在大脑中生成几个快速的“如果……会怎样”的情景。
- 工作原理:
- 机器人生成其主要计划(例如,“左转”)。
- DriveSafer 立即生成几个替代计划(例如,“左转但稍慢一点”,或者“左转但稍微向右偏移”)。
- 它将所有这些选项与地图以及其他车辆的位置进行核对。
- 如果原始计划看起来可能会撞到人或驶离道路,DriveSafer 将拒绝该计划,并选择最安全的替代计划。
结果:更少事故,更安全道路
作者在著名的驾驶基准测试NAVSIM上测试了该系统,该测试充满了棘手且真实的场景。
- 重大胜利:与之前的最佳机器人驾驶员相比,DriveSafer 将灾难性故障(碰撞或驶离道路)的数量减少了48%。
- 人行道问题:具体而言,车辆驶出允许道路区域的故障减少了**65%**以上。
- 视觉证据:论文展示了这样的例子:旧机器人曾径直撞向人群或开上人行道,而 DriveSafer 成功地将车辆引导至安全停车点或不同的路径。
总结
简而言之,DriveSafer是一个框架,它承认:“我们不能仅仅指望机器人是完美的;我们需要主动阻止它犯下危及生命的错误。”通过在训练期间结合严格的安全规则,并在驾驶期间实施“双重检查”系统,它将一个才华横溢但鲁莽的机器人驾驶员转变为一个更安全驾驶员,专门针对那些可能导致实际伤害的最坏情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。