Retrieval-Augmented Safety Knowledge for Vision-Language-Action Models in Autonomous Vehicles
本文提出了一种检索增强型描述框架,该框架将蒸馏后的避撞策略和形式化驾驶规则注入视觉-语言-动作模型中,通过解决标准模型经常忽略的安全关键细节,显著提高了自动驾驶车辆轨迹预测的准确性,使其达到接近真值的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
自动驾驶汽车正在通过摄像头观察世界,并倾听其对所见景象的内部描述来学习驾驶。这些被称为“视觉-语言-动作”模型的系统不仅处理原始图像,还将所见内容转化为文字,然后利用这些文字来决定转向方向和行驶速度。其核心理念是,如果一辆车能够用语言描述一个场景,它就能像人类驾驶员一样对其进行推理。然而,这些系统在学习方式上存在显著差距。它们的训练几乎完全基于正常、安全的驾驶视频。它们看到了数百万英里的平稳高速公路巡航,但极少接触危险时刻。由于事故本质上是罕见的,用于教导汽车在情况出错时如何反应的数据非常匮乏。收集真实的碰撞视频既困难又涉及伦理复杂性,而在计算机模拟中创建虚假碰撞往往无法捕捉到真实碰撞中那种混乱的现实。由于缺乏对这些危险时刻的接触,自动驾驶汽车可能会在无法避免危险之前难以识别出隐患。
西安大略大学(Western University)的研究人员开发出一种方法,无需重新训练整个驾驶系统或收集新的碰撞视频,即可弥补这一差距。他们并没有通过向汽车展示更多事故来教导它,而是通过给它一个可以在实时应用中查阅的“安全课程库”来进行教学。该团队从1,500段真实的交通事故行车记录仪视频入手。他们利用强大的人工智能观看每段碰撞视频,并准确记录下哪里出了问题、隐藏的风险是什么,以及驾驶员应该如何做才能防止碰撞。从这1,500段视频中,他们提炼出一套包含98条可重复使用的安全规则(或策略)的精简集,涵盖了诸如突然制动、能见度差或未让行等常见事故诱因。他们还将这些规则与18条正式的驾驶规则(如保持安全距离)相结合,从而创建了一个小型且可检索的安全知识数据库。
当自动驾驶汽车行驶时,系统会通过摄像头观察当前场景,并立即在数据库中搜索与所见场景相匹配的安全规则。如果汽车检测到某种类似于过去事故的情况,系统就会提取相关的安全建议,并将其输入到汽车的描述生成器中。随后,生成器会写出一个更谨慎的新场景描述,该描述会强调危险并建议防御性动作。这种经过强化的描述随后被传递给汽车的驾驶规划器,规划器利用这些文本来计算未来的行驶路径。结果是,汽车的决策过程受到了“如何避免碰撞”这一提醒的引导,即使汽车在训练期间从未经历过碰撞。
研究人员使用包含数千个真实驾驶场景的标准化驾驶数据集(来自日本)测试了这种方法。他们对比了汽车在使用普通描述与使用经过安全增强描述时的路径预测表现。结果非常明确:加入检索到的安全知识显著提高了汽车预测的准确性。在最佳情况下,与没有安全知识时相比,该系统将预测路径的平均误差降低了10.2%。更重要的是,配备安全库的汽车预测准确度,几乎达到了如同获得完美的人类编写描述时的水平。这表明,该系统成功学会了利用检索到的规则来更好地理解场景,有效地缩小了通用描述与安全关键型描述之间的差距。
研究还观察了该系统在处理未包含在原始训练数据中的危险、近乎碰撞情况时的表现。在这些测试中,没有安全库的系统往往会对场景进行被动描述,通常建议汽车维持原速或保持车道。而当安全库处于激活状态时,同一个系统会对同样的场景进行更具谨慎性的描述,建议汽车减速、增加跟车距离或礼让其他车辆。这种语言上的转变直接转化为了更安全的行为,表明该系统能够将从过去事故中学习到的教训推广到新的、未见的危险之中。
该方法最实用的方面之一是其高效性。构建安全库的繁重工作是在线下完成的,即在汽车驶上路面之前。一旦库文件建立完成,汽车就不需要通过大规模的新数据集进行重新训练或更新来学习一条新的安全规则。研究人员只需更新库文件,汽车在下次行驶时就能立即获取该项新知识。这意味着系统可以适应新的事故类型或不同的交通法规,而无需经历昂贵且耗时的整个人工智能模型重训过程。这项研究证实,将结构化的安全知识注入决策瞬间,是使自动驾驶汽车变得更安全、更可靠,并能更好地应对定义现实世界驾驶的那些长尾危险事件的一种强大方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。