CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving
本文介绍了 CLAP,这是一种感知位置的框架,它在冻结的视觉 - 语言 - 动作模型的潜在空间中优化每个路障的软提示,从而在不影响正常帧性能的前提下,显著减少罕见且关乎安全的关键长尾驾驶场景中的规划错误。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一辆极其智能的自动驾驶汽车。它读遍了整个互联网,熟知所有交通法规,并能完美处理 99% 的驾驶场景。它就像一名在学校里每次考试都取得满分的优等生。
但问题在于:当这位“优等生”遇到奇怪、罕见的情况时——比如到处都是锥桶的施工区域,或者被停放的卡车遮挡的停车标志——它就会惊慌失措。它可能会撞上锥桶,或者未能停车。这些就是“长尾”问题:罕见且棘手的场景,汽车尚未见到足够多的次数以自然习得应对方法。
这篇论文介绍了一种名为CLAP的新方法,旨在无需从头重新训练整辆汽车即可解决这些问题。以下是其工作原理,辅以简单的类比:
问题:“一刀切”的失败
通常,要纠正一个糟糕的司机,你会让他们多学习(收集更多数据)或重返驾校(重新训练模型)。但罕见问题过于具体,无法通过通用学习来覆盖。你无法让汽车针对世界上每一个坑洼或每一个独特的施工现场进行训练。
作者们意识到一个重要的事实:错误发生在特定的地点。
- 如果汽车在施工地点 A发生碰撞,那是因为该地点的具体布局所致。
- 如果它在路口 B发生碰撞,那是因为那个特定的几何结构所致。
汽车不需要学会如何应对世界上所有的施工地点;它只需要学会如何应对这个特定的地点。
解决方案:“本地小抄”(CLAP)
CLAP 不是重写汽车的整个大脑,而是为特定地点创建微小、无形的“小抄”(称为软提示)。
将汽车的大脑想象成一座巨大的图书馆。CLAP 并不重建图书馆,而是在特定街角的书架上贴一张小小的便利贴。当汽车驶过那个街角时,它会阅读这张便条并立即调整其行为。
CLAP 如何创建“小抄”
该过程在云端(如同中央大脑)利用其他车辆此前驶过该棘手路段的数据进行。它采用两步“训练”过程:
步骤 1:寻找“麻烦的方向”
想象汽车的大脑是一个三维空间,其中每个驾驶场景都是一个点。
- 正常驾驶的点聚集在一起。
- 棘手驾驶的点混杂在它们旁边,就像红色弹珠混在蓝色弹珠中一样。
- 目标:系统需要找到一个特定的方向,将“棘手”的点推离“正常”的点,同时完全不动“正常”的点。
- 方法:它使用一种称为对比学习的技术。这就像老师指着红色弹珠说:“向这个方向移动以确保安全”,同时忽略蓝色弹珠。这就为那个特定的路障创建了一个“指南针”(一个特定的方向)。
步骤 2:带护栏地书写便条
现在,系统编写实际的“小抄”(提示),以改善汽车在该棘手路段的驾驶表现。
- 陷阱:如果你只是告诉汽车“修复棘手部分”,它可能会意外破坏其在同一条街道正常路段的驾驶表现,因为红色和蓝色弹珠混杂得太紧密。
- 对策:CLAP 使用方向正则化。它告诉汽车:“你只能沿着我们在步骤 1 中找到的‘指南针’方向移动。”
- 这确保了汽车在棘手部分的表现得到提升。
- 它也确保了汽车不会在简单路段意外偏离轨道。这就像给司机一个 GPS,只允许在特定车道内转弯,防止其突然变道冲入对向车道。
在现实生活中的运作方式(V2X 网络)
该论文设想其运作方式如同一个邻里守望系统:
- 众包:汽车 A 驶过一个棘手的施工区域并遇到困难。它将带有数据的“求助请求”发送至云端。
- 云端处理:云端分析数据,为该特定区域创建完美的“小抄”(优化后的提示)并保存。
- 即时交付:汽车 B 接近同一区域。它向云端询问:“这个地点有便条吗?”云端发送“小抄”。
- 即时适应:汽车 B 将便条加载到其冻结的大脑中。现在,它确切知道如何安全地通过该施工区域,即使它从未在“学校”里“学过”这一点。
结果
作者在名为 NAVSIM 的基准测试中,使用真实的自动驾驶模型对此进行了测试。
- 结果:CLAP 将这些棘手情况下的驾驶错误减少了24%。
- 安全网:关键在于,它没有使汽车在正常驾驶方面表现变差。“小抄”如此精确,以至于它们修复了坏路段,而没有破坏好路段。
总结
CLAP 是一种赋予自动驾驶汽车本地化、按需获取的智慧的方法。与其试图让汽车成为全能的 genius(这既困难又昂贵),不如为它遇到的每一个棘手街角提供具体、安全的指令,确保它在安全驾驶的同时,不会忘记如何正常驾驶。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。