BeyondSight: Object Permanence for End-to-End Autonomous Driving
该论文介绍了 BeyondSight,一种具备持久性感知能力的端到端自动驾驶框架,该框架在遮挡期间维持持久的参与者假设,以改进推理与规划,并通过新的 nuScenes-Permanence 数据集进行了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在开车,但驾驶座后面不是人类,而是一个超级聪明的机器人大脑。这个大脑利用摄像头来观察世界,就像你一样。但棘手的部分在于:世界充满了盲区。一辆大卡车可能会挡住你的视线,让你看不见行人;或者一栋建筑可能会遮挡住一名骑行者。
长期以来,最优秀的机器人大脑都有一个奇怪的故障:如果它们看不见某个东西,它们就会表现得好像那个东西不存在一样。
这就像是在玩一场“马可波罗”游戏,机器人只计算它能看到的玩家。如果一个玩家游到了一个浮岛后面消失了,机器人会立即忘记他们的存在。就好像玩家凭空消失了一样。这是非常危险的!如果机器人忘记了卡车后面的行人,它可能会直接开向那个行人即将踏出的位置。
“幽灵”问题
论文将这个问题称为物体恒常性(Object Permanence)。简单来说,物体恒常性是指即便看不见物体,也能知道它们依然存在的能力。婴儿在很早的时候就会学习这一点;如果把玩具藏在毯子下面,他们知道玩具还在那里。
目前大多数自动驾驶系统(比如论文中进行对比的那些系统)就像是还没学会这一点的婴儿。它们将“存在”与“视觉”直接挂钩:
- 看到了? 它就在那里。
- 没看到? 它就不存在了。
作者反对这种做法。他们认为,仅仅因为传感器(如摄像头或激光雷达)无法捕捉到车辆或人的信号,并不意味着那辆车或那个人就不存在了。论文明确排除了这样一种观点,即我们不应该仅仅等待物体重新出现后再去担心它。等待就太晚了;在那之前可能已经发生碰撞了。
走进“BeyondSight”:拥有记忆的机器人
研究人员引入了一个名为 BeyondSight 的新系统。你可以把 BeyondSight 想象成一个为它见过的每一辆车或每一个人都保留着“心理便签”的机器人。
它是如何工作的,我们可以用一个有趣的类比来理解:
想象机器人是一名正在侦破案件的侦探。
- 观察: 侦探看到一名嫌疑人(一辆车)正在街上奔跑。
- 消失: 嫌疑人躲到了墙后。侦探看不见他们了。
- 旧方法: 侦探说:“好吧,我看不见他们了,所以他们一定是瞬间移动走了。结案!”然后停止追踪。
- BeyondSight 方法: 侦探说:“我看不见他们,但我知道他们刚才正朝着那个方向跑。即使墙挡住了我的视线,我也要在心里记下他们应该在的位置。”
BeyondSight 通过数学方式实现这一点。它会对隐藏的行动者保持一个“假设”(猜测)。它会根据行动者在被遮挡前移动的速度和方向来更新这个猜测。即使摄像头什么也看不见,机器人的大脑也会让那个行动者的“幽灵”在规划中保持活跃状态。
证明:它奏效了吗?
作者不仅仅是凭空构想,他们还进行了测试。他们创建了一个著名驾驶数据集 nuScenes 的新版本,并将其命名为 nuएससीnes-Permanence。
在旧的数据集中,如果一辆车躲在建筑后面,数据会显示“此处无物”。而新的数据集则会说:“有一辆车在那里,但它被遮挡了。”这使得他们能够训练机器人去记住隐藏的事物。
以下是他们在测试中发现的结果,包含了测试中的准确数字:
- “不可见”得分: 在使用 BeyondSight 之前,机器人检测完全隐藏的行动者的能力为 0。仿佛他们不存在一样。使用 BeyondSight 后,这个得分跃升至 0.249 mAP。这实现了从无到有的巨大飞跃!
- 安全得分: 最重要的部分是汽车的驾驶表现。研究人员测量了“规划误差”(即汽车路径偏离完美安全路径的程度)。
- 旧方法有 0.61 的误差。
- BeyondSight 将此误差降低到了 0.54。
- 他们还测量了“碰撞率”(机器人差点撞到东西的频率)。旧方法为 0.08%,而 BeyondSight 降至 0.07%。
这为什么重要
论文指出,这种“记忆”让机器人变得更安全,尤其是在交叉路口或过街路口等复杂路段,因为车辆经常会躲在其他车辆后面。
在一个特定的测试中,他们观察了一个行人躲在卡车后面的情况。
- 旧机器人: 忘记了行人。它规划了一条路径,这条路径会直接撞向行人的未来位置。
- BeyondSight: 记住了行人。它规划了一条路径,即使看不见那个人,也为隐藏的行人留出了充足的空间。
难点(他们尚不了解的部分)
作者谨慎地表示,这并不意味着问题已经完美解决。他们承认,如果一个隐藏物体在长时间内保持隐藏状态,机器人的猜测可能会变得有些“陈旧”或产生偏差。这就像是在猜墙后朋友奔跑的方向;如果墙长达 100 米,当他们出来时,你的猜测可能会有些偏差。
此外,该系统在隐藏物体运动平稳时效果最好。如果一辆隐藏的汽车突然停止或以机器人未预料到的方式转向,系统可能无法立即捕捉到它。
总结
主要结论是,为了实现真正的安全,自动驾驶汽车需要停止表现得好像它们只存在于当下。它们需要记住一秒钟前看到的东西,即使现在已经被遮挡了。
BeyondSight 表明,通过赋予机器人对隐藏物体的“记忆”,我们可以让它们在大多数现实危险所隐藏的盲区中做出更好的决策并避免事故。这是迈向让汽车不仅能“看见”世界,而且能真正“理解”世界的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。