GeoWAM: Visual Geometry World Action Models for Autonomous Driving
本文介绍了 GeoWAM,这是一种用于自动驾驶的世界动作模型,它通过使用点云进行未来几何预测来取代基于像素的未来预测,从而更好地捕捉空间结构与运动,使得相比于基于图像的替代方案,其驾驶策略显著增强。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
自动驾驶从本质上讲是一场关于预判的游戏。为了安全导航,车辆不仅要能看到前方的道路,还必须理解这条路及其上的物体在未来几秒钟内会如何变化。它需要预测行人可能在哪里跨步,前方的汽车会如何减速,以及自身的路径将如何在环境中发生偏移。多年来,研究人员一直试图通过向计算机展示无穷无尽的视频流来教会它们这项技能,希望机器能学会猜测电影的下一帧。这些被称为“世界模型”的系统非常强大,因为它们可以模拟未来,但它们往往面临一个特定的缺陷:它们将世界视为一张平面的图像。它们关注颜色、纹理和光影,而这些因素可能会掩盖物体的真实三维形状和运动。当计算机试图仅根据变化的像素来判断一辆车是如何转弯时,这就像是通过观察投射在墙上的影子来理解时钟的机械原理一样;信息虽然存在,但它是间接的,且难以理清。
来自 Uber AV Labs 和凯斯西储大学(Case Western Reserve University)的一个研究小组提出了一种不同的方法,这种方法跳过了平面图像,直接观察世界的形状。他们引入了一个名为 GeoWAM 的新系统,该系统不将驾驶环境视为一段待预测的视频,而是将其视为一组随时间移动和变化的 3D 点集。该系统并非试图生成一段具有真实感的街道未来图像,而是被训练去预测那条街道的未来几何结构——即每一处路缘、树木或车辆在三维空间中的精确位置。通过专注于这种空间结构,研究人员发现他们可以让自动驾驶车辆对世界的演变产生更清晰的理解。他们的工作表明,当驾驶代理学习预测未来的物理形状而非其视觉外观时,它在规划安全且平滑的轨迹方面会变得显著更好。
这种新方法的核心理念是,像素是描述运动的一种拙劣语言。标准的视频世界模型学习预测光影和色彩在时刻之间如何变化。虽然这可以产生视觉上令人信服的结果,但底层的物理运动——例如车轮的实际旋转或汽车在空间中的位移——仍然隐藏在这些变化的色彩之中。新系统 GeoWAM 通过直接处理点云,绕过了这种困惑。想象一张由数百万个微小点组成的 3D 地图,每个点代表汽车、建筑物或道路上的一个特定位置。该系统获取车辆摄像机捕捉的一系列过去视角,并学习预测这些点在未来的位置。它并不关心汽车是红色的还是阳光灿烂,它只关心汽车在哪里以及如何通过空间移动。这种直接的表示方式与驾驶任务完美契合,因为驾驶从根本上说是关于在三维世界中进行导航的任务。
为了构建这种能力,研究人员将系统分为两个不同的阶段进行训练。首先,他们教模型成为一名“几何学家”。利用来自多个摄像机的海量驾驶数据,系统学习观察一段过去的场景序列,并准确预测未来几秒钟内该场景的 3D 结构。它不需要重建天空的外观或沥青的纹理,而只需绘制出物体的位置图。一旦系统掌握了这种预测未来形状的能力,研究人员便加入了第二个阶段:动作规划器。这个新组件接收预测的 3D 地图,并提出一个简单的问题:鉴于世界将如何变化,汽车下一步应该做什么?由于该系统已经在以 3D 运动的方式进行思考,答案自然而然地产生了。它直接从不断演变的几何结构中推导出汽车未来的运动,从而创造出一个基于道路物理现实而非视频视觉模式的规划。
这种方法的测试是在标准驾驶基准上进行的严格验证。当被要求预测场景的未来形状时,这个新系统表现优于以往依赖视频生成的模型。即使在时间跨度延长的情形下,它在将物体准确放置在正确 3D 空间方面的表现也更为精准。更重要的是,当这种几何预见力被用于在模拟环境中控制车辆时,驾驶性能得到了显著提升。在开放回路测试(即系统在不与环境交互的情况下规划路径)和闭环测试(即系统必须实时对自身错误做出反应)中,GeoWAM 生成的轨迹始终比基于图像的对应系统更安全、更可靠。该系统在复杂场景中展现出了特别的优势,例如在狭窄转弯或避障时,理解真实的物理布局至关重要。
研究人员认为,从视觉预测向几何预测的转变,代表了机器学习驾驶的一种更自然的方式。通过消除外观的干扰并专注于结构,系统能更直接地学习运动规则。它不需要猜测光线如何在湿润的道路上反射以得知汽车正在侧滑;它只需看到汽车的位置正以一种指示侧滑的方式在改变。这种清晰度使车辆能够做出稳健且一致的决策。这项研究证实,尽管视频生成是许多任务的强大工具,但它并不是自动驾驶的理想基础。相反,一个将世界理解为动态三维结构的模型,能更好地在现实世界中导航,为开发真正的自动驾驶汽车提供了一条充满前景的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。