← 最新论文
💻 computer science

Geo-VLA: Geometry-Aware Vision-Language-Action Planning via Internalization of Map Semantics

本文介绍了 Geo-VLA,这是一个通过一个新的名为 Geo-QA 的数据集来内化道路几何结构的即插即用框架,旨在增强视觉-语言-动作模型在自动驾驶中的表现,并在无需在推理过程中使用高精地图的情况下,在 NAVSIM v1 上实现了最先进的性能。

原作者: Ran Chen, Jiaxing Ren, Zhikun Zhang, Yunhao Hou, Junbao Zhuo, Bochao Zou

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ran Chen, Jiaxing Ren, Zhikun Zhang, Yunhao Hou, Junbao Zhuo, Bochao Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

驾驶汽车不仅仅需要看到前方的道路,还需要理解支配运动的无形规则。车辆必须知道车道在哪里结束,曲线将如何弯曲,以及不同的道路在交叉路口是如何连接的。几十年来,工程师们一直试图通过向计算机展示摄像头画面来教它们驾驶,但摄像头只能捕捉到瞬间可见的事物。它们难以理解道路的永久结构,例如一条车道绕过弯道时的精确路径,或是复杂路口的特定规则。这种“看见世界”与“理解其几何结构”之间的差距,阻碍了全自动驾驶在复杂环境中成为可靠的现实。研究人员现在正转向一种结合了视觉与语言的新方法,利用能够“阅读”并“推理”图像的大型模型来做出驾驶决策。然而,即使是这些先进系统,在遇到急转弯或复杂的交叉路口时也经常失败,因为它们过度依赖道路的视觉外观,而非其底层的形状和连通性。

来自北京理工大学的一个研究小组开发了一种名为 Geo-VLA 的新方法来解决这一特定问题。他们的目标是教会这些驾驶模型理解道路的几何结构,而不必强迫它们携带沉重、预制的数字地图(这类地图需要不断的更新和复杂的硬件来读取)。研究人员并没有在汽车行驶时给它一张地图去观察,而是通过训练阶段让汽车将地图“内化”。他们创建了一个名为 Geo-QA 的特殊数据集,该数据集将驾驶摄像机图像与源自离线地图数据的问答对结合在一起。这些问题侧重于道路的静态结构,例如询问车道如何弯曲或可行驶区域在哪里结束。通过训练模型回答这些问题,系统学会了像阅读地图一样识别道路的形状和连接,尽管在实际驾驶过程中它只通过摄像头观察。

这个过程分为两个截然不同的阶段。首先,模型接触数以千计的“图像-问题-答案”对。它学习将道路场景的视觉细节与地图数据中发现的精确几何事实联系起来。这一步就像是一堂关于道路结构的深度课程,允许模型建立起关于道路布局的心理表征。一旦这种学习完成,研究人员就会锁定这种新的理解,并利用它来教模型如何控制方向。至关重要的是,当汽车在道路上接受测试时,它不需要任何地图数据、不需要额外的传感器,也不需要复杂的软件来查找道路信息。它只需像以前一样通过前视摄像头观察即可,但现在的内部推理是由其在训练期间吸收的几何知识所引导的。这意味着该系统保持了简单和快速,避免了实时将实时视频与数字地图进行匹配时产生的延迟和错误。

这种方法的成果在名为 NAVSIM v1 的标准驾驶模拟平台上进行了测试。研究人员将他们的新方法与依赖高精地图或其他复杂输入的现有系统进行了对比。Geo-VLA 系统表现始终优于其前身,在一个衡量安全性、舒适性和进度综合指标上取得了 92.1 的得分。这一得分代表了单摄像头驾驶规划器的新高点,以微小但显著的幅度超越了以往的记录。该系统在处理转弯和交叉路口时表现得尤为有效,而旧模型在这些场景下往往会偏离航线或无法遵循正确的路径。通过通过语言和问题而非原始地图数据来学习道路规则,该模型生成的轨迹更贴近预定车道,并尊重道路的物理边界。

研究还表明,教导模型关于静态道路结构的内容,比教导它关于移动物体(如其他车辆或行人)的内容要重要得多。当研究人员测试一个仅关注动态元素的系统版本时,性能并未得到提升。这表明,虽然模型已经能很好地观察移动物体,但如果没有特定的引导,它很难理解固定的道路几何结构。Geo-VLA 方法通过在训练期间提供这种引导填补了这一空白,使系统能够做出更安全、更高效的决策。研究人员指出,他们的方法依赖于用于创建训练问题的地图数据的质量,未来的工作需要测试该系统在与其他人类驾驶员进行的交互式交通中的表现。然而就目前而言,这项研究证明了汽车可以通过对话和问题来学习道路的形状,并将这些知识作为一种无声、无形的向导随身携带。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →