想象一下你正在教一个机器人如何开车。长期以来,教机器人停车的唯一方法是给它一张完美的、预先绘制好的整个停车库地图,就像一张用墨水标出了每一个转弯和障碍物的藏宝图。如果已知这座建筑,这套方法效果很好,但如果你走进一个全新的、陌生的停车库,由于机器人没有地图,它就会陷入困境。这就是“自主代客泊车”(AVP)的世界,即汽车为乘客自动停车。但是,如果机器人可以仅仅通过“观察”周围环境、阅读标牌,并理解人类说“在电梯附近找个位子”这句话,而不需要任何地图呢?这就是“视觉-语言导航”(VLN)发挥作用的地方。把 VLN 想象成教机器人通过视觉(眼睛)和大脑处理语言的能力(大脑)来理解世界。研究人员提出的核心问题是:我们能否让一辆自动驾驶汽车变得足够聪明,仅通过聆听我们的指令并观察标牌,就能在从未见过的陌生地下停车场中进行导航?
本文介绍了一个名为 VLN-AVP 的新系统,旨在解决正是这样一个问题。作者提出了一个“零样本”(zero-shot)导航框架,这是一种高级说法,意指该系统在仅使用人类自然语言指令的情况下,就能处理从未见过的全新停车库。该系统并不依赖预建地图,而是使用了一个强大的“视觉-语言模型”(VLM)——可以把它想象成一个超级聪明的机器人大脑,它能通过看图片和读句子来弄清楚该做什么。然而,作者发现,仅仅给机器人一个聪明的头脑是不够的;它还需要一个更好的记忆力来避免产生混乱。
为了解决这个问题,团队构建了一个包含两个不同部分的混合记忆系统。首先是短期记忆,它充当机器人的即时“工作记忆”。由于聪明的脑部模型(VLM)观察世界的速度不够快,它可能会错过快速闪过的标牌。短期记忆会记录下近期看到的标牌和视觉线索,这样机器人就不会忘记三秒钟前刚刚看到过一个“出口”标志。其次是长期拓扑记忆,它就像机器人行驶过程中绘制的一张心理草图。每当机器人成功找到一条路径或一个地标(比如特定的电梯)时,它就会将此信息添加到这张草图中。如果机器人需要再次在同一个停车库中导航,它可以利用这张草图移动得更快、更高效,而不是每次都要求聪明的脑部模型从头开始思考。
研究人员通过两种方式测试了这个想法:一种是在高保真计算机模拟中,另一种是在真实的地下停车库中使用真实的汽车。他们创建了一个新的数据集 VLN-AVP,其中包含 10 个高质量的 3D 停车场景和超过 1,000 个导航片段(episodes),这是此类研究中有史以来规模最大的地下车库场景集合。
结果非常令人振奋。在模拟实验中,VLN-AVP 系统表现优异。它的成功率比其他视觉-语言导航方法高出超过 25%,比其他自动驾驶方法高出超过 15%。在真实车辆的实地测试中,该系统同样表现出色,能够成功执行复杂的指令,例如“在电梯厅附近找个位子”,甚至在人类对它说“不,那是错的电梯,继续开”时,它也能纠正自己的航向。这项研究表明,通过将聪明的语言大脑与巧妙的两部分记忆系统相结合,我们可以让自动泊车汽车变得更加灵活,且不再需要预先绘制的地图来完成任务。
技术摘要:VLN-AVP
问题陈述
自动代客泊车(AVP)系统目前面临着显著的可扩展性和灵活性限制。传统方法过度依赖预构建的高精(HD)或矢量化地图,这需要大量的采集数据和场景重建才能进行部署。这种依赖性将 AVP 系统限制在预定义任务中(例如,导航至特定的车位编号),并使其无法在未知环境中运行,也无法处理复杂的、开放词汇的自然语言指令(例如,“找一个靠近电梯的停车位”)。此外,现有的视觉语言导航(VLN)方法虽然具备零样本推理能力,但多是为开放环境中的移动机器人设计的,难以应对地下停车库中运动学约束严格且封闭、低速的特性。同样,视觉语言模型(VLM)在自动驾驶中的应用通常侧重于高速开放道路,或者需要极高的微调成本,导致其在无需先验地图的情况下,无法有效地泛化到非结构化的停车场景中。
方法论
作者提出了 VLN-AVP,这是一个零样本视觉语言导航框架,旨在消除对预构建地图的依赖,并实现通过自然语言进行直观导航。该系统通过一个包含四个核心组件的分层架构,将精确的空间感知与 VLM 的通用推理能力相结合:
BEV 感知与轨迹生成:
系统利用基于 Transformer 的鸟瞰图(BEV)感知模型 MapTR 来处理多视图摄像头输入,并高频生成道路结构(车道中心线)的矢量化表示。这些结构被输入到轨迹优化器中,结合 RS 曲线和车辆运动学,生成一组可行驶的候选轨迹,作为控制器的动作空间。
混合记忆系统:
为了解决 VLM 的局限性(低推理频率和单帧推理),作者引入了一个双重记忆架构:
- 短期记忆(STM): 一个高频队列,保留近期帧中的语义视觉线索(具体为通过 Grounding DINO 检测到的标志物)。它采用物体、方向和时间过滤器来维持一致且最新的环境上下文,以补偿 VLM 低推理率的问题,并防止瞬时视觉信息的丢失。
- 长期记忆(LTM): 一个从过去成功导航回合中学习的拓扑图。它由路口节点、地标节点(在停止动作时记录)以及代表轨迹的有向边组成。这种记忆使系统能够利用历史经验在相同环境中执行重复任务,从而减少对实时 VLM 推理的依赖。
基于 VLM 的高层决策:
一个大规模 VLM(具体为 Gemini-3-flash)充当决策核心。它接收一个复合提示词,包括当前的当前前视图像、短期记忆的内容、系统指令以及当前的导航子目标。VLM 推断高层元动作(例如,“前进”、“左转”、“右转”、“停止”)。
分层决策模块:
该模块将高层 VLM 决策与底层轨迹执行连接起来。它通过查询拓扑图来寻找通往目标的有效路径,从而在熟悉区域优先使用 LTM 以提高效率。如果不存在有效的 LTM 路径,则回退到 VLM 的缓存决策。该模块根据方向对齐情况选择最合适的候选轨迹,并通过底层控制器执行。
核心贡献
本文概述了四个主要贡献:
- VLN-AVP 框架: 一个用于 AVP 的零样本导航框架,无需预构建地图即可运行,能够理解语义环境上下文并遵循自然语言指令。
- 混合记忆架构: 一种结合了短期记忆(用近期视觉线索增强 VLM 决策)和长期拓扑记忆(通过从过去经验中学习来促进稳定的策略学习)的新颖系统,解决了单帧 VLM 推理的不稳定性问题。
- VLN-AVP 数据集与基准测试: 构建了迄今为止最大的地下停车数据集,包含通过 3D 高斯泼溅(3DGS)生成的 10 个高保真场景和超过 1,000 个导航回合。这是第一个专门为地下停车场景设计的 VLN 基准测试。
- 全面评估: 在高保真模拟和真实车辆部署中的广泛实验证明,该方法优于现有的 VLN 和自动驾驶基准方法。
实验结果
作者将 VLN-AVP 与代表性的 VLN 方法(MapGPT, ReasonNav)以及基于 VLM 的自动驾驶方法(LaMPilot, DiLu)进行了对比评估。
- 模拟性能: 在 VLN-AVP-Regular 子集中,所提方法实现了 65.2% 的成功率(SR),显著优于表现最好的基准方法(LaMPilot 为 49.7%)和传统的 VLN 方法(MapGPT 为 9.3%)。在更复杂的 VLN-AVP-Challenging 子集中,VLN-AVP 实现了 45.4% 的成功率,而 LaMPilot 为 33.6%。该方法在 Oracle 成功率(OSR)、路径长度加权成功率(SPL)方面也有提升,并降低了导航误差(NE)。
- 真实世界性能: 在配备 NVIDIA 2060 GPU 的真实车辆上部署后,该系统在地下停车库中实现了 63.3% 的成功率,优于 LaMPilot 基准(36.7%)。系统展示了根据用户反馈纠正错误的能力(例如,根据要求导航至不同的电梯大厅)。
- 消融实验: 在常规任务中,移除长期记忆(LTM)使成功率从 65.2% 下降到 56.8%,而同时移除两种记忆则使其降至 42.2%。此外,LTM 显著降低了计算成本,使 VLM API 调用次数减少了 75% 以上,并缩短了平均导航时间和每个回合的经济成本。
重要性与主张
本文声称 VLN-AVP 是使 AVP 系统更具适应性和智能性的重要一步。通过消除对预构建地图的依赖,该框架使 AVP 系统能够在先前未见的场景中运行,并处理复杂的、开放词汇的指令。作者强调,其混合记忆系统有效地弥合了 VLM 的通用推理能力与车辆在封闭空间内导航的特定运动学约束之间的差距。引入 VLN-AVP 数据集和基准测试解决了评估地下停车环境下 VLN 任务资源匮乏的关键问题,为该领域的未来研究奠定了基础。成功的真实世界部署验证了零样本、无图自主泊车的实际可行性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。