← 最新论文
💻 computer science

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

该论文提出了 VLN-AVP,一种用于自主代客泊车的零样本导航框架,该框架结合了鸟瞰图感知、视觉语言模型以及混合记忆系统,旨在消除对地图的依赖,理解自然语言指令,并在模拟及真实的地下停车环境中实现卓越的性能。

原作者: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人如何开车。长期以来,教机器人停车的唯一方法是给它一张完美的、预先绘制好的整个停车库地图,就像一张用墨水标出了每一个转弯和障碍物的藏宝图。如果已知这座建筑,这套方法效果很好,但如果你走进一个全新的、陌生的停车库,由于机器人没有地图,它就会陷入困境。这就是“自主代客泊车”(AVP)的世界,即汽车为乘客自动停车。但是,如果机器人可以仅仅通过“观察”周围环境、阅读标牌,并理解人类说“在电梯附近找个位子”这句话,而不需要任何地图呢?这就是“视觉-语言导航”(VLN)发挥作用的地方。把 VLN 想象成教机器人通过视觉(眼睛)和大脑处理语言的能力(大脑)来理解世界。研究人员提出的核心问题是:我们能否让一辆自动驾驶汽车变得足够聪明,仅通过聆听我们的指令并观察标牌,就能在从未见过的陌生地下停车场中进行导航?

本文介绍了一个名为 VLN-AVP 的新系统,旨在解决正是这样一个问题。作者提出了一个“零样本”(zero-shot)导航框架,这是一种高级说法,意指该系统在仅使用人类自然语言指令的情况下,就能处理从未见过的全新停车库。该系统并不依赖预建地图,而是使用了一个强大的“视觉-语言模型”(VLM)——可以把它想象成一个超级聪明的机器人大脑,它能通过看图片和读句子来弄清楚该做什么。然而,作者发现,仅仅给机器人一个聪明的头脑是不够的;它还需要一个更好的记忆力来避免产生混乱。

为了解决这个问题,团队构建了一个包含两个不同部分的混合记忆系统。首先是短期记忆,它充当机器人的即时“工作记忆”。由于聪明的脑部模型(VLM)观察世界的速度不够快,它可能会错过快速闪过的标牌。短期记忆会记录下近期看到的标牌和视觉线索,这样机器人就不会忘记三秒钟前刚刚看到过一个“出口”标志。其次是长期拓扑记忆,它就像机器人行驶过程中绘制的一张心理草图。每当机器人成功找到一条路径或一个地标(比如特定的电梯)时,它就会将此信息添加到这张草图中。如果机器人需要再次在同一个停车库中导航,它可以利用这张草图移动得更快、更高效,而不是每次都要求聪明的脑部模型从头开始思考。

研究人员通过两种方式测试了这个想法:一种是在高保真计算机模拟中,另一种是在真实的地下停车库中使用真实的汽车。他们创建了一个新的数据集 VLN-AVP,其中包含 10 个高质量的 3D 停车场景和超过 1,000 个导航片段(episodes),这是此类研究中有史以来规模最大的地下车库场景集合。

结果非常令人振奋。在模拟实验中,VLN-AVP 系统表现优异。它的成功率比其他视觉-语言导航方法高出超过 25%,比其他自动驾驶方法高出超过 15%。在真实车辆的实地测试中,该系统同样表现出色,能够成功执行复杂的指令,例如“在电梯厅附近找个位子”,甚至在人类对它说“不,那是错的电梯,继续开”时,它也能纠正自己的航向。这项研究表明,通过将聪明的语言大脑与巧妙的两部分记忆系统相结合,我们可以让自动泊车汽车变得更加灵活,且不再需要预先绘制的地图来完成任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →