← 最新论文
💻 computer science

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN 是一个实时视觉-语言导航框架,它通过集成用于高效长程历史保留的金字塔式情景记忆,以及通过使用原子级中层动作来绕过自回归解码延迟的程序化记忆,实现了最先进的性能和 14 FPS 的推理速度。

原作者: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何在它从未见过的房子里行走,而引导它的只有一句语音:“去厨房,在蓝色花瓶处左转,然后在冰箱旁停下。”这就是视觉-语言导航(Vision-and-Language Navigation, VLN)的世界。这是机器人技术和人工智能的一个分支,其中计算机智能体必须理解口头指令,并通过摄像头观察世界,以确定下一步该如何移动。棘手之处在于,机器人不能像在视频游戏中那样直接从一个点跳到另一个点;它必须在连续空间中采取真实的、循序渐进的行动。为了做好这一点,机器人需要两种超能力:长期记忆,用以记住它从哪里开始以及要去哪里(以免迷路);以及快速反应,用以对当前所见做出即时反应。如果机器人思考得太慢,它就会撞到墙;如果它忘记了过去,它就会原地打转。科学家们一直试图构建能够同时具备这两者的机器人,但通常情况下,它们必须在“聪明”与“快速”之间做出权衡。

于是有了 MemVLN,一种旨在让机器人“鱼与熊掌兼得”的新型机器人大脑。这项研究背后的研究人员意识到,目前的机器人之所以表现挣扎,是因为它们试图以同样的高质量去记住旅途中的每一个细节,这让它们的运行速度变得极其缓慢。MemVLN 通过模仿人类记忆的运作方式解决了这个问题。它将记忆分为两种特殊类型:情景记忆(Episodic Memory)程序记忆(Procedural Memory)。可以将情景记忆想象成一本相册,其中最近的照片是高清的,而较旧的照片则被缩小成了微小的缩略图。这让机器人既能保持对当前位置的清晰认知,又能记住几小时前路径的大致轮廓,而不会被过多的数据所拖累。此外,还有程序记忆,它就像驾驶或打字时的肌肉记忆。与其让机器人停下来仔细地写下一句长长的指令,如“我现在将向左转并向前走”,不如使用一套由预设“动作标记(action tokens)”组成的快捷词汇。这使得它能够在一瞬间做出决策,跳过了通常会导致延迟的缓慢、分步思考过程。

该论文将 MemVLN 介绍为一个成功结合了这两种记忆风格的框架,使其能够在连续环境中以 14 FPS(每秒帧数)的速度进行导航。这与以往的方法相比是一个显著的速度飞跃,作者指出,以往的方法往往难以平衡长期的视觉历史需求与实时控制的需求。通过使用“金字塔分辨率”策略,其情景记忆会对即时视图进行 512 × 512 全分辨率处理,对短期视图进行 256 × 256 处理,对长期历史进行 128 × 128 的压缩处理。这确保了机器人在关注眼前事物的同时,也能保留一份过去的压缩摘要。对于其程序记忆,团队用一种“快速动作”机制取代了标准的、缓慢的动作生成方式(后者生成一个序列需要超过 300ms),该机制使用单个标记来代表一个复杂的动作,将时间缩短到了约 70ms

在标准导航基准测试(特别是 R2R-CERxR-CE)上的测试结果表明,这种方法非常有效。作者发现,他们的模型 MemVLN-4B 在 R2R 数据集上的成功率比基准模型 Qwen3-VL-4B 架构高出 5.8%,在 RxR 数据集上高出 9.7%。或许最令人印象深刻的是,新系统实现了 7 倍 的推理延迟加速,使其能够实现实时运行。论文明确反对认为“标记合并(token merging)”(其他系统用于压缩数据的方法)是最佳解决方案的观点,指出这种方法会破坏进行高级定位所需的空间网格。相反,他们的金字塔分辨率在保持数据压缩的同时,保留了网格结构。作者还测试了记忆金字塔的不同“形状”,并发现“上升式”设计(即给予最近视图最高分辨率的设计)效果最好。虽然该模型仅依赖于标准的 RGB 视频(就像人类眼睛一样)和自然语言,没有使用深度摄像头等额外传感器,但这表明智能记忆系统可以补偿视觉数据的局限性。研究证实,通过平衡高保真的近期观测与压缩的历史记录,并使用快速动作词汇,机器人可以比以往更高效、更快速地在复杂的未知空间中进行导航。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →