想象一下,你正试图教一个机器人如何在它从未见过的房子里行走,而引导它的只有一句语音:“去厨房,在蓝色花瓶处左转,然后在冰箱旁停下。”这就是视觉-语言导航(Vision-and-Language Navigation, VLN)的世界。这是机器人技术和人工智能的一个分支,其中计算机智能体必须理解口头指令,并通过摄像头观察世界,以确定下一步该如何移动。棘手之处在于,机器人不能像在视频游戏中那样直接从一个点跳到另一个点;它必须在连续空间中采取真实的、循序渐进的行动。为了做好这一点,机器人需要两种超能力:长期记忆,用以记住它从哪里开始以及要去哪里(以免迷路);以及快速反应,用以对当前所见做出即时反应。如果机器人思考得太慢,它就会撞到墙;如果它忘记了过去,它就会原地打转。科学家们一直试图构建能够同时具备这两者的机器人,但通常情况下,它们必须在“聪明”与“快速”之间做出权衡。
于是有了 MemVLN,一种旨在让机器人“鱼与熊掌兼得”的新型机器人大脑。这项研究背后的研究人员意识到,目前的机器人之所以表现挣扎,是因为它们试图以同样的高质量去记住旅途中的每一个细节,这让它们的运行速度变得极其缓慢。MemVLN 通过模仿人类记忆的运作方式解决了这个问题。它将记忆分为两种特殊类型:情景记忆(Episodic Memory)和程序记忆(Procedural Memory)。可以将情景记忆想象成一本相册,其中最近的照片是高清的,而较旧的照片则被缩小成了微小的缩略图。这让机器人既能保持对当前位置的清晰认知,又能记住几小时前路径的大致轮廓,而不会被过多的数据所拖累。此外,还有程序记忆,它就像驾驶或打字时的肌肉记忆。与其让机器人停下来仔细地写下一句长长的指令,如“我现在将向左转并向前走”,不如使用一套由预设“动作标记(action tokens)”组成的快捷词汇。这使得它能够在一瞬间做出决策,跳过了通常会导致延迟的缓慢、分步思考过程。
该论文将 MemVLN 介绍为一个成功结合了这两种记忆风格的框架,使其能够在连续环境中以 14 FPS(每秒帧数)的速度进行导航。这与以往的方法相比是一个显著的速度飞跃,作者指出,以往的方法往往难以平衡长期的视觉历史需求与实时控制的需求。通过使用“金字塔分辨率”策略,其情景记忆会对即时视图进行 512 × 512 全分辨率处理,对短期视图进行 256 × 256 处理,对长期历史进行 128 × 128 的压缩处理。这确保了机器人在关注眼前事物的同时,也能保留一份过去的压缩摘要。对于其程序记忆,团队用一种“快速动作”机制取代了标准的、缓慢的动作生成方式(后者生成一个序列需要超过 300ms),该机制使用单个标记来代表一个复杂的动作,将时间缩短到了约 70ms。
在标准导航基准测试(特别是 R2R-CE 和 RxR-CE)上的测试结果表明,这种方法非常有效。作者发现,他们的模型 MemVLN-4B 在 R2R 数据集上的成功率比基准模型 Qwen3-VL-4B 架构高出 5.8%,在 RxR 数据集上高出 9.7%。或许最令人印象深刻的是,新系统实现了 7 倍 的推理延迟加速,使其能够实现实时运行。论文明确反对认为“标记合并(token merging)”(其他系统用于压缩数据的方法)是最佳解决方案的观点,指出这种方法会破坏进行高级定位所需的空间网格。相反,他们的金字塔分辨率在保持数据压缩的同时,保留了网格结构。作者还测试了记忆金字塔的不同“形状”,并发现“上升式”设计(即给予最近视图最高分辨率的设计)效果最好。虽然该模型仅依赖于标准的 RGB 视频(就像人类眼睛一样)和自然语言,没有使用深度摄像头等额外传感器,但这表明智能记忆系统可以补偿视觉数据的局限性。研究证实,通过平衡高保真的近期观测与压缩的历史记录,并使用快速动作词汇,机器人可以比以往更高效、更快速地在复杂的未知空间中进行导航。
技术摘要:MemVLN —— 用于视觉-语言导航的陈述性记忆与程序性记忆
问题陈述
连续环境中的视觉-语言导航(VLN-CE)要求具身智能体根据自然语言指令和自我中心 RGB 观测值在未见的 3D 空间中进行导航,且不依赖先验地图或深度、里程计等辅助传感器。其核心挑战在于如何同时满足两个相互冲突的需求:
- 长程一致性(Long-Horizon Consistency): 智能体必须维持长期的视觉历史,以确保轨迹的一致性,并防止在长路径中产生漂移。
- 实时延迟(Real-Time Latency): 智能体必须以极低的延迟(高 FPS)执行底层动作,以便在连续、动态的环境中有效运行。
现有方法难以平衡这两点。基于视频的方法通常通过采样固定的稀疏帧来牺牲时间密度;而其他方法则通过池化或合并来压缩视觉 Token,但这会牺牲空间细节,并与先进的位置编码(如 M-RoPE)及现代 Transformer 架构相冲突。此外,大型视觉语言模型(LVLM)的自回归特性引入了显著的推理延迟,使得实时控制变得困难。
方法论:MemVLN 框架
MemVLN 是一种新型 VLN 框架,旨在通过模仿人类记忆系统,将长形式视频上下文与实时响应能力结合起来。它集成了一个用于处理连续观测的视觉编码器,以及一个用于理解指令和生成动作的语言大模型(LLM)。该架构依赖于两个核心的仿生机制:
1. 具有金字塔分辨率的陈述性记忆(Episodic Memory)
为了高效管理广泛的视觉历史,MemVLN 采用了金字塔分辨率策略,而非统一采样或 Token 合并。
- 机制: 历史观测被分为三个时间层级:即时、短期和长期。
- 即时帧(最近的帧)以高分辨率处理,以捕捉精确的局部线索。
- 短期和长期帧则进行渐进式下采样(空间压缩),以保留全局路径一致性,同时最小化 Token 数量。
- 原理: 注意力分析表明,近期的观测在模型关注度中占据主导地位,而远处的历史虽然提供了必要的上下文,但对感知精度的要求较低。
- 优势: 与破坏统一 2D 空间网格并与 M-RoPE 等位置编码冲突的 Token 合并不同,金字塔分辨率在 Token 化之前在原始像素空间进行下采样。这保持了严格的空间拓扑结构,确保了与现代 LVLM 后端(如 Qwen3-VL)和 DeepStack 的兼容性。
2. 用于快速动作的程序性记忆(Procedural Memory)
为了克服自回归解码带来的延迟瓶颈,MemVLN 引入了一种受程序性记忆启发的快速动作机制。
- 机制: 模型不再逐个 Token 生成动作序列(例如,“向左转 30 度”),而是将连续控制信号映射到一组紧凑的原子中层动作 Token。
- 实现: 这些增强动作(例如,
<a1> 代表“前进”,<a2> 代表“左转”)是 LLM 词表中的单个 Token。
- 益处: 这使得模型能够通过单次前向传播(一次性解码)预测复杂的导航决策,从而绕过了通常会导致延迟的迭代解码循环。
核心贡献
- MemVLN 架构: 一种新型 VLN 模型,能够有效利用长形式视觉观测,同时将推理速度提升至 14 FPS。
- 仿生记忆机制:
- 陈述性记忆: 一种金字塔分辨率策略,平衡了高保真局部导航与压缩的全局历史,在不增加 Token 预算的情况下优化了观测管理。
- 程序性记忆: 一个使用单 Token 词表的快速动作模块,通过绕过自回归解码来降低推理延迟。
- 最先进的性能(SOTA): 在标准 VLN-CE 基准测试(R2R 和 RxR)上进行了验证,仅使用单目 RGB 输入,证明了卓越的泛化能力可以补偿缺乏深度或全景传感器的不足。
实验结果
作者在 R2R-CE 和 RxR-CE 基准测试(Val-Unseen 分组)上使用 Qwen3-VL 后端对 MemVLN 进行了评估。
- 性能:
- MemVLN-8B 在 R2R 上实现了 65.3% 的 Oracle 成功率 (OS) 和 58.4% 的成功率 (SR),在 RxR 上实现了 66.0% 的成功率 (SR) 和 57.3% 的路径长度加权成功率 (SPL),达到了最先进水平。
- MemVLM-4B 在 R2R 上比基线 Qwen3-VL-4B 高出 5.8% SR,在 RxR 上高出 9.7% SR。
- 尽管仅使用单视图 RGB 输入,该模型仍优于现有的基于路标(waypoint-based)和连续控制的方法,以及其他基于 VLM 的方法(如 NaVILA, Uni-NaVid, StreamVLN)。
- 效率:
- 程序性记忆机制相比标准的自回归解码实现了 7 倍的推理延迟加速,将吞吐量从 2 FPS 提升至 14 FPS。
- 消融研究证实,快速动作模块在大幅降低延迟的同时,将 R2R 的 SR 提高了 1.8%,将 RxR 的 SR 提高了 2.1%。
- 消融洞察:
- 金字塔分辨率: “上升式”(Ascending)配置(优先考虑高分辨率的近期帧)表现最佳,与非金字塔基线相比,使 R2R 的 SR 提高了 1.2%,SPL 提高了 1.9%。
- 训练数据: 性能随数据量增加而提升。包含 DAgger 生成的合成数据显著提高了 OS 和 SR,突显了交互式、在策略(on-policy)数据的价值。
重要性与主张
本文声称 MemVLN 为在连续环境中部署 VLN 模型建立了一条可扩展且稳健的路径。通过金字塔分辨率将长程上下文的需求与计算成本解耦,并通过程序性记忆消除自回归延迟,MemVLN 证明了仅使用单目 RGB 输入和标准 LVLM 后端,即可实现实时、高性能的导航。这项工作表明,未来的具身智能体可以依赖统一的视觉-语言框架,这种框架既能保持时间一致性,又能实现快速反应,且无需专门的传感器或复杂的模块化流水线。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。