想象一下,一个机器人不是通过预先绘制的地图,而是通过聆听人类的声音来在房屋中导航。这就是视觉-语言导航(vision-language navigation)所面临的挑战——在这个领域,人工代理必须根据诸如“走过红色沙发并在窗户处左转”之类的口头指令,在真实或模拟的空间中移动。多年来,研究人员一直试图利用大型语言模型来教会机器这项技能,这些模型是能够理解人类语言和视觉场景的强大系统。然而,一个显著的障碍始终存在:这些系统通常需要海量的数据进行学习,并且在不变得缓慢且计算成本高昂的情况下,很难记住它们所看到的内容。它们往往要么会忘记旅途中的关键细节,要么会囤积过多的视觉信息,以至于无法足够快速地做出决策,从而无法在现实世界中发挥作用。
现在,一组研究人员推出了一种名为 LookStep 的新方法,旨在让这些导航任务变得更快、更具内存效率,并减少对庞大数据集的依赖。LookStep 不仅仅是根据当前的视野来猜测下一步的动作,而是被训练去预见未来。在它决定转向或停止之前,它会想象每一个可能动作的即时未来。它会问自己:“如果我现在左转,接下来的几秒钟场景会是什么样子?”以及“如果我继续直走,我会撞墙还是到达目标?”通过用自然语言生成这些未来场景,该模型学会了在做出决定之前评估其后果。这一过程使机器人能够更深入地理解路径,而无需记住它见过的每一帧视频。
LookStep 的第二个重大创新在于它如何处理记忆。传统的方法通常存储一段长且连续的过去图像流,这会迅速填满计算机的内存。LookStep 则采取了不同的方法,它更像是一个只记得旅途中重要时刻的人。随着机器人的移动,它会不断决定当前的视野是否值得保存。如果机器人只是走在一条长长的空旷走廊里,它可能会跳过保存该视图;但如果它到达了一个转折点、看到了指令中提到的特定地标,或者到达了目的地,它会将这一刻标记为关键时刻,并将其存储在一个小的滚动记忆库中。这种“事件驱动型”的记忆系统确保了机器人只保留最有用的信息,丢弃那些会拖慢其速度的冗余细节。
这种新方法的成果是惊人的。在标准导航基准测试中,LookStep 在未知环境中的成功率达到了 49.7%,超越了许多依赖更大数据集和更复杂硬件的现有系统。或许更重要的一点是,它在实现同样任务时使用的内存显著减少。当其他先进方法需要近 44 GB 的内存才能运行时,LookStep 用不到 20 GB 内存就完成了同样的工作。这种效率意味着这项技术最终可以在更小、更实惠的设备上运行,而不是需要庞大的服务器集群。研究人员还在一个具有复杂指令和视觉相似物体的真实办公环境中测试了该系统,它成功完成了高难度的导航任务,证明了其在模拟数据上的训练可以转化为物理现实。
通过将前瞻性策略与智能的选择性记忆系统相结合,LookStep 表明,机器人并不需要被数据淹没也能有效地进行导航。它们不需要记住所走的每一步,也不需要看到整个未来才能做出正确的决策。相反,通过专注于行动的即时后果并仅记住那些真正重要的地标,这些代理可以以一种高效且适应性强的水平在世界中移动,让我们离真正的智能具身机器又近了一步。
技术摘要:LookStep —— 具有语言预见性与事件驱动记忆的高效视觉-语言导航
问题陈述
视觉-语言导航(VLN)要求具身智能体通过遵循自然语言指令和视觉观测,在未见过的环境中进行导航。尽管最近的进展由多模态大语言模型(MLLMs)驱动,但现有方法在资源效率和数据利用方面面临显著局限:
- 数据利用率低下: 大多数方法遵循“下一跳动作预测”范式,仅对即时的专家动作进行监督。这需要大规模的专家数据进行训练,且无法充分利用轨迹信息。
- 高计算与内存开销: 为了维持导航状态,现有方法依赖于:
- 认知地图(Cognitive Maps): 将视觉场景转换为文本描述,这往往难以在缺乏海量数据的情况下保留空间关系和细粒度的视觉变化。
- 累积帧(Accumulated Frames): 存储历史视觉帧,这引入了巨大的计算开销,并可能保留冗余数据而遗漏关键事件。
- 外部工具: 依赖外部 3D 空间工具或几何建模模块,这增加了系统复杂性和 GPU 显存需求,阻碍了实际部署。
方法论:LookStep
作者提出了 LookStep,一个旨在实现资源高效型 VLN 的统一端到端框架。它由两个在单一 MLLM 架构(基于 Qwen3-VL 8B)内运行的互补模块组成:
1. 以语言为中心的未来状态建模 (LFS)
LFS 不直接预测下一个动作,而是将任务重新表述为未来状态建模与动作评估。
- 机制: 模型共同以自然语言形式预测三个组成部分:
- 粗粒度导航进度: 一个指示当前旅程阶段的标签(例如:
start、early、middle、late、near_goal)。
- 候选动作结果: 对于动作空间中的每个可能动作(
MOVE、TURN_LEFT、TURN_RIGHT、STOP),模型预测一个描述短期后果的语言标签(例如:finish_turn、wrong_turn、too_early、advance_to_goal)。
- 最终动作: 基于评估结果选定的动作。
- 训练: 训练目标是一个单一的结构化序列损失,它同时监督进度估计、未来状态想象和动作选择。这通过将隐式推理转化为显式的、受监督的中间信号,增强了数据利用率。
- 理论基础: 作者提供了一个基于信息论的动机,表明由专家推导出的未来状态标签包含与动作相关的有效信息(I(a∗;F∗∣X)≥0),与直接预测相比,这可以降低动作的不确定性。
2. 事件驱动的滚动记忆 (EDRM)
为了解决历史观测的冗余性以及保留关键事件的难度,EDRM 实现了一种主动的记忆选择机制。
- 机制: 在每一步中,模型自主决定:
- 记忆写入决策: 当前观测是否应被写入一个有界的滚动记忆中(
keep 或 drop)。
- 记忆角色: 观测的语义角色(例如:
turn_start、turn_end、stop_evidence、goal_approach)。
- 实现: 记忆通过先进先出(FIFO)队列实现。只有当观测构成导航关键事件(如地标、动作转换)时,才会被保留。这确保了模型在丢弃冗余帧的同时,能够保留对决策至关重要的历史信息,从而显著降低内存开销。
核心贡献
- LookStep 框架: 一个资源高效的 VLN 框架,它在预测最终动作之前,显式地对导航进度和候选动作的未来状态进行建模。它通过模型生成的记忆写入决策和语义角色,主动保留导航关键的历史观测。
- 理论动机: 通过专家级的理论分析,证明了由专家推导出的未来状态标签包含与动作选择相关的有效信息,从而为从直接动作模仿转向未来状态评估提供了理论依据。
- 实证验证: 在 VLN-CE 基准测试(R2R-CE 和 RxR-CE)上的广泛实验表明,该方法仅使用单目 RGB 观测即可达到极具竞争力的性能,无需外部空间工具或大规模额外数据。
实验结果
作者在 R2R-CE 和 RxR-CE 的 Val-Unseen 分割集上对 LookStep 进行了评估。
- 性能: 在 R2R-CE Val-Unseen 上,LookStep 实现了 49.7% 的成功率 (SR) 和 45.3% 的成功加权路径长度 (SPL)。在相同的训练设置(0K 额外数据)下,其表现优于 StreamVLN(使用 10M+ 额外数据达到 45.5% SR)和 NaVid。与当前最先进的方法 JanusVLN(52.8% SR, 4%,9.2% SPL)相比,LookStep 实现了极具竞争力的性能,且无需任何外部视觉空间建模工具(JanusVLN 依赖于 VGGT 等工具)。
- 内存效率: LookStep 展示了卓越的内存效率。其峰值 GPU 显存占用为 19.7 GB,而 JanusVLN 为 44.3 GB。每步推理时间为 59ms,显著快于 JanusVLN 的 194ms。
- 数据效率: 该模型仅在标准的 R2R-CE 和 RxR-CE 数据集上训练了一个 epoch,未使用额外的采集策略(如 DAgger)或外部数据源,却超越了依赖海量辅助数据集的方法。
- 现实世界泛化能力: 在使用机器人于复杂工作空间的现实世界实验中,LookStep 达到了 70% 的成功率,展示了从模拟训练数据到未见物理环境的强大泛化能力。
意义与主张
论文声称 LookStep 代表了 VLN 范式的转变——从重数据的模仿和重记忆的状态追踪转向语言预见性和事件驱动的记忆管理。
- 资源效率: 该框架在相似的训练约束下实现了具有竞争力的性能,同时显著降低了计算和内存开销,使其适用于边缘设备部署。
- 范式转变: 结果表明,VLN 的性能提升并不一定需要复杂的输入模态(如全景视图或深度信息)或外部空间工具。相反,通过更有效的导航范式,利用 MLLM 评估动作后果和选择性管理记忆的内在推理能力,可以获得性能提升。
- 局限性: 作者承认,由于资源限制,该方法尚未使用 DAgger 等高级训练范式进行增强,因此与大规模训练的方法相比仍存在性能差距。此外,与此类高级范式的兼容性仍有待探索。
总之,LookStep 证明了结合面向未来的动作评估与选择性的历史记忆,可以在无需承担当前最先进方法那样的沉重计算与数据负担的情况下,实现高效、高性能的视觉-语言导航。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。