← 最新论文
💻 computer science

LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory

LookStep 是一个高效的端到端视觉-语言导航框架,它利用以语言为中心的未来状态建模和事件驱动的滚动记忆,在减少数据和计算需求的同时,实现了比现有方法更优越的性能。

原作者: Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人不是通过预先绘制的地图,而是通过聆听人类的声音来在房屋中导航。这就是视觉-语言导航(vision-language navigation)所面临的挑战——在这个领域,人工代理必须根据诸如“走过红色沙发并在窗户处左转”之类的口头指令,在真实或模拟的空间中移动。多年来,研究人员一直试图利用大型语言模型来教会机器这项技能,这些模型是能够理解人类语言和视觉场景的强大系统。然而,一个显著的障碍始终存在:这些系统通常需要海量的数据进行学习,并且在不变得缓慢且计算成本高昂的情况下,很难记住它们所看到的内容。它们往往要么会忘记旅途中的关键细节,要么会囤积过多的视觉信息,以至于无法足够快速地做出决策,从而无法在现实世界中发挥作用。

现在,一组研究人员推出了一种名为 LookStep 的新方法,旨在让这些导航任务变得更快、更具内存效率,并减少对庞大数据集的依赖。LookStep 不仅仅是根据当前的视野来猜测下一步的动作,而是被训练去预见未来。在它决定转向或停止之前,它会想象每一个可能动作的即时未来。它会问自己:“如果我现在左转,接下来的几秒钟场景会是什么样子?”以及“如果我继续直走,我会撞墙还是到达目标?”通过用自然语言生成这些未来场景,该模型学会了在做出决定之前评估其后果。这一过程使机器人能够更深入地理解路径,而无需记住它见过的每一帧视频。

LookStep 的第二个重大创新在于它如何处理记忆。传统的方法通常存储一段长且连续的过去图像流,这会迅速填满计算机的内存。LookStep 则采取了不同的方法,它更像是一个只记得旅途中重要时刻的人。随着机器人的移动,它会不断决定当前的视野是否值得保存。如果机器人只是走在一条长长的空旷走廊里,它可能会跳过保存该视图;但如果它到达了一个转折点、看到了指令中提到的特定地标,或者到达了目的地,它会将这一刻标记为关键时刻,并将其存储在一个小的滚动记忆库中。这种“事件驱动型”的记忆系统确保了机器人只保留最有用的信息,丢弃那些会拖慢其速度的冗余细节。

这种新方法的成果是惊人的。在标准导航基准测试中,LookStep 在未知环境中的成功率达到了 49.7%,超越了许多依赖更大数据集和更复杂硬件的现有系统。或许更重要的一点是,它在实现同样任务时使用的内存显著减少。当其他先进方法需要近 44 GB 的内存才能运行时,LookStep 用不到 20 GB 内存就完成了同样的工作。这种效率意味着这项技术最终可以在更小、更实惠的设备上运行,而不是需要庞大的服务器集群。研究人员还在一个具有复杂指令和视觉相似物体的真实办公环境中测试了该系统,它成功完成了高难度的导航任务,证明了其在模拟数据上的训练可以转化为物理现实。

通过将前瞻性策略与智能的选择性记忆系统相结合,LookStep 表明,机器人并不需要被数据淹没也能有效地进行导航。它们不需要记住所走的每一步,也不需要看到整个未来才能做出正确的决策。相反,通过专注于行动的即时后果并仅记住那些真正重要的地标,这些代理可以以一种高效且适应性强的水平在世界中移动,让我们离真正的智能具身机器又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →