← 最新论文
💻 computer science

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM 是一种扩散 Transformer 策略,它将未来视觉预测、目标进度值估计和动作生成统一到一个共享的潜序列中,使机器人能够直接执行闭环导航,而不依赖于外部规划器或动作搜索。

原作者: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人寻找房子里的特定房间,但这个机器人只能看到它“眼睛”(摄像头)正前方的视野。它没有地图,也看不见转角后的情况。这就是**目标导向视觉导航(goal-conditioned visual navigation)**所面临的挑战。

这里是作者 Daichi Azuma 及其团队如何通过一个名为 NavWAM 的新系统来解决这一问题的故事。

问题所在:“水晶球” vs. “驾驶员”

在过去,研究人员尝试使用两种独立的工具来教机器人进行导航:

  1. 水晶球(世界模型/World Model): 这个工具擅长猜测机器人向前移动时会看到什么。“如果我向左转,我会看到厨房。”“如果我直走,我会撞墙。”
  2. 驾驶员(规划器/Planner): 这个工具观察“水晶球”的预测,然后决定:“好吧,厨房看起来不错,那我就向左转。”

缺陷: 论文指出,将这两者分开是非常低效的。这就像有一个乘客在旁边大喊方向(“向左转!”),而驾驶员不得不停下来、思考,然后再转向。这造成了一个瓶颈。“水晶球”预测了未来,但它并不知道如何通过驾驶汽车来抵达那里。

解决方案:NavWAM(“驾驶员-预测器”)

作者创建了 NavWAM(导航世界动作模型/Navigation World Action Model)。把 NavWAM 想象成一个既能预见未来,又是超级驾驶员的个体。

NavWAM 不再将“水晶球”和“驾驶员”分开,而是将它们合并为一个大脑。它不仅能猜出自己会看到什么,还能同时猜出:它会看到什么、距离目标有多近,以及究竟要给出什么样的转向指令——这一切都是同步进行的。

创意类比:“共享画布”

为了理解 NavWAM 的工作原理,请想象一位画家正在一张由九个不同面板组成的单张画布上作画:

  • 底部的面板(已知信息): 展示机器人的当前视角、它现在的位置,以及目标的图片(例如,一张特定椅子的照片)。
  • 顶部的面板(预测信息): 机器人通过绘制这些面板来展示:
    1. 机器人未来会看到的景象。
    2. 它距离目标的距离。
    3. 最关键的部分: 实现这一目标所需的实际转向指令(“动作块/action chunk”)。

机器人通过对这张画布进行“去噪(denoising)”来学习。它从一个模糊、混乱的未来版本开始,不断清理,直到得到一张清晰的路径图、目的地以及需要采取的步骤。因为“转向指令”是与“未来视图”绘制在同一张画布上的,所以机器人学会了:为了看到目标,它必须采取这些特定的动作。

它如何击败竞争对手

论文将 NavWAM 与另外两种类型的机器人进行了对比测试:

  1. 旧方法(NWM): 这种机器人先预测未来,然后使用复杂的、缓慢的数学搜索(称为 CEM)来确定采取哪种行动。这就像一个棋手在走一步棋之前要计算 100 步。
  2. 直接法(OmniVLA): 这种机器人只是看着目标并猜测下一步动作,而不去思考未来。这就像一个只顾着应对路况而从不看前方的司机。

结果:

  • NavWAM vs. 旧方法: NavWAM 速度更快且更准确,因为它不需要停下来进行复杂的搜索计算。它只需“知道”该怎么做。在现实世界测试中,它的成功率达到了 79%,而旧方法仅为 16%。
  • NavWAM vs. 直接法: NavWAM 的表现与直接法(后者使用更强大、更复杂的计算机大脑)不相上下,但 NavWAM 还拥有预测未来的额外超能力。

现实世界测试

团队不仅在计算机模拟中测试,还将 NavWAM 安装在一个名为 Diablo 的真实机器人上,并将其送入四个不同的室内环境(办公室、储藏室、会议室和走廊)。

  • 目标: 找到该房间内拍摄的一张特定图像。
  • 结果: NavWAM 在 24 次尝试中成功导航到了目标位置 19 次。
  • “预见性”检查: 尽管 NavWAM 并不需要依赖其未来预测来移动(它直接使用转向指令即可),但论文显示其预测非常准确。当机器人预测“我在 4 秒后会看到一扇门”时,它在 4 秒后确实看到了门。

核心总结

论文得出结论:对于机器人而言,要实现良好的导航,它不应该仅仅是一个“预测器”或仅仅是一个“驾驶员”。它必须两者兼具。通过在单一步骤中同时学习预测未来以及创造该未来所需的动作,机器人变得更加出色,即使是在从未去过的环境中也能找到路。

简而言之:NavWAM 教会了机器人“边看前方边开车”,而不是“看前方、停下、计算、然后再开车”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →