← 最新论文
💻 computer science

VISTA: Scale-Aware Visual Navigation via Action History Conditioning

VISTA 是一个基于视觉的导航基础模型,它通过以归一化的动作历史为条件来解决缩放漏洞,并利用 DINOv3 编码器增强几何理解,从而在多样且具有视觉重复性的环境中提升零样本泛化能力与安全性。

原作者: Maeva Guerrier, Koki Kobayashi, Simon Roy, Jana Pavlasek, Giovanni Beltrame

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Maeva Guerrier, Koki Kobayashi, Simon Roy, Jana Pavlasek, Giovanni Beltrame

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在森林、办公室或开阔的田野中行走,而从未给它看过任何地图,也没有针对那个特定环境给出具体的指令。你希望机器人通过观看其他机器人行走的视频来学习,从而学会如何自主从“起点”到达“终点”。这就是论文中所说的视觉导航(Visual Navigation)

研究人员构建了一个名为 VISTA(基于动作历史调节的尺度感知视觉导航)的新系统。以下是它的工作原理,我们使用简单的类比来解释:

问题所在:“缩放比例”带来的困惑

大多数目前的机器人导航模型就像那些只能学会在纸上画地图,却从未学过这张纸实际有多大的学生。

  • 问题: 这些模型将路径预测为一系列微小的、归一化的步骤(比如说“向前走10步”)。但在现实世界中,玩具机器人的“一步”与巨型卡车的“一步”是完全不同的。
  • 故障: 如果你告诉机器人“向前走10步”,但没有告诉它每一步有多长,它可能会猜错。如果它猜的一步太长,它可能会撞到墙;如果猜得太短,它可能会迷路。论文称之为尺度脆弱性(scale vulnerability)。机器人看到了画面,但它不知道自己所处世界的尺寸

解决方案:VISTA 的两大超能力

为了解决这个问题,作者赋予了 VISTA 两个特殊的工具:

1. “步伐的记忆”(动作历史调节)

想象你正在走过一段走廊。如果你只盯着前方的墙壁看,你不知道自己走得快还是慢。但如果你记得,“我在过去一秒钟内走了三步”,你就能判断出自己的移动速度。

  • VISTA 的做法: VISTA 不仅仅观察当前的摄像机图像,它还会回顾自身过去的动作历史。它会记得:“我刚刚移动了一个归一化距离 X。”
  • 结果: 通过将过去的动作与现在的观察进行对比,机器人可以计算出真实的物理尺寸。它知道:“啊,我在这段时间内移动了这么远,所以我的下一步应该是这么长。”这防止了它因猜错尺寸而发生碰撞。

2. “超级眼睛”(DINOv3 编码器)

有些地方很难导航,因为它们看起来到处都一样,比如一条有着一排相同房门的漫长走廊,或者一片没有任何树木的雪原。旧的机器人“眼睛”在这里会感到困惑,认为自己同时身处两个不同的地方。

  • VISTA 的做法: 研究人员为 VISTA 提供了一种新的“相机大脑”,称为 DINOv3。你可以把它想象成一只超先进的眼睛,它不仅能看到“一扇门”,还能理解这扇门的形状、纹理和几何结构,以及它与地板和天花板的关系。
  • 结果: 即使在单调重复的地方,VISTA 也能分辨出“1号门”和“3号门”的区别,从而避免迷路。

证据:现实世界测试

团队在现实世界中测试了 VISTA,而不仅仅是在电脑模拟中。他们将它送入三个非常不同的环境,且事先没有教过它关于这些特定环境的任何知识(这被称为零样本部署/zero-shot deployment):

  1. 开阔田野: 有灌木丛的草地。
  2. 森林: 一个有树木、木头和落叶的复杂环境。
  3. 办公实验室: 一个有着许多相同房门和狭窄转角的复杂走廊。

测试结果:

  • VISTA 在户外、森林和办公室设置中,成功达到了目标的次数为 100%。它能够顺利通过狭窄的转角,并每次都能找到正确的门。
  • 旧模型(如 ViNT 或 NoMaD): 它们表现挣扎。它们经常撞到墙壁、在相同的房门前迷路,或者无法在正确的时间停下。它们无法搞清楚自身移动的“尺度”。

为什么这很重要(根据论文观点)

论文声称,要让机器人安全地行走在任何地方,它需要两样东西:

  1. 好眼睛: 用来理解世界的形状(由 DINOv3 提供)。
  2. 尺度感: 知道自己的动作有多大(通过记住过去的步伐来实现)。

如果没有这两者,机器人就像一个拥有顶级 GPS 但不知道自己开车有多快的人——它最终一定会撞车。VISTA 将两者结合在一起,使其能够在未见过的环境中行走,而无需说明书或地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →