← 最新论文
💻 computer science

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

本文介绍了一种用于图像目标导航的潜在世界模型,该模型采用冻结的 DINO 编码器和一种新型的单调代价排序损失(Monotone Cost Ranking loss)来确保可靠的动作序列规划,在 GNM 数据集上实现了最先进的性能,并在物理机器人上成功实现了零样本部署。

原作者: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人通过迷宫寻找出路,但你不能给它地图、GPS,甚至连指南针都不能给。你唯一的线索就是一张目的地照片。这就是**图像目标导航(image-goal navigation)**的挑战。要解决这个问题,机器人不能仅仅靠看照片来瞎猜;它需要一点“白日梦”的能力。它需要一个“世界模型”(world model)——一个心理模拟器,让它能够自问:“如果我向左走一步,世界看起来会是什么样?如果我向右转,我会到哪里?”通过运行成千上万次这样的心理模拟,机器人在真正转动轮子之前,就能选出最佳路径。然而,这里有一个陷阱:如果机器人的心理模拟器不擅长预测未来,或者它无法分辨“好”路径与“坏”路径,它就会迷路。机器人需要一种方法来给它的白日梦打分,确保那条真正通往照片目标的路径能获得最高分。

这篇论文正是针对这个问题展开研究的:如何构建一个机器人的心理模拟器,使其不仅能准确预测未来,还能懂得如何“评判”自己的预测。研究人员发现,仅仅训练机器人预测下一步是不够的。如果机器人是基于完美的现实世界数据进行训练(这种方法称为“教师强制”,teacher forcing),它会依赖外部的真实情况,当它必须基于自己不完美的猜测来预测未来时,就会失效。此外,他们还发现,试图通过一种特定类型的对比学习来增强机器人预测的“判别性”,反而会破坏其心理地图的几何结构,使其难以进行规划。相反,他们提出了一种新的训练方法,迫使机器人练习使用自己之前的猜测来进行预测(自回归展开,autoregressive rollout),并增加了一条特殊规则:路径偏离目标越远,所受到的“代价”或惩罚就越高。这创造了一个平滑且单调的景观,让机器人能够轻松地“滑向”最佳路径。

机器人的白日梦问题

想象一个机器人试图通过一张目标图像进行导航,就像一名徒步旅行者试图仅凭一张山顶风景照来到达特定的山峰。徒步者没有地图,没有指南针,也不知道自己现在在哪里。他们只有眼睛和脑海中的目的地图像。为了到达那里,徒步者需要想象:“如果我向北走,树木看起来会像照片里那样吗?如果我向南走,我会看到悬崖吗?”

在机器人领域,这种心理模拟被称为世界模型(World Model)。它是一个神经网络,就像一个水晶球。你告诉它:“这是我现在的视觉,这是我正考虑采取的动作,”它会回答:“这是你接下来会看到的景象。”通过将这些预测串联起来,机器人可以在脑海中模拟一整段旅程。

但棘手的部分在于:规划(Planning)。仅仅拥有一个水晶球是不够的,你还需要知道哪条路径最好。机器人会尝试数百条不同的想象路径。它需要一种评分方法。在这篇论文中,评分是基于余弦距离(cosine distance),这是一种衡量两张图像(或它们的数字“指纹”)相似程度的高级方式。如果机器人对路径终点的心理模拟看起来与目标照片非常相似,那么得分就是高的。如果看起来完全不像目标,得分就是低的。

作者发现,许多现有的机器人非常不擅长这种评分游戏。它们可能在一两步的预测上很准确,但当尝试预测十步之后,它们的预测就会失控。更糟糕的是,即使它们预测未来时表现尚可,它们为不同路径分配的“代价”也可能是混乱的。想象一个徒步者,通往悬崖的路径得到了“极好”的评分,而通往山峰的路径却得到了“极差”的评分。徒步者会直接走下悬崖!当“你离目标的距离”与“你的得分”之间的关系不是平滑或**单调(monotone)**时,就会发生这种情况。

解决方案:一个更好的白日梦家

来自德雷塞尔大学(Drexel University)的作者 Amirhosein Chahe、Siwei Cai 和 Lifeng Zhou 构建了一种新型的机器人大脑来解决这个问题。他们称之为具有单调规划代价的潜在世界模型(Latent World Model with Monotone Planning Costs)。让我们用一些有趣的类比来拆解他们的做法。

1. 冻结的镜头与可训练的大脑

首先,他们使用了一个预训练的“眼睛”(一个冻结的 DINO 系列编码器),这个眼睛非常擅长将图像转化为数字指纹。这只眼睛不会改变,它只是清晰地观察世界。然后,他们构建了一个“大脑”(一个可训练的预测器),该预测器接收这些指纹,并尝试猜测在机器人移动后,这些指纹会变成什么样。

2. “熟能生巧”的训练(自回归展开)

大多数机器人的训练方式就像是在教室里的学生,老师在每个问题之后都会给出标准答案。这被称为教师强制(teacher forcing)。机器人看到当前的图像,老师说“你向左移动了”,然后机器人预测下一张图像。接着老师立即进行纠正。

问题在于,当机器人在现实世界中时,并没有老师。它必须根据自己之前的猜测来预测下一张图像。如果它在第一步犯了一个微小的错误,这个错误会在第二步变大,到了第十步,机器人可能正在白日梦一个完全不同的世界。这被称为训练-测试不匹配(train-test mismatch)。

作者通过让机器人练习“自我白日梦”解决了这个问题。他们让机器人基于自己对第一步的预测来预测第二步,再基于第二步的预测来预测第三步,以此类推。他们称之为自回归展开(autoregressive rollout)。这就像一个必须在没有标准答案的情况下参加考试的学生,被迫学会如何处理自己的错误。他们还使用了“反向课程表(counter-curriculum)”,从短时间的白日梦(2步)开始,随着机器人变得更好,逐渐延长到更长时间(最多8步),以免它被复杂的任务压垮。

3. “单调代价”规则

即使有了更好的白日梦能力,机器人仍然需要更好的路径排名方式。作者引入了一条规则,称为单调代价排序(Monotone Cost Ranking, MCR)。

想象一座山,山底是目标。离山底越远,你在山上的高度就越高。这是一个**单调(monotone)**的景观:如果你远离目标,你的“代价”(高度)总是会上升。它绝不会先下降再上升。

在许多之前的模型中,这座“山”是凹凸不平的。一条稍微偏离的路径可能会意外地看起来像个“谷底”(低代价),从而误导机器人认为自己正处于正确的轨道上。作者加入了一种特殊的训练损失函数,强迫机器人学习:“如果你偏离了正确路径,你的代价必须上升。”他们通过生成许多略微出错的路径,并告诉机器人:“你偏离得越多,惩罚就必须越高。”这平滑了心理地图,使得机器人能够利用**交叉熵方法(Cross-Entropy Method, CEM)**轻松找到最低点(即目标)。CEM 本质上是一种通过采样许多路径并挑选其中最佳路径的方法。

4. 出人意料的“禁区”

研究人员还测试了一个看似不错的主意:动作对比学习(Action-Contrastive Learning)。这是一种试图通过展示“好动作”和“坏动作”的配对,来教会机器人区分两者的技术。他们原以为这会让机器人的心理地图更加锐利。

然而,结果却恰恰相反。当他们使用一种会打乱动作顺序的特定对比训练(时间排列负样本)时,它实际上破坏了机器人的规划能力。这就像试图用锤子去磨尖一把刀;地图被扭曲了,机器人再也找不到目标。论文明确排除了这种方法,表明在处理此类任务时,试图让表示变得“判别性”(即擅长区分事物)有时会破坏规划所需的“几何结构”(即地图的形状)。

结果:一个真正能找到路的机器人

团队在名为 GNM 的数据集上测试了他们的新型机器人大脑,该数据集包含六种不同类型机器人导航真实环境的数小时视频。他们将自己的模型与几个顶级竞争对手进行了比较,包括 NWM(预测完整视频帧)、DINO-WM(之前的潜在模型)以及 OmniVLA(大规模反应式策略)。

结果令人印象深刻。使用 DINOv2 编码器的模型,将**朝向误差(orientation error)**相比于之前的最佳潜在模型(DINO-WM)降低了 2.7 倍。简单来说,机器人在到达目的地时,其朝向目标的方向要准确得多。

  • 朝向误差 (AOE): 他们的最佳模型达到了 7.63°,而之前的最佳潜在模型(使用 DINOv2 的 DINO-WM)为 20.27°。
  • 位移误差 (ADE): 他们同时也降低了机器人最终与目标之间的距离误差。

更重要的是,他们在真实的物理机器人(一台 Clearpath Husky)上进行了**零样本(zero-shot)**部署测试,即在没有任何该特定地点训练数据的情况下进行测试。机器人成功地在未见的室内和室外环境中导航,其路径比竞争对手更加逻辑化且目标明确。当其他模型有时会撞墙或过早停止时,这个模型能持续朝着目标图像移动。

为什么这很重要

这篇论文表明,对于想要仅凭一张目标图像进行有效导航的机器人来说,它们需要的不仅仅是一个好的预测器;它们需要一个能够处理自身错误,并且拥有平滑可靠评分系统的预测器。通过修复训练方法(自回归展开)并塑造代价景观(单调排序),作者创建了一个既能超越反应式策略(仅猜测下一步动作),也能超越以往世界模型的系统。

然而,作者也谨慎地指出,这并不是适用于所有情况的“万灵药”。他们的模型在静态或低流量环境下表现最好。目前尚未测试其在有行人或车辆移动的混乱场景中的表现。此外,由于机器人依赖自身的预测来进行规划,因此非常长的旅程(极长的时间跨度)仍然具有挑战性,因为微小的误差最终可能会累积。但就目前而言,这种方法代表了教导机器人通过“白日梦”寻找目的地这一领域的重要进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →