← 最新论文
💻 computer science

LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation

本文介绍了 LangMap,这是首个具有经过人工验证的四个目标层级层次化语义标注的真实世界 3D 室内导航基准测试集,并引入了 PlaNaVid 基准模型,旨在解决现有开放词汇语言条件目标导航评估中的局限性。

原作者: Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一个巨大且复杂的房子里玩一场高风险的“捉迷藏”游戏,你被蒙着眼睛,只能看到正前方的东西。你的朋友通过对讲机向你大声传达指令,告诉你该往哪里走。

这篇论文介绍了一个难度更高、也更公平的新版游戏,以及一种新的游戏策略。

问题所在:“坏地图”问题

过去,研究人员试图教机器人根据语言来寻找物体。但这些方法有一个重大缺陷:它们使用的“地图”(指令)通常是由人工智能(视觉语言模型)编写的,而这些 AI 并不真正理解这个房子。

可以这样想:如果你要求一个 AI 在一间摆满椅子的房间里找一把特定的红椅子,它可能会说:“找一把红椅子。”但如果房间里有三把红椅子,这条指令就毫无用处了。AI 还可能产生混淆,说:“找窗户附近的椅子”,而窗户实际上是在另一个房间。研究发现,这些 AI 生成的指令中,有近 40% 是错误或令人困惑的。这就像是试图用一张由从未离开过卧室的人所绘制的地图来导航城市。

解决方案:LangMap(人工验证的地图)

为了解决这个问题,作者创建了 LangMap。他们没有让 AI 去瞎猜指令,而是雇佣了人类观察真实的房屋 3-D 扫描图,并据此编写指令。

他们不仅仅停留在“找一把椅子”这种程度。他们创建了一个四级层级的难度体系,就像带有递增关卡的电子游戏一样:

  1. 场景级(简单模式): “在整个房子里找任意一把椅子。”(就像在大海捞针,但你并不在意是哪根针)。
  2. 房间级(中等模式): „在厨房里找一把椅子。”(现在你必须了解厨房长什么样)。
  3. 区域级(困难模式): “在铺着蓝色地毯的卧室里找一把椅子。”(现在你需要区分两间不同的卧室)。
  4. 实例级(专家模式): “找到那把左腿有划痕、且位于窗户旁的特定椅子。”(这需要识别微小的细节,并准确辨别出到底是哪一个物体)。

作者称之为 HieraNav(分层导航)。他们构建了一个庞大的数据集,包含超过 18,000 个任务,涵盖了 414 种不同类型的物体。每一条指令都经过了人工检查,以确保其唯一性和准确性。这就像是把模糊的地图复印件变成了高清晰度、手工绘制的藏宝图。

新玩家:PlaNaVid

论文还介绍了一个新的机器人玩家——PlaNaVid

大多数试图解决这个问题的机器人依赖于昂贵的 3D 传感器(如 LiDAR)或深度相机来构建房间的 3D 模型。这就像机器人戴着一个高科技头盔,能看到房间的“骨架”。

PlaNaVid 则不同。 它只使用标准的摄像头(RGB),就像人类的眼睛一样。它不构建 3D 模型,也不知道物体的精确距离。那么,它是如何获胜的呢?

它使用了一种被称为**有界多样化记忆(Bounded Diverse Memory, BDM)**的巧妙技巧。

  • 类比: 想象你在走迷宫。你不需要记住走的每一步(这对你的大脑来说负担太重),而是拍下旅途中一些最有趣或最具差异性的片段。
  • 策略: 当机器人需要决定下一步去哪里时,它不仅仅是看正前方。它会“翻阅”它最近访问过的几个独特地点的“精神相册”。它使用一个智能规划器(一个 AI 大脑)来查看这些照片并说:“啊,我记得在这张照片里看到过一条通往厨房的走廊。让我们往那边走吧。”

这使得机器人能够进行前瞻性规划,并完成复杂的、多步骤的任务(例如“找一个杯子,然后去咖啡机旁,然后再找一本书”),而无需昂贵的 3D 硬件。

实验结果

当他们测试这个新设置时:

  • 地图: 人类编写的指令远优于 AI 编写的指令。在一项测试计算机能否将描述与正确物体匹配的任务中,人类编写的指令正确率达到了 81%,而旧的 AI 指令仅为 58%
  • 机器人: 使用标准摄像头和“相册记忆”的 PlaNaVid 在复杂的多步骤任务中击败了几乎所有市面上的机器人。它在完成任务方面的成功率达到了 42.6%,超越了那些使用昂贵 3D 传感器的机器人。

还有哪些难点?

尽管有了这个新地图和新机器人,论文也承认仍存在艰巨的挑战:

  • “长尾”问题: 如果机器人被要求寻找非常罕见的物体(比如某种特定型号的复古烤面包机),它会表现挣扎,因为它见过的例子太少了。
  • 微小且遥远的物体: 如果目标物体很小或者离得很远,很难被捕捉到。
  • 连锁反应: 如果机器人在多步骤任务的第一步失败了(例如,它找不到杯子),那么整个任务都会失败。这仍然是一个极难解决的问题。

总结

简而言之,作者构建了一个更好的、经人工验证的地图,用于测试机器人在从“找一把椅子”到“在蓝色房间里找那把特定的带划痕的椅子”等各种复杂情况下的导航能力。他们还构建了一个聪明的机器人,它仅凭普通的摄像头和巧妙的记忆系统就能在复杂世界中穿行,证明了不需要昂贵的 3D 传感器也能成为优秀的导航者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →