← 最新论文
💻 computer science

NaviTrace: Evaluating Embodied Navigation of Vision-Language Models

本文介绍了 NaviTrace,这是一个涵盖多种场景和具身类型、包含超过 3000 条专家导航轨迹的高质量视觉问答基准,该基准通过一种新颖的语义感知轨迹评分揭示出当前的视觉语言模型在空间定位和目标定位方面仍落后于人类表现。

原作者: Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

发布于 2026-03-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位聪明但缺乏经验的游客如何在新城市中导航。你给他们看一张街道的照片,并说:“走到那辆红色的车那里。”一位人类游客会查看照片,找到那辆车,注意到楼梯,看到“禁止通行”的标志,并在照片上画出一条路径,精确地指示每一步该走哪里。

本文介绍了一种名为NaviTrace的新“测试”,旨在考察现代 AI 机器人(特别是视觉 - 语言模型)能否做到同样的事情。

以下是用简单类比对这篇论文的拆解:

1. 问题:“机器人游客”正在迷路

机器人在理解语言和识别图像方面正变得越来越聪明。但是,当你要求机器人“下楼”或“沿路前行”时,我们并不真正了解它在规划路径方面的能力究竟如何。

  • 旧方法: 为了测试机器人,研究人员曾将它们派往真实世界。这就像每次想检查司机的技能时,都让他们开车横跨整个国家。这种方式昂贵、缓慢且难以重复。
  • 模拟方法: 其他人使用电子游戏模拟。这就像在飞行模拟器中测试司机。它便宜且可重复,但游戏中的“道路”往往过于简单,缺失了现实世界的细节,如不平的路面或社会规则(例如等待行人)。

2. 解决方案:一场“纸笔”导航考试

作者创建了NaviTrace,这就像是为机器人导航设计的一场标准化考试。

  • 设置: 他们不再将机器人派出去,而是向 AI 展示一张真实世界场景(如繁忙的街道或公园)的单张照片,并给出一个指令(例如:“走到路的尽头”)。
  • 转折: 他们要求 AI 直接在照片上画出一条二维线条(即“轨迹”),以显示特定类型的旅行者应该前往何处。
  • 旅行者: 他们测试了四种不同的“具身”(即旅行者类型):
    1. 人类: 可以走到任何地方,但无法攀爬高墙。
    2. 足式机器人: 像四条腿的狗;能应对崎岖地面,但身高较矮。
    3. 轮式机器人: 像配送机器人或轮椅;需要平滑的路径和坡道。
    4. 自行车: 需要保持在道路或自行车道上;讨厌楼梯。

3. 评分系统:“智能尺子”

你如何给一幅画打分?你不能仅仅测量从起点到终点的距离。作者发明了一种特殊的评分系统,它就像一把智能尺子:

  • 形状匹配: 画出的线条是否看起来像人类专家会画出的路径?(他们使用一种称为“动态时间规整”的数学技巧来比较形状)。
  • 目标检查: 线条是否最终到达了目的地?
  • “禁止前往”惩罚: 这是巧妙之处。系统知道照片中有哪些物体(例如草地、楼梯、繁忙的道路)。如果 AI 为轮椅画出一条走上楼梯的线,系统会给予严厉惩罚。如果它为人类画出一条走在自行车道上的线,则会给予较轻的惩罚。

4. 结果:AI 很聪明,但缺乏“落地性”

作者将顶级 AI 模型(如 Gemini、GPT-5 等)与人类专家进行了测试对比。

  • 差距: 人类得分约为75/100。表现最好的 AI 模型得分约为34/100。AI 的表现优于随机猜测,但仍远落后于人类。
  • 主要错误: 最大的问题不在于 AI 不知道如何行走,而在于它无法找到目的地。
    • 类比: 如果你告诉 AI“走到那辆红色的车那里”,它通常会画出一条看起来合理的路径,但最终却停在了错误的车旁,或者画出了一条完全偏离地图的路径。
    • 当研究人员强制 AI 只猜测目的地,然后画一条直线到达那里时,得分并没有显著提高。这意味着 AI 在理解照片中物体的位置方面存在困难,而不仅仅是关于如何移动的问题。
  • “推理”陷阱: 一些 AI 模型(如 o3)在文本中写出了完美的逻辑步骤:“我需要向左转,避开楼梯,然后前往那辆车。”然而,当它们实际画线时,却忽略了自己的文本,画出了一条撞向墙壁的路径。AI 的“大脑”(文本)和它的“眼睛”(绘图)并没有正常地相互沟通。

5. 为什么这很重要

该论文认为,在我们能够信任机器人去递送包裹、帮助老人或搜寻幸存者之前,我们需要一种公平、廉价且能涵盖现实世界复杂性的测试方法。NaviTrace 提供了这种测试。它向我们表明,虽然 AI 在聊天和识别物体方面表现出色,但在以允许其安全、合乎逻辑地穿越世界的方式“看”懂世界方面,它仍然面临困难。

简而言之: 该论文建立了一项导航测试,要求机器人在照片上绘制地图。结果表明,虽然机器人正在进步,但它们仍然极不擅长寻找方向,并且经常忽视道路的物理规则(例如轮椅不能上楼梯)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →