← 最新论文
💻 computer science

AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation

该论文介绍了 AnchorVLK,这是一个开放词汇视觉语言导航系统,它利用模型上下文协议(MCP)服务器来强制执行一种严格的分离机制,即由视觉语言模型处理语义推理,而几何工具独立确定度量数值,从而与直接坐标估计相比,显著提高了在未知环境中的指令遵循准确度和物体定位精度。

原作者: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人进入一个从未见过的房间,任务是根据一段语音描述寻找特定的物体,例如“画下面的凳子”。几十年来,机器人通过使用激光和摄像头构建精确的数学世界地图来解决这个问题,并在地图中搜索预设的对象名称。这种方法在寻找“椅子”或“桌子”时效果很好,但当指令变得具有创造性或具体化时,例如“窗户附近的红椅子”,它就会失效。机器人的词汇量是固定的;它无法理解新的描述。近年来,强大的人工智能模型已经出现,它们可以观察图像并理解人类给出的几乎任何描述。然而,这些模型擅长语言,但在数学方面表现糟糕。它们可以告诉你一个物体是什么,但当被问及距离有多远或为了到达目的地需要精确移动到哪里时,它们往往会进行荒谬的猜测。如果机器人完全依赖这样的模型进行导航,它可能会自信地驶向一个并不存在的地点,因为模型发明了一个并不真实的距离。

被称为 AnchorVLV 的研究人员通过创建一个严格区分机器人“已知信息”与“如何移动”的系统解决了这一问题。他们意识到,最好的方法是让人工智能处理语言和物体识别,而让机器人的物理传感器处理距离和方向的测量。他们构建了一个系统,其中人工智能充当引导者,指出“看什么”,但绝不会尝试说出“走多远”。相反,该系统使用一套数字工具,利用来自机器人环境的真实激光数据,将人工智能的描述转化为物理坐标。这确保了机器人永远不会根据一个虚构的数字采取行动。该系统在一个涉及 15 个不同室内场景的挑战中进行了测试,机器人必须遵循 30 条复杂的指令,并回答 45 个关于物体位置的问题。结果显示,当系统使用这种职责分离的方法时,它成功执行指令的概率为 64.4%。当研究人员移除检查物理距离的部分时,成功率显著下降。此外,当被要求指出物体的确切位置时,使用真实传感器数据的系统比尝试猜测位置的系统要准确得多,将寻找物体中心的平均误差从超过三米降低到了不到两米半。

这项成就的核心在于一种连接机器人大脑与身体的新方式。研究人员设计了一种通信协议,人工智能只能通过短语和名称进行交流,绝不能使用数字。当机器人看到房间的图像时,人工智能可能会识别出一个“凳子”并给它一个临时名称,比如“物体 7”。然后,人工智能请求系统去寻找这个凳子。系统并不会询问人工智能凳子距离有多远。相反,系统查看机器人自身的激光扫描仪,该扫描仪测量到地板和墙壁的实际距离。它在激光数据中找到凳子,计算出真实距离,并告诉机器人向该特定点移动。如果人工智能试图猜测一个距离,系统会直接忽略该数字,因为它所使用的工具并未被编程为接受此类数字。这迫使机器人依靠自己的感官进行移动,就像人类在听取朋友的指引时,会依靠眼睛来判断距离一样。机器人仍然可以理解复杂的指令,例如“去离电视最近的那把椅子”,因为系统可以比较它所见到的所有椅子与电视之间的真实距离,而不是要求人工智能来进行数学计算。

这种方法还解决了机器人陷入困境或向虚无空间移动的问题。如果人工智能找不到某个物体,系统不会强迫机器人进行猜测。相反,它会指示机器人移动到一个可能获得更好视野的新位置。然后机器人再次扫描该区域,系统更新其内部的物体列表。这个列表就像是房间的一个不断增长的记忆,其中机器人看到的每个物体都记录了其真实的大小和位置。如果机器人从不同的角度看到同一个物体,系统会更新记录以使形状更加准确,而不是创建一个新的、令人困惑的条目。这使得机器人能够随着时间的推移建立起对空间的可靠理解,即使它最初没有任何地图或对房间的先验知识。研究人员发现,这种方法使机器人能够在从未访问过的环境中成功导航,而无需为每个新房间或每种新物体重新编写程序。

这项研究凸显了机器人与世界交互方式的一个根本转变。研究人员并没有试图让单个人工智能模型完成从理解语言到计算物理的所有工作,而是构建了一个让每个部分各司其职的团队。人工智能处理创造力和语言,而机器人的传感器处理精度和运动。这种分工防止了机器人基于自信的猜测做出危险的错误。来自挑战的结果表明,这种方法不仅是一个理论构想,而且是可以在现实场景中应用的实际解决方案。通过将语言和数学分开,机器人可以遵循复杂的指令,并以以往依赖单一模型的系统无法达到的准确度找到物体。这项工作表明,对于机器人要在不可预测的人类世界中进行导航,它们需要依靠自己的感官来处理硬性的数字,同时让人工智能用语言引导它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →