← 最新论文
💬 NLP

Autonomous Frontier-Based Exploration with VLM Guidance

本文提出了一种无需训练且轻量级的自主探索流程,该流程利用视觉 - 语言模型,通过分析地图与视觉图像的多模态提示来执行高层战略决策,从而在未知环境中将地图覆盖率较现有几何启发式方法提升高达 24%。

原作者: Aarush Aitha, Avideh Zakhor

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Aarush Aitha, Avideh Zakhor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将一台机器人派往一座黑暗、未知的建筑中进行测绘。几十年来,这些机器人就像非常勤勉但略显愚钝的导游。它们遵循一条简单的规则:“走到我能看到的边缘,然后在那里行走。”这被称为“基于前沿的探索”。

问题在于,这条规则过于简单。机器人可能会看到两扇敞开的门:一扇通向一个巨大而空旷的舞厅,另一扇则通向一个狭小且无用的壁橱。仅依靠基础数学运算的传统机器人,可能会因为壁橱更近而选择它。它缺乏“全局观”,无法判断哪条路径真正值得探索。

新构想:赋予机器人具备常识的“大脑”

本文提出了一种新方法,通过为机器人配备一个由视觉 - 语言模型(VLM)——具体来说是谷歌的 Gemini——驱动的高层战略顾问来引导机器人。可以将机器人的标准软件视为双腿(它知道如何行走并避开墙壁),而将 VLM 视为大脑(它知道该前往何处)。

以下是该过程的逐步说明:

  1. 侦察员:机器人四处移动,构建房间的粗略地图,就像在餐巾纸上画草图一样。
  2. 十字路口:当机器人到达一个拥有多个选择的地点(例如一条有三扇门的走廊)时,它会停下来。它不会盲目猜测。
  3. 简报:机器人拍摄地图照片以及每扇门后景象的照片,并将所有这些发送给 VLM(即“大脑”),附注说明:“我正处于十字路口。以下是选项。为了最快地完成该区域的测绘,我应该选择哪一个?”
  4. 决策:VLM 查看照片和地图,利用其“常识”得出结论:“第 2 扇门看起来是死胡同,第 3 扇门太小。第 1 扇门看起来通向一个开阔的大空间。去那里。”
  5. 执行:机器人的“双腿”接管,走向第 1 扇门。

为何这种方法更优?

作者在六个不同室内环境(如房屋或办公室)的虚拟仿真中测试了该方法。他们将他们的“智能机器人”与四种其他方法进行了比较:

  • 贪婪机器人:总是选择最近的门,即使那是死胡同。
  • NBV 机器人:一种经典方法,试图计算最佳视角,但经常陷入循环。
  • TARE 与 DSVP 机器人:更复杂的分层系统,表现良好,但有时过早放弃。

结果:明确的胜者

“智能机器人”在几乎所有方面都取得了胜利:

  • 它看得更多:它测绘了超过**98%**的房间,而其他方法通常止步于 85%–90%,导致整片建筑区域未被探索。
  • 它行走更少:由于没有浪费时间走进死胡同或在同一房间绕圈,它在完成相同任务时行走的距离更短。
  • 它不会困惑:当机器人遇到死胡同时,它拥有之前遇到选择的“记忆列表”,使其能够高效地回溯,而不是陷入困境。

最精彩之处:无需训练

通常,教导机器人变得智能需要在计算机仿真中进行数月的训练,期间它会在学会之前失败数千次。而本系统是无需训练的。你无需教导 VLM 任何内容;它因在互联网上接受过训练,已经具备了关于空间和物体的推理能力。你只需将其接入,提供摄像头和地图,它便能立即开始做出明智的决策。

简而言之

本文表明,通过将机器人移动的物理能力与 AI“思考”地图的能力相结合,我们可以创造出效率更高的探索者。它们不再漫无目的地游荡;而是制定策略,选择最佳路径,比以往任何时候都更快、更彻底地完成工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →