← 最新论文
💻 computer science

AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation

AdaGeoVLN 是一个流式视觉语言导航框架,它通过在不同深度上选择性地融合层次化几何基础模型表示,并利用有界记忆机制保留具有导航感知能力的历史几何证据,从而提升性能。

原作者: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人试图通过一组口头指令,在一个它从未见过的房子里进行导航。为了成功,机器人不能仅仅识别出椅子是椅子或门是门。它必须理解这些物体在空间中是如何相互关联的,理解它自己的视角如何随着移动而变化,以及它正在行走的路径如何与它听到的指令相连接。这一挑战被称为视觉-语言导航(vision-language navigation),它要求智能体利用仅有的摄像头和语音指令,实时构建出一个世界的心理地图。多年来,研究人员一直试图通过向机器喂入海量的视觉数据来教会它们这项技能,但一个关键问题始终悬而未决:机器人应该如何利用现代人工智能模型所拥有的深层、分层的几何理解能力?以及它应该记住多少过去的信息,才能在未来做出正确的决策?

一个研究团队推出了一种名为 AdaGeoVLN 的新系统,通过改变机器人观察世界的方式和存储记忆的方式来回答这些问题。该系统不再依赖于周围环境的单一、最终快照,而是学会从其自身思考过程的多个阶段中提取有用的几何信息。此外,它不会试图记住它所见过的每一个画面,因为这会迅速使它的记忆过载。相反,它表现得像一名细心的档案管理员,只保留那些有助于它理解自己所处位置以及下一步该去哪里的重要历史时刻。这种方法使得机器人能够仅使用标准的视频流,在复杂且未知的环境中进行导航,而无需额外的传感器(如深度摄像头)或预先制作好的地图。

这种新方法的核心在于机器人处理视觉信息的方式。理解几何结构的现代人工智能模型就像是由深层堆叠的层级构建而成的,每一层对图像的处理方式都略有不同。较早的层可能会捕捉简单的形状和边缘,而更深的层则能理解复杂的结构和空间关系。以往的系统通常会忽略这些早期层级,直到处理过程的最后一步才使用场景的单一最终总结。研究人员发现,这是一个错误。通过将机器人的决策步骤同时连接到几何模型的多个层级——即同时利用早期、中期和后期阶段——机器人获得了对周围环境更丰富的理解。这种多层级的方法被证明比仅仅重复注入最终总结要有效得多,这表明机器人受益于同时通过不同的“镜头”来看待世界。

第二个重大创新解决了记忆问题。当机器人穿过房子时,它会产生连续的视觉数据流。存储这段旅程中的每一件数据将需要极其庞大的内存,尤其是在长途旅行中。旧的方法通常保留最近的帧或固定数量的历史视图,并假设刚刚发生的事情是最重要的。然而,研究人员意识到,如果某个旧视图包含指令中提到的特定地标,或者展示了一个独特的转弯,那么它可能至关重要。AdaGeoVLN 通过三个特定标准来选择保留哪些记忆来解决这个问题:该记忆与当前指令的相关性、机器人在该视图中几何细节的置信度,以及该视图与其他已见视图的差异性。这使得机器人能够丢弃冗余信息,同时保留那些在稍后有助于其导航的特定时刻。

为了测试这些想法,研究人员在数千个模拟导航任务上训练了该系统,并在科学界使用的两个标准基准测试上对其进行了评估。结果显示,该新系统显著优于以往的方法。在一项测试集中,它成功到达目的地的概率为 55.7%,相比于那些未使用额外外部数据的现有最佳系统有了显著提升。更重要的是,该系统在实现如此高水平性能的同时,使用的计算机内存远低于其他尝试存储大量历史记录的方法。研究人员证明,通过对记忆进行筛选,机器人可以在保持空间感知能力的同时,不被不必要的数据所困扰。

该团队并未止步于计算机模拟。他们将训练好的策略部署在一台配备标准摄像头的真人大小的物理机器人上。在现实世界的试验中,机器人成功遵循了多步指令,例如远离壁炉行走、爬上弯曲的楼梯,并在特定的门口停下。它成功地从正确的一侧绕过植物,并避开了无关的门口,这证明了选择性记忆和多层几何推理不仅在虚拟世界中有效,在物理世界中同样奏效。研究人员指出,尽管该系统非常有效,但在如何平衡不同记忆信号方面仍有改进空间,但通过在不同深度和时间选择几何信息的根本方法,已被证明是教机器如何穿梭于世界的一种强大方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →