← 最新论文
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

本文提出了 GLAM,一种在全局时空记忆上训练的目标条件潜在世界模型,该模型通过预测未来的地图表示和导航路标点,以实现改进的主动探索和语义导航,并通过 GLAM NAV 系统在 HM3D-ObjectNav 任务上优于 BSC-Nav 基准线得到了验证。

原作者: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人进入了一个它从未见过的房间,任务是寻找一个特定的物体,比如一把红色的椅子,而它从当前站立的位置无法看到这个物体。为了成功,机器人不能仅仅对它相机前方的即时景象做出反应。它必须在移动过程中构建空间的心理图像,记住它去过的地方,并猜测下一个转角后会出现什么。这种在记忆中持有地图、预判随着机器人向前移动该地图会如何变化,并利用这种预判来规划下一步的能力,是主动探索的核心挑战。多年来,研究人员一直试图通过让机器重建高清晰度、像素级的世界细节,或依赖预制地图来教会机器这项技能。然而,一种新的方法表明,机器人并不需要看到每一块砖头和阴影才能导航;它只需要理解空间的结构以及通往目标的可能路径。

一个研究小组开发了一个名为 GLAM 的系统,全称为“基于全局时空记忆的目标导向潜在世界模型”(goal-conditioned latent world model trained over global spatiotemporal memory)。简单来说,这是一个导航系统,它学习预测房间的未来布局和前往目的地的最佳路径,而无需完美地重建视觉世界。该系统并不是尝试生成下一秒房间看起来像什么的新视频帧,而是预测一个压缩的、抽象的地图表示以及一个隐藏的下一步行动计划。这种方法受到了生物大脑(特别是海马体)组织空间记忆并利用其模拟未来场景方式的启发。研究人员围绕这个模型构建了一个完整的导航系统,命名为 GLAM NAV,它将在线建图、记忆检索和预测规划整合进一个单一的循环中。

该系统通过在机器人移动时不断更新环境的稀疏数字记忆来工作。这种记忆不是一张完整的 3D 照片,而是关键地标和空间关系的集合。当机器人需要寻找目标时,它会利用当前位置和已观察到的记忆来询问一个简单的问题:“如果我朝这个方向移动,地图会变成什么样,我会离我的目标更近吗?”GLAM 模型通过同时预测两件事来回答这个问题。首先,它预测地图标记(即其记忆中的抽象构建模块)随着机器人的探索将如何演变。其次,它预测一个潜在路标点(waypoint),即机器人下一步应该采取行动的隐藏表示。这些预测发生在同一个共享空间内,这意味着模型学会了将变化的地图直接与必要的移动联系起来,而从未尝试去重建未来的原始视觉图像。

为了训练这个系统,研究人员并没有让机器人在现实世界中出去犯错。相反,他们使用了一个名为 Habitat 的高保真模拟器,其中包含数百个来自真实室内环境(如公寓和办公室)的详细 3D 扫描。他们回放了专家轨迹——即由完全了解物体位置的计算机控制智能体所走的路径——并将这些路径切割成数千个训练样本。模型学习观察地图标记的历史和目标,然后预测未来的地图和下一个路标点。至关重要的是,系统被教导去忽略重建视觉世界的任务。它完全专注于预测空间的结构和导航计划。在训练主模型之前,研究人员还预训练了一个单独的组件,以理解如何将这些隐藏的路标点计划转化为实际的物理运动,从而确保预测可以转化为真实的指令。

在模拟器中测试时,结果显示这种预测性方法比以往依赖不同类型记忆结构的方案效果更好。在针对 50% 特定测试场景的一组测试中,新系统 GL am NAV 成功找到了目标物体,成功率达到了 86.89%,相比于它所对比的基准系统的 78.50% 成功率有了显著提升。它还实现了更高效的目标到达,其衡量指标“路径长度加权成功率”(Success weighted by Path Length)从 47.70% 上升到了 48.35%。这些数字表明,通过同时预测地图的未来结构和路径,机器人变得更加可靠地寻找路径,即使目标最初在视线之外。该系统不仅仅是记住了路线;它学会了预判环境的布局,并根据这种预判调整计划。

为了证明这不仅仅是模拟器的结果,研究人员将该系统部署在一个物理机器人上——一个带有双臂的轮式类人机器人,置于真实的办公环境中。在第一次实地测试中,机器人被要求在一个它从未见过的房间里寻找一盆植物,且没有提供预建地图。随着它的移动,它构建了自己的空间记忆,将新的视觉观察连接到不断增长的地图中。它成功地导航到了植物处,证明了该系统能够在真实的物理设置中从零开始构建有用的空间记忆。在第二次测试中,机器人被要求在植物移出视线后回忆它在哪里见过该植物。系统从记忆中检索了存储的位置,并成功导航回了那个点。这些演示证实了模型所做的抽象预测可以引导真实的机器人穿梭于真实的物理环境,利用记忆来弥补“所见”与“所需”之间的差距。

尽管取得了这些成功,研究人员仍谨慎地指出了这项工作的局限性。该系统通过学习专家智能体在模拟器中的路径进行学习,因此当机器人的行为保持在训练期间所见的模式范围内时,其效果最为理想。它不是一个可以预测任何随机动作结果的通用模拟器;相反,它是一个目标导向的工具,用于估计特定目标下最可能的地图和路径。该模型产生的是单一且确定的预测,而不是一个可能性的范围,这意味着它并没有显式地计算其猜测的不确定性。如果机器人遇到与其学习内容差异极大的布局,或者如果其传感器发生漂移导致丢失位置追踪,系统可能会遇到困难。研究人员强调,机器人仍然依赖实时观测来验证其位置并避免碰撞,仅将预测用于引导搜索。

这项工作代表了我们对机器人导航思维方式的一种转变。系统不再试图在计算机内部构建一个完美的、高分辨率的世界副本,而是学习使用一个功能性的、抽象的版本作为地图来进行规划。通过将预测未来地图和规划下一步移动视为一个单一的、连接的任务,研究人员创造了一个既能更可靠地寻找目标,又能具备在现实环境中运行能力的系统。研究结果表明,对于机器人而言,要进行有效的探索,它不需要看到一切;它只需要足够理解空间的结构,以便想象接下来会发生什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →