← 最新论文
🤖 AI

Visual Navigation Transformer with Pose Attention

该论文提出了 VNT-PA,一种基于 Transformer 的导航规划器,它利用相机位姿作为位置编码来索引深度关键帧,从而实现了在不同轨迹间高效复用空间经验,并在长程点目标导航任务中达到了最先进的性能。

原作者: Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

发布于 2026-09-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在世界上移动的机器人面临着一个根本性的记忆问题。为了从 A 点移动到 B 点,机器不仅必须记住它所见到的事物,还必须知道这些记忆属于空间中的什么位置。传统的导航系统通常将机器人的旅程视为一段录像带,按发生的先后顺序存储观察结果。这对于单次行程效果很好,但当机器人试图重复利用旧有的经验时,就会产生混乱。如果机器人今天访问了一条走廊,下周再次返回,这种“视频式”的记忆很难将这两次访问合并为一个连贯的地图。它无法轻易判断昨天看到的门是否就是今天看到的同一扇门,也无法理解在不同顺序下进行的转向最终会通向同一个目的地。为了解决这个问题,工程师们通常会构建显式地图,在机器人移动之前绘制世界的网格或图谱。然而,这些地图需要复杂的构建过程,并且如果机器人的传感器出现轻微偏差,地图就会失效。问题依然存在:机器人能否仅仅通过记住看到某物时自己所处的位置,而不预先绘制地图,就能学会导航?

宾夕法尼亚大学的一个研究小组开发了一种让机器人思考空间的新方法,他们称之为带有位姿注意力的视觉导航 Transformer(Visual Navigation Transformer with Pose Attention)。他们不再按时间组织机器人的记忆,而是按位置进行组织。想象一下在房屋中散步时拍摄的一组照片。在标准方法中,这些照片会按照拍摄顺序堆叠在一起。而在这个新系统中,每张照片都会被标记上拍摄时相机的精确位置和角度。机器人不再按顺序查看这叠照片,而是将整个集合作为一个整体来观察,并询问:“我现在在哪里,目标在哪里?”随后,系统会搜索所有存储的照片,以找到与当前情况在空间上相关的照片,而忽略它们是什么时候拍摄的。这使得机器人能够将来自不同行程的记忆融合为一个灵活且统一的环境理解。

研究人员在计算机模拟中测试了这个想法,使用的是包含真实建筑 3D 扫描数据的真实室内环境数据集——Habitat-Matterport 3D 数据集。他们给了机器人一组深度图像——这种视觉数据捕捉了物体到观察者的距离——这些图像是在对建筑物进行初始探索期间收集的。这些图像被过滤成一组“关键帧”,即展示房间新部分的最有用快照,而非重复观看同一面墙的视角。随后,机器人被要求仅利用这些存储的图像及其当前位置,从一个随机位置寻找特定的目标点。它并不依赖于预建的地图或当前运动的视频流。相反,它使用了一种被称为 Transformer 的人工智能类型,这种技术旨在权衡不同信息的重要性。在这种情况下,Transformer 使用相机的位置和角度作为引导,来决定应该关注哪些记忆。

结果表明,这种方法非常有效。在一系列测试中,机器人成功到达目标的概率为 93.3%,相比于那些将相同记忆视为时间有序序列的其他方法有了显著提升。当目标距离较远或需要经过漫长曲折的路径时,新系统仍能保持准确性,而其他系统则经常迷路或采取低效的路线。研究人员发现,成功的关键在于机器人连接记忆的方式。通过关注当前位置与存储图像之间的位置差异,而不是它们之间的时间间隔,机器人能够更有效地进行几何推理。它学会了识别出,现在进行的转向与在建筑物的另一部分进行的转向是相关的,仅仅是因为这两个点之间的空间关系是一致的。

最令人震惊的发现之一是该系统处理自身定位误差的能力。在现实世界中,机器人的传感器往往并不完美,可能无法精确到毫米级的定位。当研究人员引入噪声以模拟这些误差时,新系统表现得非常稳健,性能损失很小。相比之下,使用相同数据构建刚性地图的传统系统则出现了严重的失败,因为带有噪声的位置数据导致墙壁被错误地放置在了错误的位置,从而将开放的走廊误认为是被阻挡的墙壁。新系统通过将环境视为一组灵活的、带有位置标签的记忆,能够容忍这些不准确性而不会崩溃。它不需要致力于构建一个单一、完美的物理世界网格;它只需根据自己认为所在的位置来查询记忆,并在移动过程中调整路径。

研究人员还发现,该系统可以从初始探索之外的学习中获益。如果机器人在旅途中遇到了房间的新角度或此前未见的区域,它可以立即将这个新视角添加到其记忆集中,而无需重新训练。这意味着机器人可以在旅途中实时构建更丰富的环境理解,利用来自不同路径的观察结果来填补空白。该系统被训练去模仿一个知道建筑内完美路径的专家规划器,并通过观察周围环境的空间上下文来预测下一步行动。它不需要看到当前的视图来做出决策;它只需要知道自己在哪里以及想去哪里,然后召回相关的记忆部分。

这项工作表明,对于要在复杂、多变的环境中导航的机器人而言,它们不一定需要构建一个静态的世界地图。相反,它们可以依靠一组按发生位置索引的动态经验集合。研究证明,按位置而非按时间组织记忆,可以实现更快的学习速度和在长期、困难任务中的更好表现。虽然实验是在模拟环境中进行的,但其原理依赖于适用于物理世界的几何推理。研究人员指出,目前的系统是在二维空间内运行,假设机器人在平坦的地面上移动,但底层方法可以扩展到三维运动。通过展示机器人仅使用一组带有位姿戳记的记忆即可进行有效导航,这项研究为创造能够像人类一样灵活且具有适应性的机器开辟了一条新路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →