想象一下,一个机器人进入了一个它从未见过的房间,任务是寻找一个特定的物体。在这个挑战最简单的版本中,机器人被告知去寻找“一把椅子”。但在现实世界中,房间里到处都是椅子,机器人需要知道哪一把才是正确的,这需要根据诸如“窗户旁边的红椅子”之类的描述或一张特定家具的照片来进行判断。这就是具身导航(embodied navigation)的领域,在这里,人工智能代理必须理解它们周围的环境,理解复杂的指令,并在空间中移动以实现目标。多年来,研究人员一直试图教机器人构建这些环境的精神地图,通常使用一种叫做场景图(scene graph)的工具。可以将场景图想象成一份数字清单,记录了房间里有哪些物体以及它们是如何相互关联的。虽然很有用,但这些传统的清单有一个盲点:它们通常将所有的椅子都视为同一种通用的物品,并且会忘记机器人到达那里的路径。它们是房间的静态快照,而不是一段旅程的记录,这会导致机器人对完全相同的物体产生混淆,或者在已经探索过的区域里转圈圈。
南京大学的一个研究小组开发了一种新方法来解决这些问题,创建了一个他们称之为 STEGNav 的系统。该系统不再依赖于静态的物体列表,而是构建了一个动态的、事件驱动的地图,既能记住房间的布局,也能记住机器人的运动历史。研究人员意识到,为了在长时间内进行有效的导航,代理不仅需要理解它面前有什么,还需要理解它是如何到达那里的,以及它已经尝试了什么。他们的解决方案涉及对机器人感知世界方式的两项主要改进。首先,他们添加了一个空间层,帮助机器人区分单个物品。如果机器人正在寻找一张特定的桌子,这个系统可以帮助它分辨出餐厅里的那张桌子和厨房里的那张桌子的区别,即使它们看起来很相似。它还将这些物体与周围的空旷空间联系起来,使机器人不仅能看到家具,还能看到它可以用来到达这些家具的开放路径。
第二个改进是一个追踪机器人近期决策和过去成功经验的记忆系统。这个系统运作起来就像一个双层笔记本。笔记本的一部分记录了即时过去,密切关注机器人最后走的几步路、走过的路径以及探索过的区域。这可以防止机器人陷入循环或浪费时间回到已经检查过的地方。另一部分笔记本则存储了早期任务中经过验证的成功案例。如果机器人在之前的任务中成功找到了某个特定物体,该信息会被保存并链接回当前的地图,从而帮助机器人记住未来可能在哪里找到类似的物品。通过结合这些空间和时间层,机器人创建了一个丰富的、活生生的环境表征,并随着它的移动而演变。
为了测试这个新系统,研究人员在一个旨在模拟现实世界导航的模拟环境中,对其进行了一系列严格的挑战。他们使用了一个名为 GOAT-Bench 的基准测试,该测试要求机器人在同一个连续的旅程中完成一系列不同的任务,例如根据照片、句子描述或类别名称寻找特定物体。结果非常显著。这个新系统成功完成了 66.3% 的这类复杂的多步导航任务,相比于在相同挑战中挣扎的以往方法,这是一个显著的进步。它还经常能找到最短路径,在衡量成功率与路径效率平衡的指标上得分 39.7。当在另一个更大规模的环境集 HM3D 上进行测试时,该系统继续表现出色,在两个不同版本的测试中分别达到了 64.0% 和 69.4% 的成功率。
研究人员分析了系统成功的地方以及仍然面临困难的地方,以理解其为何表现如此出色。他们发现,最大的提升来自于系统能够阻止机器人重复探索相同的区域以及将一个物体误认为另一个物体。通过明确记住哪些路径已被走过以及哪些物体已被检查过,机器人避开了困扰旧系统的许多死胡同。分析表明,与之前的最优方法相比,新方法将机器人迷路或产生混淆的次数减少了近一半。虽然该系统在移动和停止等极低层级的机械操作方面仍面临一些挑战,但导航的核心逻辑——即知道去哪里以及寻找什么——已得到了实质性的改进。这项工作表明,通过赋予机器人一种更好的记忆旅程和区分相似物体的方式,我们可以让它们成为探索未知领域的更可靠的伙伴。
技术摘要:STEGNav
问题陈述
多模态终身导航(Multimodal lifelong navigation)要求具身智能体在自主探索未知环境的同时,按顺序完成由物体类别、语言描述或参考图像定义的导航任务。虽然近期的视觉语言模型(VLMs)能够实现零样本导航,但现有方法主要依赖于以状态为中心的语义场景图(state-centric semantic scene graphs)。作者指出了这些以状态为中心的表示法中存在的三个关键局限性:
- 实例歧义性(Instance Ambiguity): 它们描述了当前存在的物体,但未能明确区分同一类别下的不同个体实例。
- 语义-空间分离(Semantic-Spatial Separation): 它们未能将语义目标与探索前沿(exploration frontiers)进行联合表示,导致智能体无法同时对目标的身份、可通行性和探索效用进行推理。
- 记忆缺失(Memory Loss): 它们缺乏显式的导航历史,导致重复探索,并且无法复用先前子任务中已验证的结果。
作者认为,多模态终身导航本质上是**事件驱动(event-driven)**的,因为每一次决策都会改变智能体的空间知识及其历史经验。
方法论:STEGNav
作者提出了 STEGNav(时空事件图导航,Spatio-Temporal Event Graph Navigation),这是一个无需训练的框架,通过沿两个互补轴线扩展传统的场景图,将其转化为时空事件图(spatio-temporal event graphs)。
1. 空间轴:查询驱动的语义-导航图
该轴线将语义实例与感知占用情况的空间信息相统一:
- 查询驱动的实例落地(Query-Conditioned Instance Grounding, QIG): 一个基于 VLM 的模块根据当前查询(物体、语言或图像)评估场景节点。它通过生成相关性评分和语言描述,来区分同一类别中的特定物理实例,从而过滤掉无关实例,同时保留紧凑的查询相关信息。
- 感知占用的前沿落地(Occupancy-Aware Frontier Grounding, OFG): 该框架将探索前沿(已探索空间与未探索空间之间的边界)直接集成到图中。前沿节点存储空间中心、可达路径代价和探索增益。
- 统一表示: 导航边将智能体与物体节点及前沿节点连接起来,编码可达性和路径代价。这使得 VLM 能够从单一的结构化表示中选择特定的目标实例或探索前沿。
2. 时间轴:轨迹感知双窗口记忆
该轴线按两个时间尺度组织导航经验,以防止重复探索并实现跨子任务学习:
- 短期窗口(决策轨迹): 记录最近的高层决策、执行的轨迹段、经过的区域以及结果。这使得 VLM 能够识别重复的导航模式并避免重新访问已探索的前沿。
- 长期窗口(任务事件): 仅保留来自先前子任务的已验证结果。在成功导航后(由 VLM 根据终端视觉证据和查询进行验证),会创建一个包含实例标识符、类别和查询模态的“事件锚点(event anchor)”。这些锚点作为召回线索,通过外观特征和房间标签与当前的场景图重新关联,用于未来的子任务。
导航策略
在每个决策步骤,智能体执行以下操作:
- 通过结合当前查询并链接短期轨迹与长期锚点,构建时空事件图。
- 将图序列化为 VLM 的提示词(prompt)。
- VLM 选择下一个目标:要么是目标实例节点(前往特定的物体),要么是探索前沿节点(探索新区域)。
- 执行的轨迹和结果被追加到短期记忆中;成功的输出则更新长期记忆。
核心贡献
- STEGNav 框架: 一种无需训练的方法,将表示从以状态为中心的场景图转向以事件驱动的时空表示,用于多模态终身导航。
- 双轴架构:
- 空间轴将查询驱动的实例落地与感知占用的语义-前沿关系相统一。
- 时间轴通过双窗口记忆组织近期的轨迹和已验证的跨子任务结果。
- 实证验证: 通过广泛的实验证明了其可靠性和泛化能力的提升,并通过消融研究和错误分析验证了空间与时间组件的互补效应。
实验结果
该框架在 GOAT-Bench(多模态终身导航)和 HM3D(类别级物体导航泛化)上进行了评估。
- GOAT-Bench (Val-Unseen): STEGNav 实现了 66.3% 的成功率 (SR) 和 39.7% 的路径长度加权成功率 (SPL)。相比最强的竞争方法 (MSGNav),其 SR 提高了 3.9 个百分点,比 EvoMemNav 高出 6.7%。
- HM3D 泛化能力:
- HM3Dv1: SR 为 64.0%,SPL 为 29.8。
- HM3Dv2: SR 为 69.4%,SPL 为 28.2。
STEGNav 在这两个基准测试中均取得了最高的 SR,分别比之前的最佳结果高出 3.8% 和 5.6%。
- 错误分析: 与 3D 场景图基线相比,STEGNav 减少了 34.1% 的总失败次数。显著的降幅包括:
- 实例混淆: 减少了 53.8%(验证了 QIG 的有效性)。
- 低效探索: 减少了 40.0%(验证了 OFG 和短期记忆的有效性)。
- 记忆召回和目标落地失败: 也显示出显著的下降。
意义与主张
论文声称 STEGNav 解决了将场景图视为静态存储库的基本局限性。通过将表示转化为事件驱动的时空图,该框架实现了:
- 实例感知的目标落地: 基于特定查询区分相似物体。
- 高效探索: 平衡目标相关性与探索效用,以避免冗余路径。
- 跨子任务经验复用: 利用已验证的历史结果来加速未来的导航。
作者总结道,虽然 STEGNav 显著改善了高层落地和探索能力,但未来仍需进一步将高层事件图推理与底层导航控制相结合,以提高类别级导航中的路径效率 (SPL)。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。