← 最新论文
💻 computer science

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav 是一个无需训练的框架,它通过将传统的场景图扩展为时空事件图,来增强多模态终身物体导航,该框架将查询条件的空间实例定位与轨迹感知的时序记忆相结合,以提升实例区分度、边界表示能力以及跨子任务的经验复用。

原作者: Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人进入了一个它从未见过的房间,任务是寻找一个特定的物体。在这个挑战最简单的版本中,机器人被告知去寻找“一把椅子”。但在现实世界中,房间里到处都是椅子,机器人需要知道哪一把才是正确的,这需要根据诸如“窗户旁边的红椅子”之类的描述或一张特定家具的照片来进行判断。这就是具身导航(embodied navigation)的领域,在这里,人工智能代理必须理解它们周围的环境,理解复杂的指令,并在空间中移动以实现目标。多年来,研究人员一直试图教机器人构建这些环境的精神地图,通常使用一种叫做场景图(scene graph)的工具。可以将场景图想象成一份数字清单,记录了房间里有哪些物体以及它们是如何相互关联的。虽然很有用,但这些传统的清单有一个盲点:它们通常将所有的椅子都视为同一种通用的物品,并且会忘记机器人到达那里的路径。它们是房间的静态快照,而不是一段旅程的记录,这会导致机器人对完全相同的物体产生混淆,或者在已经探索过的区域里转圈圈。

南京大学的一个研究小组开发了一种新方法来解决这些问题,创建了一个他们称之为 STEGNav 的系统。该系统不再依赖于静态的物体列表,而是构建了一个动态的、事件驱动的地图,既能记住房间的布局,也能记住机器人的运动历史。研究人员意识到,为了在长时间内进行有效的导航,代理不仅需要理解它面前有什么,还需要理解它是如何到达那里的,以及它已经尝试了什么。他们的解决方案涉及对机器人感知世界方式的两项主要改进。首先,他们添加了一个空间层,帮助机器人区分单个物品。如果机器人正在寻找一张特定的桌子,这个系统可以帮助它分辨出餐厅里的那张桌子和厨房里的那张桌子的区别,即使它们看起来很相似。它还将这些物体与周围的空旷空间联系起来,使机器人不仅能看到家具,还能看到它可以用来到达这些家具的开放路径。

第二个改进是一个追踪机器人近期决策和过去成功经验的记忆系统。这个系统运作起来就像一个双层笔记本。笔记本的一部分记录了即时过去,密切关注机器人最后走的几步路、走过的路径以及探索过的区域。这可以防止机器人陷入循环或浪费时间回到已经检查过的地方。另一部分笔记本则存储了早期任务中经过验证的成功案例。如果机器人在之前的任务中成功找到了某个特定物体,该信息会被保存并链接回当前的地图,从而帮助机器人记住未来可能在哪里找到类似的物品。通过结合这些空间和时间层,机器人创建了一个丰富的、活生生的环境表征,并随着它的移动而演变。

为了测试这个新系统,研究人员在一个旨在模拟现实世界导航的模拟环境中,对其进行了一系列严格的挑战。他们使用了一个名为 GOAT-Bench 的基准测试,该测试要求机器人在同一个连续的旅程中完成一系列不同的任务,例如根据照片、句子描述或类别名称寻找特定物体。结果非常显著。这个新系统成功完成了 66.3% 的这类复杂的多步导航任务,相比于在相同挑战中挣扎的以往方法,这是一个显著的进步。它还经常能找到最短路径,在衡量成功率与路径效率平衡的指标上得分 39.7。当在另一个更大规模的环境集 HM3D 上进行测试时,该系统继续表现出色,在两个不同版本的测试中分别达到了 64.0% 和 69.4% 的成功率。

研究人员分析了系统成功的地方以及仍然面临困难的地方,以理解其为何表现如此出色。他们发现,最大的提升来自于系统能够阻止机器人重复探索相同的区域以及将一个物体误认为另一个物体。通过明确记住哪些路径已被走过以及哪些物体已被检查过,机器人避开了困扰旧系统的许多死胡同。分析表明,与之前的最优方法相比,新方法将机器人迷路或产生混淆的次数减少了近一半。虽然该系统在移动和停止等极低层级的机械操作方面仍面临一些挑战,但导航的核心逻辑——即知道去哪里以及寻找什么——已得到了实质性的改进。这项工作表明,通过赋予机器人一种更好的记忆旅程和区分相似物体的方式,我们可以让它们成为探索未知领域的更可靠的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →