← 最新论文
🤖 AI

RTNav: Towards Real-Time Zero-Shot Object Navigation

该论文介绍了 RTNav,一种实时导航架构,它通过显式地考虑推理延迟和异步环境步进,来克服现有零样本目标导航方法在现实时间约束下的性能退化问题,从而在 HM3D 基准测试上实现了成功率的显著提升。

原作者: Easop Lee, Lingyu Zhang, Boyuan Chen

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Easop Lee, Lingyu Zhang, Boyuan Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人被派往一个陌生的房子里去寻找一个特定的物体,比如一个红色的杯子,而它对这个房间没有任何先前的训练。为了成功,机器人必须观察周围环境,理解所见之物,决定下一步去哪里,以及移动它的轮子或腿,而与此同时,它周围的世界仍在不断变化。这就是零样本目标导航(zero-shot object navigation)的挑战:利用强大的人工智能来引导机器穿越未知领域。多年来,研究人员一直在计算机模拟中测试这些系统,在虚拟世界中,当机器人的大脑进行思考时,虚拟世界会暂停。在这种冻结的状态下,机器人可以根据需要花费尽可能长的时间来处理图像或做出决策,而时钟不会跳动。这种设置让科学家们能够构建日益复杂且功能强大的导航智能体,但它隐藏了一个关键缺陷。在现实世界中,时间从不停止。当机器人在计算下一步行动时,秒数在流逝,机器人处于停滞状态,而任务预算——即完成任务允许的时间——也在缩减。如果机器人思考得太久,无论它的推理能力多么聪明,它都无法完成任务。

杜克大学的一个研究小组现在揭示了这一隐藏成本,并提出了一种新的构建导航系统的方法,这种方法尊重跳动的时间。他们发现,那些依赖大型、强大的人工智能模型来理解语言和视觉的高级导航智能体,在被迫在实时环境下运行时,性能会大幅下降。在他们的研究中,他们创建了一个新的测试环境,在这个环境中,模拟过程是连续运行的,就像真实的房间一样,而机器人的计算机则在努力工作以决定其下一步行动。当他们在这种设置下运行标准的导航方法时,这些智能体变得迟钝且低效。等待计算机完成计算所花费的时间意味着机器人大部分时间都在原地踏步,往往错失了在时间耗尽前到达目标的机会。研究人员使用一种新的指标来衡量这一点,该指标不仅奖励找到物体,还奖励快速找到物体,并对任何浪费的秒数进行惩罚。

为了解决这个问题,该团队引入了一种名为 RTNav 的新架构,它将时间的流动视为设计的核心部分,而非事后的补充。RTNav 并不强迫机器人在完成单一想法的每个部分之前停止并等待,而是让系统的不同部分以各自自然的速率运行。负责检测物体的系统持续运行,每秒多次扫描环境;负责规划路径的系统运行频率较低,仅在必要时进行更新;负责控制轮子的部分则持续移动,对最新的计划做出反应,而无需等待新计划完全形成。这类似于人类在拥挤的街道上行走:你不会在思考每一步时完全停下来,你会保持移动,同时用眼睛扫描障碍物,并用大脑更新你的路径。通过允许这些过程并行发生而非严格的线性执行,机器人能够保持运动并高效利用时间。

该方法的实验结果令人瞩目。在标准的导航基准测试中,新系统显著优于以往的方法。在测试机器人必须在复杂的、多房间环境中寻找物体时,新系统的成功率比现有的最佳方法提高了高达 11%。更重要的是,它完成任务的速度更快。研究人员测量了一个名为“成功率加完成时间权重”的指标,该指标结合了机器人是否找到了物体以及花费了多长时间。新系统的得分高出多达 5.1 点,这表明它不仅更成功,而且效率更高。研究表明,旧的方法由于是为“冻结的模拟世界”设计的,因此在等待计算完成方面浪费了大量时间。相比之下,新系统让机器人保持运动,与竞争对手相比,它减少了超过 14% 的闲置时间。

研究人员还通过在不同类型的计算机硬件上运行该系统,测试了其鲁棒性,涵盖了从强大的桌面图形卡到专为边缘设备设计的更小、更节能的芯片。该系统在所有硬件上表现一致且良好,即使在计算能力降低时也能保持较高的成功率。这表明该设计具有足够的灵活性,可以在各种机器人上运行,而无需使用最昂贵的硬件。团队还对用于推理的不同规模的人工智能模型进行了实验。他们发现,虽然并不一定需要非常大的模型,但中等规模的模型提供了速度与准确性的最佳平衡,使机器人能够在不被缓慢的处理过程拖累的情况下做出明智的决策。

这项工作凸显了我们在构建现实世界机器人时应有的关键转变。那种“世界等待机器人思考”的旧测试方式,已不再反映实际部署的现实。研究表明,为了让机器人在日常环境中投入实用,其软件必须被设计为能够处理实时执行的约束。通过将感知、规划和移动这些不同的任务解耦,并让它们并行运行,机器人可以变得更加响应迅速且高效。研究人员总结道,忽视计算时间的成本会导致系统在模拟中表现出色,但在实践中却难以应用。他们的新方法提供了一条前进的路径,表明通过正确的架构,机器人可以快速且可靠地在未知世界中导航,将人工智能的理论承诺转化为现实应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →