← 最新论文
💻 computer science

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation

AECNav 是一个无需训练、证据驱动的框架,用于实现零样本开放词汇物体导航,它通过整合门控感知、信念巩固和主动探索,在模拟机器人和实体机器人上均实现了最先进的成功率和低延迟。

原作者: Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正试图在一栋它从未见过的全新房子里寻找一个特定的物体,比如在堆满了红杯子、红碗和红苹果的厨房里寻找一个“红色的马克杯”。这就是**零样本目标导航(Zero-Shot Object Navigation)**的世界。“零样本”意味着机器人并没有针对这栋特定的房子,甚至没有针对这种特定类型的马克杯进行过训练;它必须仅凭语言描述,在实战中即时判断。这个巨大的挑战在于,机器人需要既快速又聪明。如果它停下来对看到的每一个物体都拍摄一张超详细的照片,它就会耗尽电池和时间。但如果它移动得太快而不仔细检查,它可能会把一个红苹果当成红色的马克杯抓起来。科学家们正试图让机器人能够在这些混乱的现实世界环境中进行导航,而不需要依赖庞大的预存地图库,从而使它们能够真正走进人们的实际家庭,而不仅仅是在完美的视频游戏模拟器中运行。

于是有了 AECNav,一种为机器人设计的全新“大脑”,它通过像一名高效侦探一样行动来破解这个谜题。AECNav 并不通过不断拍摄高分辨率照片(这既慢又昂贵)来工作,而是使用了一种聪明的“证据门控(evidence-gated)”系统。你可以把它想象成在黑暗的房间里拿着手电筒行走:大多数时候,你只是用快速、模糊的扫视来观察房间,看看是否有任何有趣的东西;只有当你快速扫视发现某个东西可能是目标时,你才会打起明亮、详细的聚光灯(即进行昂贵的相机作业)。这节省了大量的能量和时间。

但是,当机器人发现某个东西看起来像目标,但可能是一个陷阱时,会发生什么呢?也许它看到一个红苹果,心想:“那是马克杯吗?”AECNav 不仅仅是猜测;它会维护一个运行中的证据评分,就像侦探的笔记本一样。如果机器人在三个不同的角度看到了“红色马克杯”,分数就会上升。但如果它看到一个看起来很像马克杯的“红苹果”,那么关于马克杯假设的分数实际上会下降。机器人也会从它“没看到”的东西中学习。如果它预期在某个地方看到该物体,但镜头扫过时却发现空无一物,这种缺失就成了负面证据,降低了该物体就在那里的可能性。这能防止机器人陷入追逐假线索的困境。

最后,当机器人感到困惑且不知道下一步该去哪里时,它不会盲目游荡。它玩的是一场“信息与成本”的游戏。它会问自己:“如果我走过这条走廊,我会看到很多新东西吗?这段路程长吗?”它会选择那些能以最小行走代价换取最多新线索的路径。这使得即使在缺乏线索的情况下,探索过程也能保持高效。

论文显示,这种方法效果极佳。在对三种不同复杂房屋环境的计算机模拟中,AECNav 在最难的测试集上成功找到了目标的概率高达 84.7%,击败了所有以往的方法。而且它的速度也更快,每个回合仅需约 24 秒,而排名第二的方法则需要超过 50 秒。研究团队甚至在一个真实的四足机器人在实际房间中的测试中测试了它。该机器人在 40 次真实实验中成功找到了咖啡机、垃圾桶和椅子等物体中的 38 个,移动速度约为每秒 5 次决策。研究人员发现,如果移除该系统的三个核心部分中的任何一个——快速扫描触发器、证据笔记本或智能路径规划——成功率都会显著下降,这证明了这三个部分对于让机器人兼具速度与准确性都是必不可少的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →