← 最新论文
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN 通过引入一种显著增强长期定位与视觉回溯能力的层次化记忆系统,解决了开源零样本视觉语言导航中的“导航失忆”问题,其性能几乎达到了现有最先进开源方法的两倍。

原作者: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能够像你一样理解你的声音并观察这个世界的机器人。这就是“具身智能”(Embodied AI)的梦想——在这个领域,计算机不仅仅是在聊天或计算,它们还能在房间里物理移动,执行诸如“去厨房拿一个杯子”之类的指令,并在复杂的空间中穿行而不撞到墙壁。长期以来,这些机器人需要海量的人类编写的训练数据来学习如何移动,这使得它们很难适应新的房屋或办公室。最近,科学家们开始使用被称为“大语言模型”(LLMs)的巨型“大脑”模型来赋予机器人常识,使它们能够在无需预先训练的情况下即时规划导航。然而,这里有一个问题:最聪明的“大脑”被锁在昂贵的、基于云端的门后,使用它们需要付费,并且由于需要将家中的视频流发送到服务器,还会引发隐私担忧。虽然存在开源模型(免费、本地化的“大脑”),但它们经常会感到困惑、忘记自己所处的位置或原地打转,导致其能力与昂贵的闭源模型之间存在巨大的差距。

于是有了 HiMemVLN,一种全新的方法,它教会开源机器人大脑如何记住自己去过哪里以及要去向何方,有效地治愈了它们的“导航失忆症”。研究人员发现,这些开源机器人存在两种类型的健忘:短期失忆,即它们会失去对即时周围环境的追踪并最终陷入循环行走;以及长期失忆,即它们会忘记最初的目标,并在走动几步后偏离航线。为了解决这个问题,该团队构建了一个受人类大脑启发而设计的“层级化记忆系统”。他们创建了一个 Short-Term Localer(短期局部器),它就像一个视觉速写本,不断绘制它刚刚访问过的房间地图,以识别自己是否在绕圈子。他们还构建了一个 Long-Term Globaler(长期全局器),它充当指南针和任务控制器,不断提醒机器人大局观:“你从卧室出发,你需要去厨房,而你目前正朝着错误的方向前进。”

通过结合这两个记忆系统,HiMemVLN 让开源机器人的导航可靠性达到了此前只有昂贵的闭源模型才能达到的水平。在测试中,这种方法不仅帮助机器人避免了循环,还使其成功率比之前最好的开源方法几乎翻了一番。在模拟环境中,该系统实现了 30% 的成功率和 26.85 的成功加权路径长度(SPL),显著优于之前的开源领先者 OpenNav(其成功率仅为 16%)。研究人员还在真实房间内的实际轮式机器人上进行了测试,结果再次击败了竞争对手,取得了 32% 的成功率,而 OpenNav 的成功率为 18%。这项研究表明,通过赋予机器人一种既能记住即时视觉环境又能记住长期目标的结构化记忆方式,我们可以构建出安全、私密且高度胜任的导航智能体,而无需依赖云端。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →