← 最新论文
💻 computer science

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

该论文提出了 Route2Step,这是一个通过显式的步骤级接口和一种新颖的对齐程序,将语义进度追踪与局部动作生成解耦的框架,从而解决了执行错误与进度错误之间的歧义,显著提升了视觉语言导航的性能。

原作者: Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人仅凭语音指令和一对摄像头眼睛,在一个巨大的、隐形的迷宫中导航。这就是**视觉与语言导航(Vision-and-Language Navigation, VLN)**的世界。这就像是在真实的房子里玩一场高风险的“老师说”游戏,但机器人必须仅仅通过听一段话,比如“走过红色沙发,在蓝色台灯处左转,然后在厨房前停下”,就能弄清楚自己到底在哪里以及下一步该做什么。棘手之处在于,机器人不仅仅需要移动它的腿部;它需要理解这段旅程的“故事”。它必须知道自己是已经经过了红色沙发,还是仍在寻找它。如果机器人搞混了并走错了方向,它需要意识到:“噢不,我错过转弯了!”并在尝试再次移动之前修复它的心理地图。如果没有这种能力,机器人可能会在已经走过台灯之后,仍然试图执行“在蓝色台灯处左转”的操作,从而变成一个非常迷失且困惑的机器。

这正是来自北航和南方科技大学等研究团队决定解决的问题。他们注意到,大多数机器人导航器都在试图同时完成两项截然不同的任务:追踪宏观图景(路径)和决定微观下一步(动作)。他们发现,当机器人犯错时,很难判断机器人是因为误解了“指令”(认为自己处于错误的步骤中),还是仅仅因为未能正确“执行”动作。为了解决这个问题,他们构建了一个名为 Route2Step 的新系统。你可以把它想象成给机器人配备了一个两人小组,而不是一个过度劳累的大脑。其中一人是“指令分析师”,扮演着导游的角色,不断检查地图并说:“好的,我们目前处于‘退出卧室’阶段。”另一人是“动作生成器”,扮演着驾驶员的角色,他倾听导游的指示并说:“明白了,我现在左转。”通过将这些工作分离,机器人可以在不干扰其驾驶动作的情况下修复其心理地图,反之亦然。

双头导航员

在旧有的机器人训练方式中,系统就像一个试图同时学习数学和历史的学生,而只能通过最终的考试成绩来学习。如果机器人迷路了,老师只会说:“动作错误,再试一次,”而不会解释为什么机器人认为自己处于正确的地点。研究人员发现,这使得机器人很难区分“我迷路了”和“我只是笨手笨脚”。

为了解决这个问题,他们引入了 Route2Step,这是一个将机器人的大脑拆分为两个通过清晰、明确的接口进行交流的独立模块的框架。

导游 (MIA):
第一个模块被称为指令分析模块 (Instruction Analysis Module, MIA)。把 MIA 想象成一位非常专注的导游,她拿着完整的说明手册,并观察机器人的视频历史。她的唯一任务就是回答一个问题:“我们现在正在进行指令的哪一部分?”是“退出卧室”的部分,还是“走过走廊”的部分?她还会检查机器人处于“正常”状态(完美遵循路径)还是“恢复”状态(在出错后尝试回到正轨)。MIA 不会告诉机器人如何移动腿部;她只是更新机器人的心理地图。

驾驶员 (MAG):
第二个模块是动作生成模块 (Action Generation Module, MAG)。这是驾驶员。他获取当前位置、机器人眼睛捕捉到的近期视频流,以及来自导游的具体指令(“我们目前正在退出卧室”)。基于此,MAG 决定即时的物理动作:“左转,前进,停止。”因为 MAG 只专注于即时的“如何做”,所以即使机器人意外偏离了航线,它也不会感到困惑;它只会尽力执行当前的步骤。

“E-SPA”的魔力

你可能会问:“如果你没有人类在每个步骤发生时手动记录,你如何教机器人知道它处于哪一步呢?”这正是研究人员发挥创意的地方。他们开发了一种称为 E-SPA(能量最小化语义路径对齐)的方法。

把 E-SPA 想象成一个聪明的拼图求解器。机器人被给予一段人类行走路径的连续长视频,但指令只是一个长句子。E-SPA 观察视频和文本,并找出自然的断点。它会问:“‘退出卧室’指令在哪里逻辑性地结束,而‘走向厨房’又在哪里开始?”它通过将词汇与视觉线索(如看到一扇门)以及动作(如穿过这扇门)进行匹配来实现这一点。这使得系统能够从“长篇故事”式的指令中创建一个“步进式”的地图,而无需人类在每次机器人切换任务时手动按下按钮。

他们的发现

研究人员在标准的导航挑战 R2R-CE 上测试了这个新的双头机器人。结果非常喜人。当使用他们的新系统时,机器人的成功率从 48.1% 跳升至 55.3%。在衡量机器人是否能在不绕远路的情况下顺利到达目标的 SPL 指标方面,得分从 43.3% 提高到了 48.2%

但真正的魔力在于他们是如何实现的。通常,为了让机器人从错误中学习,你需要数以千计的例子,其中人类会对机器人的每一个步骤进行纠正。这既昂贵又耗时。然而,Route2Step 使用了一个巧妙的技巧。它使用了大约 190,000 个示例来教“导游”(MIA)如何识别机器人何时迷失(状态级监督),但仅使用了 11,500 个示例来教“驾驶员”(MAG)如何修复特定的动作(动作级监督)。

这表明,帮助机器人意识到自己在故事中的“位置”比微观管理它的每一个动作要重要得多。通过修复机器人的心理地图,机器人通常可以自己找到正确的动作。

现实世界测试与未来步骤

该团队并未止步于计算机模拟。他们将他们的机器人放在了一个真实的四足机器人狗(Unitме GO2)上,并将其送入实际的室内外环境,包括实验室、公园和咖啡馆。他们并没有针对现实世界重新训练机器人;他们只是让机器人使用在模拟中学到的技能。

在这些现实世界的测试中,机器人成功完成了 19 次出 33 次 测试。在一次特别困难的、包含 120 字指令的室内任务中,旧款风格的机器人(StreamVLN)完全失败了,平均只能完成约 2.2 个步骤中的 7 个步骤。然而,Route2Step 机器人平均完成了 5.0 个步骤,并在 5 次中的 3 次 试验中取得了成功。这表明“导游”方法有助于机器人在现实世界变得混乱和复杂时仍能保持在轨道上。

研究人员还展示了这种“导游”理念的灵活性。他们将系统的“指令分析”部分接入了另外四个完全冻结(未经过训练)的现有机器人导航器中。仅仅通过给予这些机器人关于它们处于哪一步的“导游”建议,所有四个机器人的导航能力都得到了提升,这证明了将“处于哪一步”与“如何移动”相分离是一个对任何机器人都有用的想法,而不不仅仅是针对他们特定的设计。

简而言之,Route2Step 表明,更好的机器人导航关键不在于让机器人更擅长移动,而在于让它更擅长了解自己处于故事中的什么位置。通过将追踪进度的工作与移动的工作分离,机器人变得更加稳健、学习效率更高,并且能够真正应对现实世界中混乱且不可预测的本质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →