← 最新论文
💻 computer science

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

VerNav 是一个面向视觉-语言导航(Vision-and-Language Navigation)的验证器优先框架,它通过将每步自回归生成替换为批处理动作验证和基于熵的自适应生成器,显著降低了决策阶段的延迟,同时采用两阶段对齐方案以在 R2R 基准测试上保持具有竞争力的导航性能。

原作者: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正试图在一座它从未见过的房子里寻找路径,仅凭一句语音指令进行引导,比如“走到厨房,在蓝色椅子处左转,然后停下”。这就是视觉-语言导航(vision-and-language navigation)所面临的挑战。机器人必须观察周围环境,理解人类的话语,并决定下一步确切的移动方向。长期以来,研究人员一直试图通过给机器人一个强大的大脑来解决这个问题,让它在每一步行动前都进行自我对话。在做出动作之前,机器人会生成一段长长的思维流,解释其推理过程、检查周围环境并规划下一步转向。虽然这种显性的思考有助于机器人理解复杂的指令,但它的速度极其缓慢。就像一个每走一步都要自言自语的人会比直接走路的人慢得多一样,一个在每一步行动前都要生成一段完整推理的机器人,在做决策时会耗费过多的时间。在现实世界中,速度至关重要,这种延迟使得这项技术变得不切实际。

来自电子科技大学的研究团队提出了一种看待该问题的不同方式。他们建议,与其强迫机器人每走一步前都写一段长篇大论,不如让它先快速检查一系列可能的移动选项,并从中选出最佳的一个。他们将这个新系统称为 VerNav。其核心思想是用快速的验证过程取代缓慢的、逐步生成的思维过程。该系统不再要求机器人的大脑从零开始发明一条新路径,而是向其展示一组可用的方向——例如“前进”、“左转”或“停止”——并要求大脑只需对每一个选项回答“是”或“否”。这使得机器人能够一次性评估所有选项,而不是一个接一个地评估。通过这种方式,该系统将决策所需的时间缩短到传统方法的十分之一以上,同时仍能让机器人在正确的路径上行驶。

然而,仅仅快速检查选项是不够的。研究人员发现,如果他们只使用这种快速检查方法,机器人会变得困惑并犯错,尤其是在棘手的场景中。快速检查器擅长排除坏主意,但在面对看起来非常相似的选项时,它有时难以选出那个唯一的最佳主意。为了解决这个问题,团队增加了一个智能安全网。他们构建了一个监测机器人置信度的系统。如果机器人确定该往哪走,它就坚持使用快速检查方法。但如果机器人感到不确定——即通过可能选项之间的高水平混乱程度来体现——系统就会暂停,并请求一个更强大、更缓慢的思考引擎来提供一份简短且集中的情况摘要。这份摘要作为一个快速提示,帮助快速检查器做出正确的判断。这样一来,机器人只在绝对需要时才调用缓慢且昂贵的思考能力,从而保持了整个过程的快速与高效。

为了确保这种快速检查系统在导航中确实有效,研究人员必须教会它如何正确判断移动。他们开发了一个两步训练过程。首先,他们教系统识别哪些即时移动优于其他移动,帮助它学会偏好那些能让它更接近目标的动作。然后,他们让系统练习完整的路径导航,不仅奖励它到达最终目的地,还奖励每一个取得进展的小步骤。这种训练确保了快速检查器不仅仅是随机选择移动,而是学会了如何在长距离内准确遵循指令。在标准导航任务集上进行测试时,这个新系统的表现与使用沉重、缓慢思考能力的现有顶尖机器人一样出色,但它做出决策的时间仅为后者的极小部分。结果表明,通过快速检查选项并在必要时才调用深度思考,机器人可以在不迷路的情况下,更快地在复杂环境中进行导航。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →