想象一下,一个机器人正试图在一座它从未见过的房子里寻找路径,仅凭一句语音指令进行引导,比如“走到厨房,在蓝色椅子处左转,然后停下”。这就是视觉-语言导航(vision-and-language navigation)所面临的挑战。机器人必须观察周围环境,理解人类的话语,并决定下一步确切的移动方向。长期以来,研究人员一直试图通过给机器人一个强大的大脑来解决这个问题,让它在每一步行动前都进行自我对话。在做出动作之前,机器人会生成一段长长的思维流,解释其推理过程、检查周围环境并规划下一步转向。虽然这种显性的思考有助于机器人理解复杂的指令,但它的速度极其缓慢。就像一个每走一步都要自言自语的人会比直接走路的人慢得多一样,一个在每一步行动前都要生成一段完整推理的机器人,在做决策时会耗费过多的时间。在现实世界中,速度至关重要,这种延迟使得这项技术变得不切实际。
来自电子科技大学的研究团队提出了一种看待该问题的不同方式。他们建议,与其强迫机器人每走一步前都写一段长篇大论,不如让它先快速检查一系列可能的移动选项,并从中选出最佳的一个。他们将这个新系统称为 VerNav。其核心思想是用快速的验证过程取代缓慢的、逐步生成的思维过程。该系统不再要求机器人的大脑从零开始发明一条新路径,而是向其展示一组可用的方向——例如“前进”、“左转”或“停止”——并要求大脑只需对每一个选项回答“是”或“否”。这使得机器人能够一次性评估所有选项,而不是一个接一个地评估。通过这种方式,该系统将决策所需的时间缩短到传统方法的十分之一以上,同时仍能让机器人在正确的路径上行驶。
然而,仅仅快速检查选项是不够的。研究人员发现,如果他们只使用这种快速检查方法,机器人会变得困惑并犯错,尤其是在棘手的场景中。快速检查器擅长排除坏主意,但在面对看起来非常相似的选项时,它有时难以选出那个唯一的最佳主意。为了解决这个问题,团队增加了一个智能安全网。他们构建了一个监测机器人置信度的系统。如果机器人确定该往哪走,它就坚持使用快速检查方法。但如果机器人感到不确定——即通过可能选项之间的高水平混乱程度来体现——系统就会暂停,并请求一个更强大、更缓慢的思考引擎来提供一份简短且集中的情况摘要。这份摘要作为一个快速提示,帮助快速检查器做出正确的判断。这样一来,机器人只在绝对需要时才调用缓慢且昂贵的思考能力,从而保持了整个过程的快速与高效。
为了确保这种快速检查系统在导航中确实有效,研究人员必须教会它如何正确判断移动。他们开发了一个两步训练过程。首先,他们教系统识别哪些即时移动优于其他移动,帮助它学会偏好那些能让它更接近目标的动作。然后,他们让系统练习完整的路径导航,不仅奖励它到达最终目的地,还奖励每一个取得进展的小步骤。这种训练确保了快速检查器不仅仅是随机选择移动,而是学会了如何在长距离内准确遵循指令。在标准导航任务集上进行测试时,这个新系统的表现与使用沉重、缓慢思考能力的现有顶尖机器人一样出色,但它做出决策的时间仅为后者的极小部分。结果表明,通过快速检查选项并在必要时才调用深度思考,机器人可以在不迷路的情况下,更快地在复杂环境中进行导航。
技术摘要:VerNav
问题陈述
视觉-语言导航(Vision-and-Language Navigation, VLN)要求具身智能体能够遵循自然语言指令,在未见的 3D 环境中进行穿行。虽然最近基于大语言模型(LLM)的方法利用显式推理(例如思维链,Chain-of-Thought)来增强指令理解和语义接地能力,但它们面临着显著的决策阶段延迟问题。这种延迟源于在每个导航步骤中进行自回归生成会累积大量时间,其中许多过程是冗余的(例如重复输入重述或通用的格式化)。本文解决的核心挑战在于:如何在调用高成本生成式推理时,仅在决策不确定时才进行调用,从而维持一条低延迟的决策路径。
方法论
作者提出了 VerNav,一个旨在最小化延迟并保持导航性能的“验证器优先”(verifier-first)框架。该系统由三个核心组件组成:
验证器优先动作接口(Verifier-First Action Interface):
VerNav 不采用自回归地生成推理和动作,而是采用动作评分验证器。在每个时间步,系统构建一组批处理查询,为每个可执行的候选动作生成一个查询。验证器以指令、导航历史和视觉观测(转换为文本)为条件,输出一个二进制的“是”或“否”得分(logit),指示该动作是否有助于完成任务。具有最高“是”得分的动作被选中。这种批处理验证取代了逐步生成,大幅降低了推理时间。
基于熵的协作框架(Entropy-Based Collaboration Framework):
为了弥补原始验证与全量生成之间的性能差距,VerNav 引入了一个自适应生成器,仅在验证器不确定时,生成紧凑的状态证据(总结视觉-语义线索和路径进度)。
- 触发机制: 系统计算验证器候选动作得分的归一化熵。高熵表示验证器在候选动作之间缺乏明确的偏好(通常发生在复杂状态或智能体偏离路径时)。
- 自适应流程: 如果熵超过阈值,则调用自适应生成器以生成状态证据(zt)。该证据被反馈到验证查询中进行重新评分。如果熵较低,系统则沿用原有的仅验证器路径,避免不必要的生成。
两阶段验证器对齐(Two-Stage Verifier Alignment):
为了确保验证器的评分与导航偏好一致,作者提出了一个两阶段训练方案:
- 静态对齐(验证器偏好优化 - VPO): 受直接偏好优化(D法,DPO)启发,此阶段在同一决策上下文中的“被选”与“被拒”动作对上训练验证器。它鼓励验证器为遵循标注路径或从偏差中恢复的动作分配更高的分数。
- 动态精炼(步级强化微调 - RFT): 由于导航是一个长程任务,静态对齐是不够的。此阶段利用稠密的步级奖励,在策略诱导的展开(rollouts)上优化验证器。奖励基于局部进度(例如:减少与目标的距离、发现新地标),并惩罚冗余循环(重复访问视点),同时结合了回合级的成功优势。
核心贡献
- 验证器优先的低延迟接口: 将 VLN 动作选择形式化为对可执行候选动作的批处理验证,提供了一个比自回归生成快几个数量级的决策路径。
- 基于熵的协作: 一种协调验证器与自适应生成器的机制,仅在处理高熵(不确定)决策时调用生成器以提供紧凑的状态证据。
- 静态与动态验证器对齐: 一个结合了用于局部动作偏好对齐的 VPO 和用于动态轨迹级优化的步级强化微调的训练流水线。
- 效率-性能评估: 通过实验证明,该框架在实现竞争性导航性能的同时,显著降低了延迟。
实验结果
实验在 R2R 基准测试(val-seen 和 val-unseen 分割集)上使用 Qwen2.5-3B 作为骨干网络进行。
- 延迟降低: VerNav 的验证器优先决策路径实现了平均每步 0.08 秒 的决策阶段延迟。这代表了相比于代表性的自回归 LLM 导航方法(如 NavCoT 为 0.98s,NavGPT 为 3.52s,DiscussNav 为 21.13s)实现了 >10 倍的缩减。
- 导航性能:
- 在 R2R val-unseen 上,经过 VPO 和 RFT 训练的 VerNav 模型实现了 39.63% 的成功率(SR)和 34.13% 的路径长度加权成功率(SPL)。这一性能与最先进的 LLM 智能体(如 NavCoT: 40.23% SR; NavGPT: 34% SR)相当。
- 在 R2R val-seen 上,该模型实现了 43.10% 的 SR。
- 组件分析:
- 训练影响: 从原始验证器(0.38% SR)到 VPO(37.25% SR),再到加入 RFT(39.63% SR),证明了两阶段对齐的必要性。
- 自适应生成: 分析表明,熵触发机制成功地将生成器调用集中在困难轨迹上(失败的路径表现出更高的熵和更多的调用)。为这些不确定步骤添加状态证据,相比于仅验证器路径,使 SR 提升了 6.0–8.0 个百分点。
意义
本文声称 VerNav 为低延迟 LLM 导航提供了一条切实可行的路径。通过将决策接口与全量自回归生成解耦,它证明了高性能导航并不一定需要昂贵的逐步推理。相反,一种由熵触发的、选择性证据生成的验证器优先方法,结合专门的对齐训练,可以以极低的计算开销实现具有竞争力的结果。这挑战了“显式的、逐步的推理生成对于有效的 VLN 是必需的”这一普遍假设,表明基于验证的选择是一种可行且高效的替代方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。