想象一下,你正在教一个机器人如何在全新的房子里导航。你给它一个简单的指令:“去厨房,右转,然后在沙发旁停下。”这就是**视觉-语言导航(Vision-and-Language Navigation, VLN)**的世界。这是机器人领域的一个分支,其中智能体必须理解人类的语言和视觉线索,才能在一个它从未见过的3D空间中移动。长期以来,机器人需要通过在成千上万个特定的房子中进行训练来学习如何移动,这意味着如果你把它们带到另一栋建筑,它们就会迷路。但最近,我们开发了“大型视觉语言模型”(Large Vision-Language Models, VLMs)——这些超级聪明的AI大脑已经可以在不需要为每个任务重新训练的情况下,理解图片和文字。科学家们面临的大问题是:我们如何将这个聪明的脑子与机器人的腿连接起来?我们如何让AI决定究竟在哪里迈步,而不至于在现实世界混乱且连续的状态中感到困惑?
这正是 AgenticNav 这篇论文发挥作用的地方。作者认为,过去将AI连接到机器人上的方式,就像是给驾驶员一张地图,上面只能从三条预设好的道路中进行选择。如果目的地不在那三条路之一,驾驶员就会陷入僵局。新方法 AgenticNav 彻底改变了游戏规则。它不再强迫机器人从有限的预设动作列表中进行选择,而是给了AI一套它可以在需要时随时调用的“工具”。把AI想象成侦探游戏中的侦探:游戏不再强迫侦探在“向左走”、“向右走”或“直走”之间做出选择,而是可以让侦探说:“我需要检查墙上那个特定像素的深度,”或者“给我看我走过的路径图,”或者“我想直接走向我看到的那个椅子。”
该论文介绍了一个名为 AgenticNav 的系统,它充当了这些聪明AI大脑的“束缚器”或控制面板。研究人员发现,通过给AI三个特定的工具,即使没有任何额外训练,它也能比以前更好地在未见过的环境中导航。第一个工具是动作工具(Action Tool)。AI不再是从一小组建议的位置中进行选择,而是可以直接指向摄像头视野中的任何像素并说:“去那里。”随后,系统会进行数学计算,将该像素转化为一条安全的行走路径。第二个工具是深度工具(Depth Tool)。有时AI需要知道某个物体到底有多远。与其向AI展示一个巨大且令人困惑的3D深度图,这个工具可以让AI询问:“这个特定位置的墙离我有多远?”并得到一个精确的数值。第三个工具是记忆工具(Memory Tool)。当机器人行走时,它会构建一个精简的地图。如果机器人感到困惑或需要记住之前看到的某个标志,它可以要求系统“回溯”那个特定的时刻,而不是试图记住整个旅程的每一帧画面,否则会使它的“大脑”过载。
作者在名为 R2R-CE(使用 Habitat 模拟器)的计算机模拟环境以及一台真实的机器人上测试了这个系统。真实世界的验证涉及 30 个特定的片段,涵盖了实验室、办公室和户外庭院场景,重点测试了阅读标牌、远程导航和精确到达目标等任务。他们发现,当使用强大的AI大脑(GPT-5.5)时,他们的新方法在到达目标的成功率上达到了 55%,这比之前表现最好的方法(SmartWay,仅为 44%)有了显著提升。在效率方面(即如何在成功与路径长度之间取得平衡),他们从 35.04% 提升到了 48.41%。论文指出,瓶颈不仅在于AI大脑本身有多聪明,更在于我们如何赋予它与世界互动的工具。通过让AI选择自己的目标并请求特定的信息,它在导航现实世界(即使是它从未造访过的地方)时变得更加强大。研究人员还指出,这种方法适用于不同类型的AI大脑,这表明这种“工具调用”风格是让机器人真正理解并穿梭于我们复杂世界的一种极具前景的途径。
技术摘要:AgenticNav
问题陈述
连续环境中的零样本视觉语言导航(VLN-CE)旨在使智能体能够在不依赖预定义导航图或特定任务训练的情况下,遵循自然语言指令在未见的 3D 场景中进行导航。虽然大型视觉语言模型(VLM)已使零样本推理成为可能,但现有的最先进方法(如 Open-Nav、SmartWay、EvoNav)在 VLM 与环境的接口方面面临三个关键瓶颈:
- 受限的动作空间: 当前的方法依赖于学习到的路标点预测器(waypoint predictors),该预测器仅提出少量且固定的可导航候选点。如果指令相关的地点不在预测器的输出范围内,这会限制 VLM 选择相关位置的能力。
- 深度利用效率低下: 尽管可以使用深度数据,但这些数据通常作为原始输入提供,或者隐藏在路标点预测器中。这阻碍了 VLM 获取用于特定空间推理任务(例如比较障碍物的距离)的精确度量距离。
- 内存管理低效: 现有方法要么累积长文本/视觉历史(引入无关上下文并分散模型注意力),要么检索跨回合(cross-episode)经验(这违反了严格的零样本假设,因为依赖了先前的回合数据)。
方法论:AgenticNav
作者提出了 AgenticNav,这是一个轻量级的导航框架,它将零样本 VLN-CE 重新定义为一个智能体工具调用过程(agentic tool-calling process)。AgenticNav 不再强迫 VLM 从预计算的路标点中进行选择,也不再让其解析密集的深度图,而是向 VLM 暴露了三个特定的、具有地面实感的工具,供其按需调用:
1. 动作工具(像素级选择)
- 机制: VLM 直接在 RGB 观测图像中选择一个目标像素 (u,v),而不是从预测的路标点列表中进行选择。
- 执行: 框架通过深度反投影(depth unprojection)和相机标定,将此 2D 像素选择转换为 3D 可执行运动 (θ,ρ)。
- 安全性: 在执行之前,通过确定性的安全检查验证路径是否无障碍物(使用人体高度点过滤),并确保深度值有效。如果目标不安全,该工具将返回
Reselect(重新选择)信号,提示 VLM 再次进行选择。
- 收益: 这消除了对训练好的路标点预测器的依赖,允许 VLM 导航至任何可见且可达的位置。
2. 深度工具(按需度量查询)
- 机制: VLM 无法直接获取完整的深度图,但可以对一批特定的像素调用
query_depth(P)。
- 输出: 该工具返回度量深度值、局部深度统计数据(来自 5×5 邻域的最小值、平均值、中位数)以及动作预览(估计的偏航角和前进距离)。
- 收益: 这使得 VLM 能够进行针对性的空间比较(例如,“门口是否比障碍物更近?”),而无需承担解析完整深度图像的认知负荷,仅在需要时提供精确的局部证据。
3. 智能体记忆与回溯工具
- 机制: 系统维护一个总结轨迹的紧凑型**地图图像(Map Image)**和一个受限的过去观测缓存。
- 回溯: 当 VLM 判定需要来自过去决策点的视觉细节时,它会调用
recall(p, k) 来检索特定的缓存 RGB 图像。
- 收益: 这确保了上下文窗口仅随任务相关信息增长,避免了无关历史帧的累积,同时保持了严格的单回合零样本设置(不进行跨回合数据检索)。
核心贡献
- 智能体工具调用框架: 本文引入了 AgenticNav,它将 VLM 与环境的接口重新构思为工具调用过程,消除了对学习型路标点预测器的需求。
- 智能体深度接口: 一种允许 VLM 在精确位置请求度量深度的创新机制,事实证明,相比于原始深度输入或基于路标点的代理,该机制在空间推理方面更为有效。
- 选择性记忆机制: 一种结合了紧凑轨迹图与选择性回溯工具的混合记忆系统,显著改善了长程决策能力,同时避免了上下文膨胀。
- 达到最先进性能(SOTA): 该方法在 R2R-CE 基准测试上实现了新的零样本 VLN-CE SOTA 结果,证明了框架设计与 VLM 主干模型本身同样重要。
实验结果
模拟实验 (R2R-CE Val Unseen)
在不进行策略训练的标准 100 回合协议下进行评估:
- 性能: 使用 GPT-5.5 作为主干模型,AgenticNav 实现了 55% 的成功率 (SR) 和 48.41% 的路径长度加权成功率 (SPL)。
- 对比: 与使用相同主干模型的 SmartWay 复现版本相比,AgenticNav 在 SR 上提升了 11 个百分点,在 SPL 上提升了 13.37 个百分点。
- 泛化性: 使用 Gemini-2.5-Pro 时,AgenticNav 在相同基准下也超越了 Open-Nav 和 EvoNav,证实了该方法并不绑定于单一的 VLM。
- 消融实验:
- 移除动作工具(回归到路标点预测器)导致 SR 下降了 5 个百分点。
- 移除深度工具导致 SR 下降至 42%;仅仅将深度图像作为输入只能部分恢复损失,这凸显了结构化查询的价值。
- 移除选择性回溯机制导致 SR 下降至 41%,证明了针对性记忆检索优于仅使用静态地图的价值。
现实世界验证
部署在配备 RGB-D 相机的四轮机器人在实验室、办公室和庭院环境中进行测试:
- AgenticNav (4-view) 实现了 46.7% 的 SR 和 2.67m 的导航误差 (NE),显著优于 SmartWay (23.3% SR, 3.57m NE)。
- 定性分析显示,当 SmartWay 的路标点预测器无法提出正确方向时,AgenticNav 能够成功处理;同时,它能有效地利用深度工具来把握转向时机,并利用回溯工具来维持长程约束。
意义与主张
本文认为,对于基于基础模型的导航而言,动作、感知和记忆框架的设计与 VLM 本身的选择同样重要。
- 范式转变: 零样本 VLN-CE 的限制因素不再仅仅是模型的推理能力,而是模型如何与环境建立接地(grounded)联系。
- 零样本完整性: 通过避免学习型预测器和跨回合记忆,AgenticNav 维持了严格的单回合零样本设置,使其在处理不存在先验训练数据的全新场景时更加鲁棒。
- 高效性: 工具调用接口允许 VLM 决定何时检查什么证据(深度、记忆)以及向何处移动,在最大限度释放模型推理自由度的同时,保持了确定性的安全检查。
作者得出结论,虽然 VLM 的决策质量仍然是失败的主要来源(约占模拟失败原因的 89%),但 AgenticNav 框架通过提供一个直接、具备地面感且连续的物理世界接口,成功释放了基础模型的潜力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。