想象一下,你正在给一个机器人下达一个非常具体的、多步骤的指令来清理你的房子,但你从未向这个机器人展示过你的房子,你也无法提前教它如何完成这项特定的工作。
这个指令非常棘手:“清洁椅子或者沙发中的任意一个,然后 打开电视。”
这对机器人来说很难,因为它必须同时解决两个问题:
- 顺序问题: 在它清洁完一件家具之前,它不能打开电视。
- 选择问题: 它不知道椅子还是沙发离得更近,所以它需要足够聪明,能够挑选更容易的一个以节省时间。
目前的多数机器人就像是拿着一张只显示一个目的地的地图的游客。它们能找到一把椅子,但如果要求它们执行带有规则的序列任务,它们就会感到困惑。
这篇论文介绍了一种名为 ViTL(视觉-语言时序逻辑导航)的新系统,它通过两个巧妙的技巧解决了这个问题。
1. “交通警察”(任务层面)
把机器人的大脑想象成内部有一个交通警察。
- 问题: 如果你只是让标准的 AI(比如聊天机器人)来规划路线,它可能会在执行到一半时感到困惑。它可能会说:“好的,我先去电视机那里!”从而违反了必须先清洁某物的规则。
- ViTL 的解决方案: 在机器人开始移动之前,ViTL 会将你那句凌乱的英文句子转化为一套严格的、不可逾越的规则,称为线性时序逻辑 (LDT)。
- 想象一下将你的句子转化为一个流程图或一个棋盘游戏地图。
- 这个地图有检查点。除非你经过“椅子”或“沙发”,否则你无法从“起点”移动到“电视机”。
- 它是如何工作的: 机器人使用一个确定性有限状态自动机 (DFA)。把它想象成一个数字游戏板。
- 随着机器人的探索,它会更新这个游戏板。如果它看到附近有一张沙发,那么通往沙发的“路径”就会亮起绿灯(它成为了最容易进行的下一步)。
- 如果机器人试图过早地前往电视机,游戏板会说:“不,你现在还不能去那里。”
- 这确保了机器人绝不会违反规则,无论它看到了什么。
2. “带有方向感的闪光灯”(导航层面)
一旦交通警察说“去找沙发”,机器人就需要在一个黑暗且未知的房间里找到它。
- 旧方法: 以前的机器人使用的是一种“闪光灯”,它只能对整个房间提供一种模糊的“温暖感觉”。这就像是在说:“沙发可能在这个方向的某个地方,”但信号很模糊,并没有告诉机器人具体要转向哪个方向。
- ViTL 的解决方案: 他们引入了一个方向得分。
- 想象机器人看着房间,并在它可能采取的每条路径(边界)上画出小箭头。
- 它询问它的“视觉-语言大脑”(一个理解图像和文字的模型):“如果我沿着箭头 A 走,我找到沙发的可能性有多大?那么箭头 B 呢?”
- 它为每个箭头都给出了一个具体的得分。
- 这创建了一个详细且平滑的“热力图”,机器人可以清晰地看到最热、最有希望的路径,而不是在黑暗中瞎猜。
结果
他们在虚拟 3D 世界(Habitat-Matterport 3D)中测试了这个系统。
- 测试: 他们给了机器人复杂的指令,比如“椅子/沙发,然后电视”这个例子。
- 对比: 他们将 ViTL 与其他仅使用聊天机器人来规划步骤的机器人进行了对比。
- 胜出者: 其他机器人经常会感到困惑,要么违反规则(过早前往电视机),要么选择放弃。而 ViTL 凭借其严格的“交通警察”规则和“带有方向感的闪光灯”,能够更成功地完成任务,并且路径更短、更高效。
简而言之: ViTL 是一种机器人导航系统,它将你的语言规则转化为一套严格且不可逾越的游戏计划,并利用超强的方向感来寻找目标,使其能够在从未见过的房子里处理复杂的、多步骤的家务任务。
技术摘要:ViTL —— 基于视觉-语言模型与时序逻辑引导的零样本自然语言导航
1. 问题定义
本文旨在解决如何使自主移动机器人能够在未知环境中执行零样本长程自然语言导航任务的挑战。虽然近期的零样本目标导航(ObjectNav)方法可以利用视觉-语言模型(VLM)来寻找单一目标,但它们无法处理需要按特定时序执行多个子任务的复杂现实世界指令。
例如,“清理椅子或沙发,然后打开电视”这类指令涉及:
- 多个目标: 导航至不同的物体类别。
- 时序约束: 序列关系(如“然后”)和逻辑析取(如“或者/或者”)。
- 动态重规划: 在没有先验地图的情况下,根据实时发现的物体来调整执行顺序的需求。
作者将该问题定义为:基于自我中心(egocentric)RGB-D 观测结果确定一系列动作序列,以达到所有要求的目标,同时严格满足指令中隐含的时序和逻辑约束,且无需访问先验地图或进行特定任务的训练。
2. 方法论:ViTL 框架
ViTL(视觉-语言时序逻辑导航)在两个不同层级上运行:任务级规划器(Task-Level Planner)和导航级执行器(Navigation-Level Executor)。
A. 任务级规划器
规划器将高层自然语言转化为一种形式化结构,用以管理时序约束和动态重规划。
- 自然语言转 LTL: 大语言模型(LLM)被用于一次性离线查询,将自然语言指令编译为**线性时序逻辑(L-T L)**公式。该公式捕捉了目标类别及其时序关系(例如:序列化、析取)。
- 示例: “到达椅子或沙发,然后是电视”变为 ϕ=⋄((chair∨couch)∧⋄tv)。
- LTL 转确定性有限自动机(DFA): LTL 公式被编译为一个 DFA。DFA 的图结构代表了所有有效的执行顺序。
- 动态目标选择: 规划器维护已检测到(D)、已到达(R)和失败(B)的物体集合。它根据这些集合为 DFA 边分配权重:
- wdet(低权重)用于已检测到的目标。
- wfail(高权重)用于失败的目标。
- 默认权重(1.0)用于未检测到的目标。
- 重规划: 系统在加权 DFA 图上进行最短路径搜索。如果检测到新物体或某个目标失败,边权重会随之更新,规划器会立即选择新的最优子任务,从而实现通过机会性重排序来最小化行驶距离。
- 多通道价值图: 为了支持并行探索,系统为每个目标类别维护一个独立的价值图通道。当规划器切换目标时,相应的通道(该通道已包含先前探索中的空间知识)会被激活,从而防止冗余的重复探索。
B. 导航级执行器
执行器通过一种创新的**方向得分(Directional Score)**方法,引导机器人前往当前由规划器选定的目标。
- 方向评分: 不同于以往对整个视野赋予单一、与方向无关的分数的方法,ViTL 会在观测图像上为前沿方向(frontier directions)进行视觉标注。系统会查询 VLM 对每个前沿方向进行独立评分(例如:“方向 A、B、C 中,哪一个通向椅子?”)。
- 价值图构建:
- 时序融合: 前沿得分通过场景加权平均法与历史观测结果进行融合,为信息量丰富的视角赋予更高权重。
- 空间平滑: 离散的前沿得分通过基于角度的插值在视场角(FOV)锥体内进行插值,从而生成密集的、平滑的梯度价值图。
- 执行: 智能体从当前激活的价值图通道中选择得分最高的前沿方向,并使用预训练的 PointNav 策略向其导航。
3. 核心贡献
- ViTL 框架: 一个零样本框架,能够使机器人执行具有复杂时序约束的长程导航任务,弥补了单目标 ObjectNav 与多步逻辑规划之间的差距。
- 方向得分: 一种利用 VLM 生成空间变化导航价值图的新方法,相比于方向无关的基准方法,提高了单目标导航的准确性和效率。
- 形式化保证: 通过将 LTL 编译为 DFA,该系统能够提供满足时序约束的证明,并支持在发现新物体时进行动态重规划,从而避免了迭代式 LLM 规划中常见的推理错误。
4. 实验结果
实验在 Habitat-Matterport 3D (HM3D) 数据集(v2 验证集,2000 个回合)上进行。
- 单目标导航(导航层级): ViTL 实现了 54.1% 的成功率 (SR) 和 30.9 的 SPL,在不进行微调的情况下,使用开源 VLM(LLaVA-34B)超越或匹配了最先进的零样本方法(如 VLFM、InstructNav)。
- 任务级规划: 与迭代式 LLM 规划器基准相比:
- 在所有观测概率下,ViTL 实现了 100% 的任务完成率(假设 LTL 翻译正确),而 LLM 规划器仅为 88.3%。
- LLM 规划器经常违反时序约束(例如,在完成前提条件之前到达目标)或过早终止。ViTL 的 DFA 结构防止了这些错误。
- 在共同完成的回合中,ViTL 所需的探索尝试更少,且路径长度缩短了 15.31%。
- 翻译准确率: NL-to-LTL 翻译步骤达到了 95.3% 的准确率,表明该编译过程是可靠的,且不会成为瓶颈。
5. 重要性与主张
本文声称,ViTL 通过解决现有零样本系统无法处理具有时序约束的多目标任务这一局限性,代表了向前迈出的重要一步。其重要性在于:
- 解耦推理与执行: 使用单次离线 LLM 调用来生成形式化规范(LTL/DFA),而不是依赖于运行时反复进行易出错的 LLM 查询来进行规划。
- 鲁棒性: 基于 DFA 的控制器确保了时序约束永远不会被违反,这对于要求逻辑一致性的现实世界部署至关重要。
- 高效性: 方向得分和多通道价值图减少了冗余探索,使得系统比将每个子任务孤立对待的基准方法更高效。
作者指出,目前的框架假设子任务简化为“到达”某个物体。将 ViTL 扩展到处理更丰富的语义(如操作或交互)被确定为未来的研究方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。