想象一下,你正走在一个巨大的、陌生的办公楼里寻找“304号房间”。你有两种导航方式:
- “过度思考者”模式: 你在每一步都会停下来,掏出一本巨大的百科全书,阅读关于这条走廊的整整一页内容,分析墙壁的纹理,然后决定向左转还是向右转。这非常聪明,但极其耗时。当你决定转向时,你已经走过了那扇门。
- “直觉”模式: 你只是保持向前走,因为走廊看起来是直的。只有当你看到分叉路口或看起来令人困惑的标志时,你才会停下来思考。这很快且安全,但你可能会错过一些细微的线索,比如远处墙上一个小小的房间号码。
IROS 是一种结合了这两种方法的机器人导航系统。它的灵感来自于人类大脑的工作方式,即所谓的双过程理论(Dual Process Theory)。研究人员构建了一个拥有两个“大脑”协同工作的机器人:
IROS 的两个大脑
系统一:反射(快速直觉)
可以将其视为机器人的“自动驾驶”或“膝跳反应”。
- 它做什么: 它观察场景并提出简单的问题:“前方的路是直的吗?”“我的左侧有墙吗?”“我刚刚经过了一扇门吗?”
- 它是如何工作的: 它使用一个小型、快速的计算机程序(类似于快速扫视)来检查周围环境。如果走廊看起来与上次观察时一样,它就直接继续向前走。它不需要进行深度思考。
- 为什么它很棒: 它速度极快(不到一秒)。它处理了 5 씨 53% 的决策,这意味着机器人大部分时间都在平稳巡航,而不需要停下来沉思。
系统二:思考者(慢速推理)
这是机器人的“大脑”,或者是那个掏出百科全书的部分。
- 它做什么: 当系统一感到困惑时,它就会介入。例如,如果机器人看到了 T 型路口、一个无法辨认的房间号码标志,或者复杂的地图,系统一会说:“我不知道该怎么做,”并将任务移交给系统二。
- 它是如何工作的: 这个系统使用一个强大的 AI 模型(视觉语言模型),该模型可以阅读标志、理解语境并对路径进行推理。
- 代价: 这种“思考”需要很长时间(在实验中约为 16 秒)。如果机器人每走一步都使用这个系统,它就会变得太慢而无法投入使用。
核心秘诀:“增强”(Augmentation)
研究人员注意到,小型、快速的计算机(例如机器人上的计算机)在独立阅读标志或理解三维空间方面表现并不理想。它们可能会看到模糊的标志并做出错误的判断。
为了解决这个问题,IROS 给“思考者”(系统二)提供了一份“小抄”。在机器人开始行走之前,它利用快速的“反射”系统执行以下操作:
- 扫描文本: 它使用工具读取房间号码和标志(OCR),并将它们记录下来。
- 绘制空间图: 它确定机器人相对于地板、墙壁和门的相对位置。
当机器人最终需要进行深度思考时,它展示给 AI 的不仅仅是一张图片,还有一份带有“小抄”的图片,上面写着:“嘿,左侧有一个 304 号房间的标志,且地面是畅通的。”这有助于慢速 AI 更频繁地做出正确的决策。
结果:速度 vs. 智能
团队在五种不同的真实建筑(大学、办公室和住宅)中测试了该机器人。结果如下:
- 速度: 使用 IROS 的机器人比尝试每一步都使用“思考者”的机器人快了 66%。它显著减少了总行程时间,因为它不会在直行走廊上浪费时间去“思考”。
- 成功率: 一个只使用“思考者”(没有快速反射系统)的机器人大约有一半的时间会迷路或无法到达目的地(成功率为 48%)。使用 IROS 后,成功率跃升至 64%。
- 效率: “反射”系统处理了超过一半的决策,且是瞬间完成的。“思考者”仅在绝对必要时才会启动,从而节省了机器人的电池和处理能力。
总结
IROS 就像一位知道何时开启自动驾驶、何时接管方向盘的驾驶员。当道路笔直且畅通时,它使用自动驾驶(系统一)来节省能量和时间。但一旦看到复杂的交叉路口或令人困惑的标志,它就会切换到全神贯注状态(系统二)来做出最佳决策。通过这种方式,它实现了两全其美:既拥有反射的速度,又具备人类的智慧。
技术摘要:IROS —— 一种用于实时 VLM 驱动室内导航的双过程架构
1. 问题陈述
室内移动机器人导航面临着语义推理与实时响应能力之间的根本权衡。
- 几何方法(如 SLAM): 提供可靠的定位和低延迟,但缺乏理解以人类为中心的语义线索(例如:房间号、标牌、公告栏)的能力,而这些线索对于复杂的室内推理至关重要。
- 视觉-语言-动作(VLA)模型: 提供语义落地能力,但本质上是反应式的,仅基于当前帧做出决策。它们难以进行长程推理,或根据远处的文本线索推断未观察到的目标。
- 视觉语言模型(VLM): 拥有广泛的世界知识和上下文推理能力,能够对目标和部分观测空间进行推理。然而,其高计算延迟使其不适用于在嵌入式硬件(如 NVIDIA Jetson)上的连续、实时操作。持续的 VLM 推理会产生“思考停顿”,从而损害安全性并影响用户体验。
现有解决方案无法同时提供 VLM 的深度上下文推理能力以及在动态环境中进行安全物理操作所需的亚秒级响应能力。
2. 方法论:IROS 架构
作者提出了 IROS,一种受认知科学中双过程理论(Dual Process Theory)启发的实时导航框架。IROS 将导航解耦为两个不同的路径:系统一(System One)(快速、反射式感知)和系统二(System Two)(慢速、审慎式推理)。该系统完全在低成本、设备端的硬件上运行,无需外部连接。
系统一:快速感知(反射式)
系统一处理即时的、低歧义性的决策,以确保实时响应。
- 关键帧比较(Key Frame Compare, KFC): 一种轻量级的门控机制,利用补丁级嵌入(来自 SigLIP 等视觉编码器)来检测结构性变化(例如:转角、交叉口),而非全局语义变化。它仅在视觉场景发生实质性变化时才触发系统二,从而避免在诸如直行走廊等静态环境中的冗余推理。
- 空间与文本增强: 为了补偿紧凑型 VLM 空间意识有限的问题,系统一采用了以下技术:
- 分割(SegFormer-b0): 检测消失点并将场景划分为导航区域(前、左、右、下),以生成结构化的空间描述符。
- OCR(docTR): 提取标准视觉编码器可能遗漏的远处文本线索(房间号、标牌)。
- 条件匹配: 系统将当前的结构化描述符与预计算的**“条件-动作表”(Condition-to-Action Table)**进行对比,使用余弦相似度进行计算。
- 如果识别出唯一的动作(例如:“前进”),则立即执行。
- 如果场景具有歧义(匹配到零个或多个动作),则将决策提升至系统二。
- 到达目的地检查: 验证目标文本是否与当前视图匹配,以声明到达。
系统二:审慎推理(认知式)
系统二作为认知核心,仅在系统一无法确定唯一动作或需要更深层语义理解时被调用。
- 离线条件-动作生成: 在初始化时,VLM(例如 Gemma3 4B)分析起始位置和目标描述,以“推测性地推断”潜在的环境条件及相应的动作,从而生成系统一所使用的“条件-动作表”。
- 实时追加思考: 当发生升级时,系统二接收目标、当前图像以及来自系统一的增强型空间/文本描述符。
- 提示词工程: VLM 受限于最大 Token 预算(例如 150 个 token),并使用**逻辑值处理(logit processing)**在接近限制时抑制非动作 token,从而强制实现及时的输出。
- 回退机制: 如果 VLM 未能生成动作,系统会恢复键值缓存(key-value cache)并恢复生成过程,以确保以最小延迟完成动作。
执行模块
一个有限状态机负责执行所选动作(前进、左转/右转、转向)。它利用消失点(VP)追踪器将机器人的光学中心引导至目标方向,确保精确的 360° 机动。
3. 核心贡献
- 双过程导航架构: 一种解耦的系统,将快速感知(系统一)与审慎推理(系统二)分离。这保留了 VLM 的语义智能,同时通过仅在必要时调用 VLM 来确保实时响应。
- 高效的条件推理: 关键帧比较和视觉-条件匹配模块的设计使得 VLM 推理仅在环境发生显著变化时触发,显著降低了延迟。
- 空间与文本信息增强: 该框架通过显式的空间描述符(源自几何分割)和文本线索(通过 OCR)来增强紧凑型 VLM 的提示词,解决了小型设备端模型的空间意识局限。
- 端到端现实世界实现: 该系统在配备 NVIDIA Jetson Orin NX 的移动机器人上实现,并在五个不同的现实世界室内环境中进行了评估,展示了具备类人水平的决策能力和低延迟特性。
4. 实验结果
评估在测试机器人上跨五个环境(三个大学建筑、一个办公综合体、一个住宅楼)进行,共计 120 个回合(2,455 米视频)。
- 延迟降低: 与连续 VLM 驱动的导航相比,IROS 将平均行驶时间减少了 66%。
- 决策准确率:
- IROS 实现了 90.2% 的决策准确率,显著优于仅使用 VLM 的基准方案(47.5%)。
- 添加空间与文本信息增强功能后,VLM 的机动决策准确率从 48.2% 提升至 64.3%。
- 系统效率:
- 系统一处理了 53.6% 的所有导航决策,且具有亚秒级延迟(0.7–0.9s)。
- 系统二仅在复杂或存在歧义的情况下被调用,其延迟与标准 VLM 推理相当(约 20s),但其调用频率被降至最低。
- 切换机制: 系统一在约 72% 的情况下能正确识别何时应委托给系统二。它在必要转向的情况下具有 100% 的召回率(从未在关键时刻未能成功委托),尽管其表现较为保守,偶尔会将可处理的情况(假阳性)也委托给系统二以确保安全。
- 模型容量: 实验表明,4B 参数模型(Gemma3)是实现可靠导航推理的最低可行容量;更小的模型(如 1.1B 的 TinyLLaVA)无法生成有效的决策。
5. 重要性与主张
论文声称 IROS 成功弥合了 VLM 的推理能力与实际机器人导航的严格实时需求之间的鸿沟。通过采用双过程架构,该系统使机器人能够“像人类一样思考”(利用快速反射处理常规任务,利用慢速审慎处理复杂任务),且不会牺牲安全性或速度。
作者强调:
- 借助廉价的设备端硬件,可以实现鲁棒、低延迟的 VLM 驱动导航,且不会牺牲决策质量。
- 仅仅缩小模型规模是不够的;需要一种系统级的架构重构,将感知与推理分离,才能克服计算瓶颈。
- 所提出的框架是迈向**通用具身智能(General Embodied AI)**的一步,通过结合轻量化感知与重型语义推理的互补优势,使机器人能够在以人类为中心的环境中安全高效地运行。
论文最后谦虚地指出,虽然 IROS 实现了鲁棒导航,但未来仍需研究如何集成针对动态环境的显式避障机制(如通过深度感知或强化学习),并将该双过程设计扩展到操作任务中。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。