想象一下,一个机器人正试图在一个凌乱的房间里寻找特定的物品,比如丢失的一串钥匙或一袋杂货。如果机器人试图以同样高强度的、微观层面的细节去检查房间里的每一个物体,那就像是为了找一本特定的书而去读遍图书馆里的每一行字一样。这会耗费太长时间,而且机器人在完成任务之前就会耗尽电量。
这篇论文介绍了一种名为 BiMoSG(双模态 3D 场景图)的新系统,它通过赋予机器人一个“快脑”和一个“慢脑”,来模仿人类的思考方式。
两种模式:快与慢
作者将机器人的思考过程比作心理学中著名的“系统 1”和“系统 2”思维:
“快”模式 (System 1):
- 工作原理: 这是机器人的默认设置。它快速扫描房间并创建一个粗略的、“粗粒度”的地图。它并不关心椅子的具体品牌或地毯的具体图案。相反,它将物体视为简单的形状(如盒子或棱柱),并给它们通用的名称,如“桌子”、“椅子”或“柜台”。
- 类比: 这就像在高速公路上开车。你不需要知道路过的每辆车的车牌号;你只需要知道那里有一辆车、一辆卡车或一棵树。你会瞬间看到世界的“大意”。
- 益处: 这种模式速度极快,且消耗极少的能量。它让机器人能够在不陷入细节纠缠的情况下进行移动和探索。
“慢”模式 (System 2):
- 工作原理: 只有当“快”模式发现有趣的东西时,这种模式才会启动。如果机器人正在寻找杂货,并且看到了一个可能是冰箱的东西,它就会切换到“慢”模式。它会放大观察,使用先进的 AI 来读取标签,并确定该物体的确切身份。
- 类比: 这就像是你把车停在路边,去阅读一个特定的路标或查看地图。你停止了整体的流动,转而专注于一个特定的细节。
- 益处: 这为机器人真正需要交互的特定物品提供了高准确度,而不会在无关紧要的事情上浪费时间。
“棱柱”捷径
为了让“快”模式更加高效,研究人员发明了一种新的 3D 物体表示方法。他们没有构建由数千个微小点组成的详细 3D 模型(这在计算上非常沉重),而是将物体表示为简单的棱柱(如纸箱)。
- 类比: 想象你在收拾行李箱。你不需要知道一件毛衣的确切曲线或一只鞋子的纹理。你只需要知道这件毛衣能装进一个特定尺寸的盒子里。机器人也是如此:它将复杂的家具转化为简单的几何方块。这使得计算物体的位置以及它们是否重叠变得更加容易,节省了大量的计算能力。
它们如何协同工作
该系统的设计旨在让机器人在 99% 的时间里处于“快”模式,即巡航移动并构建粗略地图。只有当发生“触发”事件时——例如机器人的通用地图显示:“嘿,这里有一个柜台,而任务是寻找食物”——它才会切换到“慢”模式。
一旦机器人切换到“慢”模式,它会确认该物体确实是一个柜台(而不是桌子),然后机器人就可以继续执行其任务。
结果显示了什么
论文声称,这种方法比目前那些试图时刻保持细节化的最先进方法快了三倍。
- 速度: 在测试中,“快”模式生成场景地图的时间约为每帧 0.1 秒,而其他方法则需要 0.4 秒。
- 成功率: 在测试中,机器人完成任务(如寻找垃圾桶或厨房岛台)的速度比使用仅有“慢”(详细)模式的机器人快得多,同时达到了同样的成功水平。
- 现实世界: 他们在一个模拟博物馆中使用真实的机器人(Clearpath Jackal)进行了测试。机器人成功利用“快”模式扫描房间,并利用“慢”模式将一个“背包”识别为可疑物体,证明了该方法在计算机模拟之外也是有效的。
核心结论
这篇论文认为,机器人并不需要时刻对所有事物都拥有完美的视觉。通过使用一种双模态方法——在大多数时候保持快速和概括,仅在必要时变得缓慢和详细——机器人可以更高效地在复杂的未知环境中导航,从而节省时间并延长电池寿命,同时仍能圆满完成任务。
技术摘要:BiMoSG —— 用于开集任务的双模态 3D 场景图
问题陈述
开集(Open-set)任务执行要求机器人在无需预先信息的情况下,能够在包含新颖物体的复杂环境中进行导航。虽然开词汇量 3D 场景图(利用 SAM、CLIP 和 LLaVa 等大型视觉基础模型)提供了鲁棒的实例分割和分类能力,但它们在移动机器人上的实时部署面临显著障碍。这些障碍包括基础模型的巨大计算需求、有限的边缘计算资源以及高昂的能耗,这些因素都会限制作业时间跨度。
本文认为,为整个任务过程生成高粒度的开词汇量场景图是不必要的。相反,机器人通常只需要粗粒度的语义信息来进行导航并确定一般功能,而将细粒度的、开词汇量的分析保留给可能包含任务相关物体的特定区域。这种方法模仿了人类认知的区别:即快速、直觉性的“系统 1”思维与缓慢、深思熟虑的“系统 2”思维。
方法论:BiMoSG
作者提出了 BiMoSG,一种双模态 3D 场景图生成框架,旨在根据任务上下文在“快速”(粗糙)模式和“慢速”(精细)模式之间进行无缝切换。
1. 双模态架构
- 快速模式(默认): 使用闭集词汇量设置运行,以生成粗糙的 3D 场景图。它依赖于用于分割的 Mask2Former(在 ADE20K-150 上训练)和一种新型的棱柱体体积表示法(prismatic volumetric representation)来处理物体。该模式避免了使用大型基础模型,从而大幅降低了计算和能耗成本。
- 慢速模式(按需): 当系统识别出与任务相关的区域或物体时触发。该模式采用开词汇量技术,利用视觉语言模型(VLM)如 SmolVLM2 和 LangSAM 来生成详细的开词汇量描述并精细化物体标签。
2. 棱柱体体积物体表示
为了在“快速”模式中实现高效,BiMoSG 引入了一种新型几何抽象:
- 系统不再处理密集的点云(点云计算成本高且对视角变化敏感),而是从分割掩码中提取物体轮廓。
- 这些轮廓被投影到世界坐标系中,进行去噪,并转换为由 XY 多边形(凸包或 Alpha Shape)和 Z 范围(zmin,zmax)定义的多边形棱柱体。
- 这种表示法显著降低了合并和去重时的计算复杂度(对于体素化点云为 O(n+m) 对比 O(n3)),并提高了在稀疏视角下的体积重叠匹配效率。
3. 基于邻域的物体关系
该框架通过基于邻域的方法构建层次化场景图:
- 可见性矩阵(Visibility Matrix): 追踪物体在同一帧中共同出现的频率。
- 层次化划分: 物体按“粗细”(体积的立方根)及相对于邻居的大小进行排序。通过构建有向无环图(DAG)来建立“邻域”(局部集群)和“区域”(房间级近似)的概念。
- 关系生成: 根据这些邻域内物体棱柱体的接近程度和相交情况,生成自然语言关系(如 ON、IN、BESIDE)。
4. LLM 规划器集成
大语言模型(LLM)规划器(具体为 GPT-4o)充当认知桥梁:
- 阶段 1(分解): 分析高层任务,生成针对闭集物体的“触发标签”。
- 阶段 2(监控): 监控场景图。如果触发标签与检测到的物体匹配,则调用
InspectAt(检查于)动作。
- 阶段 3(确认): VLM 精细化物体标签,LLM 在下游执行前确认该物体与任务的相关性。这可以防止由于视觉相似但上下文无关的物体导致的误报。
系统支持两种开集识别模式:
- 混合模式(Hybrid Mode): 使用 CLIP 嵌入处理闭集掩码,从而隐式地处理开集语义。
- 切换模式(Switching Mode): 当 LLM 请求详细调查时,显式切换到基于 VLM 的分割(LangSAM)。
核心贡献
- BiMoSG 框架: 一种新型 3D 场景图生成方法,通过在闭集(快速)和开集(慢速)模式之间动态切换,平衡了效率与语义丰富度。
- 棱柱体体积表示: 一种新型 3D 物体几何抽象,实现了快速合并与去重,相比基于点云的方法降低了计算复杂度。
- 基于邻域的层次结构: 一种基于可见性和相对大小建立物体关系及层次划分(邻域与区域)的新方法,促进了结构化推理。
- 性能验证: 实证结果表明,其“快速”模式比最先进的开词汇量方法(如 ConceptGraphs)快约 3 倍,同时保持了鲁棒性。
- 真实世界部署: 在博物馆环境中使用 Clearpath Jackal 机器人验证了该框架,展示了在无需预先建图的情况下成功执行任务(识别可疑物体)。
实验结果
- 计算效率: 在 RTX 4090 上,BiMoSG 的快速模式平均每帧处理时间为 0.1 秒,而 ConceptGraphs 为 0.4 秒,BBQ 为 0.2 秒。
- 几何精度: 在 Replica 数据集上的评估显示了可接受的几何精度,其平均真值覆盖率(Mean GT Coverage)约为 57%,线性 mIoU 约为 61%。较低的精度归因于分割伪影而非体积表示本身。
- 任务执行时间: 在 Habitat Matterport3D 模拟中,BiMoSG 在开集和闭集任务中均一致优于 Clio 基准。例如,在寻找键盘的开集任务中,BiMoSG 将执行时间从约 1:45(Clio)缩短至 2.13 秒,这主要是因为它避免了在任务完成前进行全环境建图。
- 收敛性: 在高层任务(如“我应该把冰淇淋放在哪里?”)中,系统实现了较高的收敛率(80–90%),并显著缩短了执行时间(例如,冰淇淋任务仅用 19 秒)。
意义与主张
本文声称,BiMoSG 通过模仿人类的认知效率,为开集任务执行提供了一种实时、节能的解决方案。通过默认使用粗糙的闭词汇量表示,并仅在必要时调用计算昂贵的开词汇量模型,该系统实现了:
- 场景图生成与任务执行的无缝集成。
- 在未知环境中进行鲁棒操作,无需预先建图。
- 相比纯开词汇量方法,显著缩短了任务执行时间,同时达到了相似的成功率。
作者总结道,这种双模态设计在实时机器人感知、导航和推理方面具有竞争力,有效地解决了移动机器人所需的速度与开集任务所需的语义深度之间的权衡问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。