✨ 要点🔬 技术摘要
机器人在建筑物内部移动时面临着一个根本性的挑战:它们将世界视为混乱的原始数据点集合。激光扫描仪可能会检测到成千上万个平面——墙壁、天花板和地板——但对机器而言,这些仅仅是没有意义的几何形状。为了有效地导航,机器人需要理解这些形状构成了一个房间,房间构成了楼层,而楼层属于一栋建筑。这种被称为“3D场景图”(3D Scene Graph)的心理地图,充当了原始感官输入与人类描述周围环境时使用的高层概念之间的桥梁。多年来,研究人员一直致力于教机器人如何自动构建这些地图。传统方法依赖于僵化的、手工编写的规则,只能识别像矩形房间这样简单的形状;而较新的基于学习的方法通常需要独立的系统来确定结构和物体的位置,这使得在大规模、多层环境中进行扩展变得十分困难。
现在,一组研究人员引入了一种新方法,允许机器人从底层开始构建这些复杂的、多层级的地图,从它们探测到的基础墙壁开始,逐步向上构建至整个建筑甚至城市。该系统并非使用分离的工具来猜测布局然后再放置房间,而是使用一个统一的过程,学习同时生成整个层级结构。该方法通过获取机器人看到的初始平面集合,并逐步增加新的语义层来实现。它会决定应该添加多少个新元素(例如一个新的房间或一个新的楼层),确定这些元素的名称,并精确计算它们在3D空间中的位置。这个过程是循序渐进的,系统通过不断完善其推测,直到完整的地图构建完成。
研究人员在多种环境下测试了该系统,包括计算机生成的合成场景、真实的建筑平面图,以及由配备激光传感器的机器人记录的实际数据。他们将这种新方法与依赖固定规则或针对不同任务使用不同模型的现有技术进行了对比。结果表明,他们的统一方法生成的地图在准确性和完整性上始终优于以往的方法。它成功处理了并非完美矩形的复杂布局,并且能够生成一直延伸到城市层级的地图,而早期的基于学习的系统无法完成这项任务。事实上,在涉及整个建筑和城市的最高复杂度数据集上,该系统的表现甚至超过了一个拥有“秘密优势”的强大单次生成模型——即在开始生成地图之前就已经预先知道了房间和楼层的确切数量。
这项工作的最显著特征之一是它如何处理现实世界的不确定性。在典型场景中,机器人在开始探索之前并不知道一栋建筑中有多少房间或楼层。旧的方法往往在这方面表现挣扎,因为它们要求预先知道地图的最终规模。然而,新系统学会了如何自主决定地图何时结束。它会不断添加新的结构层,直到它判定不再需要更多信息为止,从而在构建地图的过程中有效地弄清环境的规模。这种能力使该技术在现实世界的机器人领域中更具实用性,因为在现实中,建筑物的规模和复杂程度很少是预先已知的。
为了确保其系统的有效性,研究人员开发了一种衡量成功的新方法。他们不仅仅是检查机器人是否找对了房间数量,而是创建了一个评估生成的地图在形状、位置以及不同部分之间的关系方面与真实情况匹配程度的指标。这种结合了几何距离与结构相似性的新测量工具证实,该系统生成的地图在接近真实情况的程度上显著高于其他方法。该团队还将他们的数据和代码公开,为其他科学家在此基础上开展工作提供了基础。通过证明单一的统一模型可以学习生成复杂的、多层级的空间层级结构,这项研究为开发能够真正理解并能在复杂的现实世界结构中导航的机器人提供了一条充满前景的路径。
技术摘要:通过自回归扩散生成高层级概念的 3D 场景图
问题陈述 室内 3D 场景图(3DSGs)是环境的紧凑表示,将低层几何原语(例如,传感器检测到的平面)与高层度量-语义概念(例如,墙壁、房间、楼层、建筑)连接起来。虽然现有方法可以生成观测节点之间的关系,但如何从低层观测推断出完整的、多层级的空间层次结构仍然是一个开放性挑战。经典方法依赖于针对特定概念类的手工设计启发式算法(例如,基于占据图的房间分割),这限制了其向新类别或复杂层次结构的扩展性。相反,基于学习的方法通常采用独立的模型来处理图结构和空间节点特征(例如,质心),或者仅限于一到两个层次。这些局限性阻碍了生成跨越楼层、建筑和城市等复杂多层级层次结构的完整过程,且无需进行特设定义。
方法论 作者提出了一种统一的、基于自回归扩散的图生成模型,该模型通过联合学习结构与特征,从观测到的垂直平面自底向上构建完整的 3DSGs。该方法基于 FLexible Autoregressive Graph Generation (FLAGG) 框架,该框架通过迭代扩展初始的观测平面图来扩展图结构。
在每个步骤 t t t 的生成过程中包含三个模块化组件:
插入 (Insertion): 一个带有边信息的图同构网络 (GINE) 用于预测下一个待添加节点块的大小 (m t m_t m t )。
填充 (Fill): 一个单次生成模型根据当前图的状态,采样新节点块的连通性(边)、语义标签和连续几何属性(质心)。作者实现并对比了该模块的两种变体:
OURS-FD4: 适配距离与离散去噪扩散模型 (D4)。它首先使用离散扩散模型 (DiGress) 采样拓扑结构和标签,然后采样新边上的成对距离,最后通过多维尺度分析 (MDS) 恢复 3D 质心。
OURS-MIDI: 适配混合图与 3D 去噪扩散 (MiDi) 模型。它在以条件图为中心的坐标系中,利用等变图 Transformer 联合去噪类别标签、边和连续坐标。
停止 (Halt): 一个 GINE 预测一个二进制信号,以决定生成过程应当停止还是进入下一次迭代。
为了解决曝光偏差问题(即在推理过程中,模型依赖于自身生成的噪声预测而非真实值),作者在训练期间采用了噪声增强 (noise augmentation) 技术。这包括对先前生成的高层节点进行标签和位置的扰动,并随机丢弃或插入边,同时保护初始的观测平面节点。
在评估方面,本文引入了一种 融合 Gromov–Wasserstein (FGW) 距离的适配版本。该指标综合考虑了关系保真度(通过图结构的 Gromov-Wasserstein 距离)和度量-语义保真度(通过质心和标签等节点特征的 Wasserstein 距离),为与真实值进行图层级的比较提供了原则性的衡量标准。
核心贡献
首个自回归扩散 3DSG 模型: 本文提出了第一个能够基于机器人观测平面图生成多层级层次结构的自回归扩散深度图生成 (DGG) 模型,消除了对特定概念手工规则的需求。
统一的结构与特征生成: 不同于以往将结构预测与属性生成分离的方法,该模型能够在任意层次深度下联合生成图拓扑、语义标签和 3D 质心。
新型评估指标: 作者提出了一种专门用于评估层次化 3DSG 生成的 FGW 距离适配版本,能够同时捕捉关系、语义和度量的一致性。
全面的基准测试: 本研究利用源自合成场景、公开建筑平面图 (MSD) 和真实机器人传感器数据的多样化数据集建立了新的基准,涵盖了不同的布局复杂度和层次深度(最高达城市级)。数据集和代码已公开发布。
实验结果 模型在涵盖从单层楼到整个城市的不同层次深度的合成、MSD 和真实世界数据集上进行了评估。
性能对比基线: 所提方法(OURS-FD4 和 OURS-MIDI)在所有非预知 (non-oracle) 基线(包括手工设计启发式算法 EC-□, EC-L 以及随机猜测基线 RAND)中表现一致优于它们。在所有数据集上,其在 FGW 及其组成部分(用于结构的 GW 和用于度量-语义距离的 W)方面均有提升。
性能对比单次生成预知模型 (One-Shot Oracle): 当与获得目标图规模预知访问权限的最先进单次生成模型 (MiDi) 进行对比时,自回归方法依然保持了竞争力。值得注意的是,在最大规模层次(M-C,城市级)和真实单层数据(R-F)上,自回归模型超越了具备预知能力的单次生成模型,这表明随着结构复杂度的增加,预先获知图规模带来的收益会逐渐减小。
鲁棒性: 基于距离的变体 (OURS-FD4) 在从训练数据迁移到真实机器人记录的环境时,比基于坐标的变体 (OURS-MIDI) 表现出更强的鲁棒性,这表明通过相对于现有图的成对距离来约束新质心有助于提高泛化能力。
意义与主张 本文声称解决了从低层观测推断完整多层级空间层次结构的问题,且无需依赖特设算法。通过在自回归框架下统一结构与特征生成,该方法实现了复杂环境(楼层、建筑、城市)的可扩展 3DSG 构建,而这些环境此前是学习类方法无法触及的。作者认为,该模型通过提供一致的高层结构表示,有助于下游机器人应用(如 SLAM、全局定位和路径规划)。此外,作者指出 FGW 指标为评估生成图与真实图之间的整体相似性提供了一个平衡的指标,解决了该领域缺乏原则性评估方法的问题。研究结论指出,尽管误差累积是自底向上方法的局限性,但所提方法成功地将 3DSG 生成的范畴扩展到了前两个层次级以上。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。