← 最新论文
🤖 machine learning

Generation of High-Level Concepts in 3D Scene Graphs via Autoregressive Diffusion

本文提出了一种统一的自回归扩散模型,该模型通过联合学习图结构与空间特征,从观测到的几何原语中生成完整的层次化室内三维场景图,其性能在多种数据集上均优于现有基准模型,并引入了一种全新的融合格罗莫夫-瓦瑟斯坦度量(Fused Gromov-Wasserstein metric)用于原则性评估。

原作者: Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos, Jose Luis Sanchez-Lopez, Luciano Serafini

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos, Jose Luis Sanchez-Lopez, Luciano Serafini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人在建筑物内部移动时面临着一个根本性的挑战:它们将世界视为混乱的原始数据点集合。激光扫描仪可能会检测到成千上万个平面——墙壁、天花板和地板——但对机器而言,这些仅仅是没有意义的几何形状。为了有效地导航,机器人需要理解这些形状构成了一个房间,房间构成了楼层,而楼层属于一栋建筑。这种被称为“3D场景图”(3D Scene Graph)的心理地图,充当了原始感官输入与人类描述周围环境时使用的高层概念之间的桥梁。多年来,研究人员一直致力于教机器人如何自动构建这些地图。传统方法依赖于僵化的、手工编写的规则,只能识别像矩形房间这样简单的形状;而较新的基于学习的方法通常需要独立的系统来确定结构和物体的位置,这使得在大规模、多层环境中进行扩展变得十分困难。

现在,一组研究人员引入了一种新方法,允许机器人从底层开始构建这些复杂的、多层级的地图,从它们探测到的基础墙壁开始,逐步向上构建至整个建筑甚至城市。该系统并非使用分离的工具来猜测布局然后再放置房间,而是使用一个统一的过程,学习同时生成整个层级结构。该方法通过获取机器人看到的初始平面集合,并逐步增加新的语义层来实现。它会决定应该添加多少个新元素(例如一个新的房间或一个新的楼层),确定这些元素的名称,并精确计算它们在3D空间中的位置。这个过程是循序渐进的,系统通过不断完善其推测,直到完整的地图构建完成。

研究人员在多种环境下测试了该系统,包括计算机生成的合成场景、真实的建筑平面图,以及由配备激光传感器的机器人记录的实际数据。他们将这种新方法与依赖固定规则或针对不同任务使用不同模型的现有技术进行了对比。结果表明,他们的统一方法生成的地图在准确性和完整性上始终优于以往的方法。它成功处理了并非完美矩形的复杂布局,并且能够生成一直延伸到城市层级的地图,而早期的基于学习的系统无法完成这项任务。事实上,在涉及整个建筑和城市的最高复杂度数据集上,该系统的表现甚至超过了一个拥有“秘密优势”的强大单次生成模型——即在开始生成地图之前就已经预先知道了房间和楼层的确切数量。

这项工作的最显著特征之一是它如何处理现实世界的不确定性。在典型场景中,机器人在开始探索之前并不知道一栋建筑中有多少房间或楼层。旧的方法往往在这方面表现挣扎,因为它们要求预先知道地图的最终规模。然而,新系统学会了如何自主决定地图何时结束。它会不断添加新的结构层,直到它判定不再需要更多信息为止,从而在构建地图的过程中有效地弄清环境的规模。这种能力使该技术在现实世界的机器人领域中更具实用性,因为在现实中,建筑物的规模和复杂程度很少是预先已知的。

为了确保其系统的有效性,研究人员开发了一种衡量成功的新方法。他们不仅仅是检查机器人是否找对了房间数量,而是创建了一个评估生成的地图在形状、位置以及不同部分之间的关系方面与真实情况匹配程度的指标。这种结合了几何距离与结构相似性的新测量工具证实,该系统生成的地图在接近真实情况的程度上显著高于其他方法。该团队还将他们的数据和代码公开,为其他科学家在此基础上开展工作提供了基础。通过证明单一的统一模型可以学习生成复杂的、多层级的空间层级结构,这项研究为开发能够真正理解并能在复杂的现实世界结构中导航的机器人提供了一条充满前景的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →