← 最新论文
💻 computer science

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

该论文介绍了 ZeroSplat,这是一个无需训练且零特征的框架,它通过利用多视图几何约束将 2D 视觉-语言模型先验提升至 3D 空间,解决了现有方法的局限性,从而实现了对 3D 高斯泼溅(3D Gaussian Splatting)中任意数量目标的泛化指代分割。

原作者: Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正拿着一部神奇的相机,它捕捉的不只是平面的照片,而是整个房间的3D景象,就像空间中漂浮着的一团由微小的、发光的尘埃组成的云朵。这就是 3D 高斯泼溅(3D Gaussian Splatting) 的世界——一种全新的构建 3D 场景的方式,它们如此清晰且快速,甚至可以实时查看。但在很长一段时间里,这些 3D 场景对语言是“盲目”的;你无法告诉计算机,“给我看那把红色的椅子”,而让它理解你的意思。研究人员曾试图通过教计算机阅读文本并指向物体来修复这个问题,但他们遇到了障碍:旧的方法就像一个刻板的图书管理员,一次只能找到一本特定的书。如果你问“所有的红椅子”或者“不要任何椅子”,这位管理员就会感到困惑或崩溃。这篇论文切入了这一空白,提出了一个简单而强大的问题:我们能否教会我们的 3D 场景去理解复杂的、混乱的人类指令,即那些可能同时要求寻找零个、一个或一堆东西的指令?

这篇论文的作者称他们的工具为 ZeroSplat,他们说答案是肯定的,而且他们并没有进行通常需要的那种沉重且昂贵的训练。他们认为,旧的方法之所以从根本上存在缺陷,是因为它们试图通过观察物体的 2D 图像来理解 3D 物体,就像试图通过观察雕塑的影子来理解雕塑本身。这使得计算机变得缓慢且耗费内存,需要为每一个场景存储海量的数据。ZeroSplat 颠覆了这种做法。它没有为每个房间训练一个新的大脑,而是使用了一个巧妙的技巧:它利用了一个聪明的、预训练好的“视觉-语言模型”(一个已经知道如何将文字与图像匹配的超级智能 AI),并通过几何学将其理解直接投影到这些 3D 尘埃上。

你可以这样理解:想象你有一个装满了漂浮气球的房间(3D 场景)。你想找到“蓝色的气球”。旧的方法就像是在花费数小时研究房间后,在每一个气球上画上标签。ZeroS到不同的是,它更像是一个聪明的向导,他看了几张房间的照片,弄清楚了蓝色气球在哪里,然后立即使用激光笔在 3D 空间中标记出实际的漂浮气球。如果你问“不要气球”,他只会说:“好的,无需标记任何东西。”如果你问“蓝色的和红色的气球”,他会同时标记两者。最棒的是,这位向导不需要提前记住这个房间;他只需利用自己现有的知识和房间的几何结构,就能即时搞定一切。

该论文引入了一个新的挑战,称为 广义指代 3D 高斯泼溅(Generalized Referring 3D Gaussian Splatting, GR3DGS)。这是一个高级术语,对应一个简单的概念:一个能够处理任意数量目标的系统。它可以根据你输入的句子,找到零个项目(如果你寻找的东西并不存在)、一个项目或一组项目。为了证明这一点,团队构建了两个新的测试集,GR-LERFGR-ScanNet,它们就像是充满了刁钻指令的障碍赛场,用以测试计算机是否真的能理解“所有的红椅子”或“空旷的空间”这类指令。

当测试 ZeroSplat 时,结果令人印象深刻。在这些测试中,ZeroSplat 的表现显著优于之前的最佳方法。当其他系统在区分多个物体时感到吃力,或被复杂的句子搞混时,ZeroSplat 却能精准定位它需要寻找的 3D 点。例如,在一个测试集中,它达到了 50.8 分(以 mIoU 衡量),而次优方法仅达到 23.8 分。在另一个测试中,它达到了 41.2,击败了得分 24.5 的亚军。论文指出,这种成功归功于两个主要技巧:首先,使用智能 AI 来挑选最适合分析场景的照片(这样就不会在无聊的平面墙壁上浪费时间);其次,使用一种“空间扩散”过程来填补空白,确保物体的 3D 形状是稳固且完整的,而不仅仅是散乱的点云。

至关重要的是,论文反对“需要为每个新场景花费数小时进行训练”或“存储大量额外数据”的观点。他们明确排除了对“单场景优化”和“重度语义特征”的需求。相反,ZeroSplat 是“无需训练(training-free)”且“零特征(zero-feature)”的,这意味着它无需先学习场景即可立即投入使用。它是一个“即插即用”的解决方案,可以在单块显卡上高效运行,仅占用约 10 GB 的内存,这远低于许多其他方法所需的 20–28 GB

作者还测试了 ZeroSplat 在更简单任务上的表现,比如仅仅寻找一个物体或按类别寻找物体,它依然表现出色,甚至击败了一些专门为此类任务设计的模型。这表明,他们的这种方法不仅仅是一个“一招鲜”的工具,而是一种理解 3D 空间的鲁棒方式。然而,论文也谨慎地指出,虽然结果很强,但它们是基于特定的数据集和他们创建的模拟环境得出的。他们并不声称解决了宇宙中的所有问题,但他们展示了一条清晰的路径,让 3D 场景能够真正理解人类语言——无论你是想找一个东西、很多东西,还是什么都不找。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →