想象一下,你正在用数百万个微小的、发光的半透明气球构建一个三维世界。这就是名为**3D 高斯泼溅(3D Gaussian Splatting)**的技术的工作原理。它在从任意角度生成房间或场景的逼真图像方面表现出色。然而,这里有一个问题:这些气球并不知道它们是什么。漂浮在椅子附近的气球不知道它属于“椅子”组,漂浮在桌子附近的气球也不知道它属于“桌子”。它们只是匿名的色彩与光斑。
这使得计算机难以以人类的方式理解场景(例如说“把椅子显示出来”)。以往的方法试图通过以下两种方式来解决这个问题:
- 给每个气球背上巨大的、沉重的背包,里面装着关于它是什么的复杂描述。这虽然有效,但速度缓慢且占用过多内存。
- 基于二维图片给气球涂上标签。但这很混乱。如果一个气球漂浮在空中(即“漂浮物”),却恰好与二维照片中的椅子对齐,它就会被错误地标记为椅子。当你稍后尝试只显示椅子时,那个漂浮的气球也会显现出来,破坏画面。
本文的作者OP2GS提出了一种巧妙的**“双重不透明度(Dual Opacity)”**概念来处理这一问题。
双重不透明度解决方案
想象每个三维气球都有两种不同的“透明度”,而不仅仅是一种:
- “外观”不透明度(σ):这是原始设置。它控制气球对视觉图像的贡献程度。当你观察场景时,这种不透明度决定了气球是否可见,从而使房间看起来逼真。
- “身份”不透明度(σ):这是新增的部分。它控制气球对*物体掩码(特定物体的轮廓)的贡献程度。
这里是魔法所在:
想象一个漂浮在空中的“漂浮物”气球,因为它在照片中恰好与椅子对齐,而被错误地标记为“椅子”的一部分。
- 在旧方法中,这个气球会是个问题。如果你尝试只显示椅子,这个气球就会出现,让椅子看起来像是多出了一段幽灵般的延伸。
- 在OP2GS中,系统学会关闭该气球针对椅子的**“身份不透明度”。当你寻找椅子的轮廓时,这个气球会变得不可见。然而,它的“外观不透明度”**保持开启,因此它仍然有助于让三维场景看起来美丽且逼真。
这就像一位穿着戏服的舞台演员。
- 外观不透明度:演员在舞台上可见,以便观众能看到演出。
- 身份不透明度:演员拥有一个特殊的开关。如果导演要求“国王”,演员就翻转开关。如果他们在扮演“士兵”,他们就保持可见。如果他们在扮演一个不应被计为角色的“幽灵”,他们就翻转开关,使其仅在导演要求显示“士兵”时变得不可见,但它们仍然在那里帮助灯光效果看起来更好。
如何教导气球
为了教导气球使用哪种“身份不透明度”,作者使用了一种**“随机物体损失(Random Object Loss)”**。
计算机不是试图一次性修复每一个气球(这太难了),而是在每个训练步骤中随机挑选几个物体(如“椅子”、“桌子”、“灯”)。它会问:“这个气球属于椅子吗?”
- 如果气球实际上是椅子的一部分,系统会增加其针对椅子的“身份不透明度”。
- 如果气球是一个错误(漂浮物或标记错误的碎片),系统会降低其针对该物体的“身份不透明度”,直到它对该特定物体变得透明。
这个过程反复进行,直到系统确切地学会哪些气球属于哪些物体,从而在不破坏视觉质量的情况下清理“噪声”。
结果:快速且干净
一旦气球经过训练:
- 无需沉重背包:系统不需要为每个气球存储巨大的数据文件。它只需要一个微小的数字(新的不透明度)和一个简单的 ID 标签。
- 超快:由于数据非常轻量,计算机可以极快地处理场景(约每秒 121 帧),这比那些试图解码沉重特征文件的其他方法快得多。
- 干净的掩码:当你要求计算机“显示椅子”时,它会绘制出清晰的轮廓,而不会出现那些烦人的漂浮伪影或幽灵般的延伸。
总结
本文介绍了OP2GS,一种赋予三维场景气球“秘密身份开关”的方法。这使得计算机能够将**“看起来好看”(渲染图像)的任务与“成为物体”**(分割形状)的任务分离开来。这解决了标签混乱和错误的问题,创建了一个更轻量、更快速的系统,并允许对三维场景进行即时、开放词汇的理解(例如要求查看“红色的杯子”或“木制的椅子”),而无需沉重的数据存储。
OP2GS 技术摘要:基于双不透明度的对象感知 3D 高斯原语
1. 问题陈述
3D 高斯泼溅(3DGS)为真实场景重建提供了一种高效、显式的表示方法,但缺乏固有的对象级身份标识。其原语由几何、颜色和透明度定义,未经修改便不适用于开放词汇场景理解等下游任务。现有方法试图通过两条主要途径注入对象级信息,但两者均存在显著局限性:
- 基于特征的方法: 这些方法将高维特征嵌入(例如来自 CLIP)蒸馏到高斯中。虽然有效,但它们带来了沉重的存储和解码开销,并且在 Alpha 合成后可能出现跨视图不一致的问题。
- 掩码提升方法: 这些方法通过多数投票或渲染权重过滤等启发式方法,将 2D 对象掩码(例如来自 SAM)投影到 3D 高斯场中。这里的一个关键失效模式是标签污染。由于 3DGS 使用柔和、半透明的原语,“漂浮”高斯(通常是致密化产生的伪影)或位于低整体透明度暗区的高斯可能会在射线方向上主导渲染权重。因此,这些漂浮物可能被错误地分配对象标签,从而污染分割掩码。一旦高斯被错误标记,标准方法就无法在降低视觉外观重建质量的情况下抑制其对对象掩码的贡献,因为两者都依赖于单一的不透明度场。
2. 方法论:OP2GS
作者提出了OP2GS,这是一种对象感知表示,它利用双不透明度公式将视觉重建与实例占用解耦。
表示法:
每个高斯原语都增加了两个额外的标量参数:
- 实例不透明度(σ∗): 一个专用于对象掩码渲染的不透明度场,充当一维实例占用场。
- 标量标签(l): 在初始化期间分配的整数对象 ID。
与以往将高维特征向量附加到每个高斯上的方法不同,OP2GS 使用紧凑的标量标签和单个标量 σ∗。
训练流程:
该方法采用两阶段训练策略:
- 阶段 1(标准 3DGS): 训练标准 3DGS 模型,直到致密化稳定。
- 阶段 2(实例学习):
- 初始化: 使用 SAM2 生成视图一致的实例掩码。将高斯中心投影到训练视图上,并通过多数投票分配标签(l)。
- 双不透明度渲染: 渲染过程被拆分。原始不透明度 σ 处理辐射(颜色)重建,而 σ∗ 处理实例占用。对于特定对象 j,渲染的实例图 Sj(v) 是通过累积属于对象 j 的高斯的 αi∗=σi∗G2Di(v) 来计算的,使用与颜色分支相同的透射率 Ti。
- 随机对象损失(Lobj): 为了优化 σ∗,引入了随机对象损失。在每次迭代中,采样一组对象子集。对于采样对象 j,在渲染的实例图 Sj(v) 和二值伪标签掩码 Bj 之间计算交叉熵损失。这鼓励属于该对象的高斯增加其 σ∗,同时将错误标记的高斯(漂浮物)的 σ∗ 抑制为零。
- 梯度路径: 来自图像重建损失(Lrgb)的梯度更新原始不透明度 σ、颜色 c 和几何结构。来自 Lobj 的梯度更新实例不透明度 σ∗ 和几何结构。这使得模型能够学习在掩码分支中将错误标记的高斯变为“透明”,同时在颜色分支中保持其“可见”,以保留场景保真度。
开放词汇分割:
OP2GS 不存储每个高斯的语言特征,而是执行对象嵌入聚合:
- 对学习到的实例占用场进行阈值处理,以在选定视图中创建二值对象掩码。
- 这些掩码充当“几何门”,从原始图像中裁剪出对象区域。
- 从这些裁剪区域中提取 CLIP 特征,并在多个视图上进行平均,为每个对象生成单个语义描述符。
- 通过将文本嵌入与这些聚合的对象描述符进行匹配,执行开放词汇查询。
3. 主要贡献
- 双不透明度表示: 引入实例不透明度 σ∗ 将视觉存在与实例占用解耦。这使得系统能够在不损害场景逼真重建的情况下,在对象掩码中抑制错误标记的高斯。
- 感知可见性的实例学习: 所提出的随机对象损失利用标准 3DGS 透射率机制优化实例占用场。这有效地解决了由漂浮物和模糊掩码提升引起的标签污染问题,通过学习将错误分配的实例不透明度归零来实现。
- 紧凑的开放词汇分割: 通过避免每个高斯的特征存储和解码,OP2GS 在显著降低计算开销的同时实现了具有竞争力的精度,实现了 121 FPS 的推理速度。
4. 实验结果
该方法在开放词汇基准测试上进行了评估,具体为3DOVS和LERF-Mask数据集。
- 精度: 在 3DOVS 数据集上,OP2GS 实现了97.1%的平均 mIoU,超过了之前的最佳结果(ObjectGS 为 96.4%)。在 LERF-Mask 数据集上,它在"figurines"场景上实现了92.3%的 mIoU,在"ramen"场景上实现了91.0%,在大多数情况下优于先前的方法。
- 效率: 与基于特征的方法相比,OP2GS 表现出更优越的推理速度。每个高斯仅增加 2 字节的额外数据(用于标签和 σ∗),它实现了121.7 FPS,显著快于 Gaussian Grouping(43.6 FPS)和 ObjectGS(78.6 FPS)。
- 消融实验: 实验证实双不透明度公式至关重要;仅使用多数投票标签和标准不透明度渲染的基线产生了显著较低的 mIoU(例如,在 3DOVS 上为 76.1% 对比 97.1%),这表明学习 σ∗ 对于实现视图稳定的对象分离是必不可少的。
5. 意义与主张
该论文声称,OP2GS 提供了一种紧凑且鲁棒的对象感知表示,成功解决了 3D 场景理解中精度与效率之间的权衡问题。通过重新定义包含专用实例占用场的高斯原语,该方法解决了直接掩码提升中固有的“标签污染”问题。作者强调,这种方法利用了 3DGS 物理一致的占用学习来处理启发式提升方法难以处理的可见性歧义(如漂浮物),同时保持了适合边缘设备和交互式应用的轻量级参数足迹。这项工作表明,3DGS 中的显式对象级推理不需要沉重的特征场,而是需要外观和实例属性的结构解耦。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。