想象一下,你正试图利用一系列从不同角度拍摄的二维照片,构建一个完美的房间三维模型。你拥有一个超级智能的 AI 助手(类似于"Segment Anything"),它可以查看每张照片,并勾勒出它看到的每个物体的轮廓。
问题所在:“困惑的艺术家”困境
问题在于,你的 AI 助手有点不一致。
- 在照片 A中,它用红色轮廓勾勒出一张咖啡桌,并将其标记为“物体 #1"。
- 在照片 B(从不同角度拍摄)中,它用蓝色轮廓勾勒出同一张咖啡桌,却将其标记为“物体 #5"。
- 在照片 C中,它甚至可能将桌子分割成两部分,或者完全漏掉它。
如果你试图将这些照片拼合在一起形成三维模型,计算机会感到困惑。它认为“物体 #1"和“物体 #5"是两个不同的东西,或者在桌子本应存在的地方留下了空隙。以往的方法试图通过充当视频追踪器来解决这个问题,假设相机从一个照片到下一个照片是平滑移动的。但如果照片是从非常不同的角度拍摄的(稀疏视角),或者存在两把相同的椅子,追踪器就会迷失方向并将它们混淆。
解决方案:Gaga(三维图书管理员)
这篇论文介绍了Gaga,这是一个新系统,它通过利用“三维感知记忆库”来解决这种混乱。将 Gaga 想象为一位超级有条理的图书管理员,她不仅查看照片,还查看构成场景的实际三维构建块(称为高斯点)。
以下是 Gaga 的工作原理,分步说明:
- 构建三维骨架:首先,Gaga 利用照片构建场景的粗略三维模型。该模型由数百万个微小的、模糊的三维点(高斯点)组成,这些点代表了空气、墙壁和物体。
- “谁拥有这个?”检查:当 AI 在照片中用二维轮廓勾勒出一把椅子时,Gaga 会问:“哪些三维点实际上位于这个轮廓内部?”
- 记忆库:Gaga 维护一份列表(记忆库),记录哪些三维点属于哪个物体。
- 如果新轮廓内的三维点与记忆库中“椅子”组已有的点大部分匹配,Gaga 会说:“啊,这是同一把椅子!让我们给它分配相同的 ID 编号。”
- 如果这些点与任何现有组都不匹配,Gaga 就会为它们创建一个新组。
- 深度引导(安全网):有时,二维轮廓可能会意外包含背景物体(例如椅子后面的墙壁)。Gaga 使用深度检查(类似于雷达)来过滤掉距离过远的点,确保它只将属于前景物体的点进行分组。
为何这意义重大
- 一致性:因为 Gaga 对实际的三维点进行分组,所以无论你看哪张照片,咖啡桌始终是“物体 #1"。它解决了“红色轮廓与蓝色轮廓”的混淆问题。
- 无需平滑视频:与以往需要相机像视频一样平滑移动的方法不同,即使照片是从随机且相距甚远的角度拍摄的,Gaga 也能发挥作用。它不进行猜测,而是检查三维数学。
- 编辑变得简单:因为系统确切知道哪些三维点属于“坐垫”,哪些属于“沙发”,你可以轻松编辑场景。你可以告诉计算机:“将坐垫改为栗色”,它只会更改坐垫的特定点,而保持沙发的其余部分不变。以往的方法经常意外地给整个脚凳或附近的沙发着色,因为它们无法区分它们。
简而言之
Gaga 就像一位翻译,它将混乱、不一致的二维绘图,利用世界的三维结构,组织成一个单一、连贯的故事。它确保三维场景中的每个物体都有一个真实的身份,从而使人们能够以高精度理解和编辑复杂的三维世界。
技术摘要:Gaga:通过 3D 感知记忆库对任意高斯进行分组
问题陈述
有效的开放世界 3D 分割对于场景理解与操作至关重要。尽管零样本 2D 类无关分割模型(如 SAM、EntitySeg)已取得显著进展,但将这些模型扩展至 3D 场景面临一个根本性挑战:多视图图像间的掩码标签不一致。由于 2D 模型独立处理每个视图,同一物体在不同视图中可能获得不同的掩码 ID。将这些不一致的掩码直接提升至 3D,会导致模糊且碎片化的分割结果。
现有解决方案试图通过以下方式解决此问题:
- 对比学习:学习 3D 高斯的特征向量以对其进行聚类。然而,这些方法通常无法为跨视图的分割组分配唯一且一致的掩码 ID。
- 视频目标跟踪:将多视图图像视为视频序列以跟踪物体。该方法依赖于视图连续且变化微小的假设,这在稀疏输入、相机姿态变化显著或存在相似/遮挡物体的真实场景中往往失效。
方法:Gaga
Gaga 提出了一种框架,通过新颖的3D 感知记忆库利用不一致的 2D 掩码来重建和分割开放世界 3D 场景。该方法无需假设视图连续变化,也无需用户干预。
1. 场景重建与初始掩码生成
- 3D 重建:流程首先利用**高斯泼溅(Gaussian Splatting)**技术,从一组带有姿态的 RGB 图像重建 3D 场景。
- 2D 掩码生成:开放世界分割模型(如 SAM、EntitySeg)为每个输入视图生成类无关的 2D 掩码。
2. 3D 感知记忆库与掩码关联
核心创新在于3D 感知记忆库,它基于几何重叠而非时间跟踪,对 3D 高斯进行分组,并为跨视图的 2D 掩码分配通用组 ID。
- 深度引导下的对应高斯:对于每个 2D 掩码,系统识别对应的 3D 高斯。为确保准确性并避免包含投影至掩码内但属于远处物体的背景高斯,该方法采用深度引导。它渲染深度图,利用四分位距(IQR)统计过滤异常值,并仅选择位于前景物体有效深度范围内的高斯。
- 基于高斯重叠的组 ID 分配:系统迭代构建记忆库:
- 对于新视图的掩码,计算该掩码对应的高斯集合 G(m) 与记忆库中现有组 Gi 之间的重叠度。
- 重叠度定义为共享高斯数量与掩码内总高斯数量的比率:Overlap(m,i)=#(G(m)∩Gi)/#G(m)。
- 若与现有组的重叠度超过阈值(0.1),则将该掩码分配给该组的 ID,并将非重叠的高斯加入该组。
- 若现有组均无足够重叠度,则创建新的组 ID。
- 此过程确保跨不同视图对应同一 3D 物体的掩码获得相同的通用 ID。
3. 身份编码与渲染
一旦建立了一致的组 ID,系统便为每个 3D 高斯学习一个身份编码(一个 16 维特征向量)。
- 监督:学习到的特征向量被泼溅至 2D 图像,并通过线性层和 SoftMax 解码以预测分割图。
- 损失:将预测图与由 3D 感知记忆库生成的伪真值掩码(包含一致组 ID)进行比较,使用交叉熵损失。
- 输出:训练好的模型可渲染多视图一致的分割掩码,并通过根据其身份编码选择高斯,实现 3D 场景操作(例如物体移除、颜色更改、平移)。
主要贡献
- 不一致 2D 掩码的框架:一种利用开放世界模型产生的不一致 2D 掩码来重建和分割 3D 场景的方法,无需用户引导。
- 3D 感知记忆库:一种新颖机制,通过基于 3D 几何重叠对 3D 高斯进行分类并对齐跨不同视图的 2D 掩码,从而解决掩码不一致问题,消除了对视频跟踪假设的需求。
- 通用性:该方法兼容任何 2D 类无关分割模型,有助于新视角图像和掩码的合成。
- 鲁棒性:在具有挑战性的场景中表现出有效性,包括稀疏输入视图和显著的相机姿态变化。
实验结果
论文在多个数据集(LERF-Mask、Replica、ScanNet、MipNeRF 360)上评估了 Gaga,并与包括 Gaussian Grouping、OmniSeg3D 和 LangSplat 在内的最先进方法进行了对比。
- 定量性能:
- 在LERF-Mask上,Gaga 取得了优于以往方法的 mIoU(92.3%)和 mBIoU(90.8%)。
- 在Replica 和 ScanNet上,无论 2D 分割骨干网络是 SAM 还是 EntitySeg,Gaga 在 IoU、精确率和召回率方面均 consistently 优于 Gaussian Grouping。
- 稀疏数据鲁棒性:当仅使用 5% 的数据进行训练时,Gaga 显著优于 Gaussian Grouping(例如,在 Replica 上使用 SAM 时,IoU 分别为 31.87% 对 21.76%),表现出对数据稀缺更强的抵抗力。
- 定性性能:
- 与对比学习和视频跟踪基线相比,Gaga 生成的多视图一致掩码具有更少的伪影、更少的空白区域以及更清晰的边界。
- 它成功处理了视频跟踪器失效的相似物体和遮挡情况(例如,错误识别相似沙发或在大幅相机移动中丢失物体)。
- 应用:论文展示了成功的场景操作任务,包括精确的物体移除、颜色更改(例如仅重新着色坐垫而不影响脚凳)以及物体平移,突显了 3D 分组的准确性。
意义与主张
作者声称,Gaga 解决了现有开放世界 3D 分割中的一个根本性局限:未能充分利用固有的 3D 场景信息来解决 2D 掩码不一致问题。通过从时间跟踪或对比学习转向通过 3D 感知记忆库进行的基于几何的跨视图掩码关联,Gaga 实现了:
- 真正的多视图一致性:在不假设视图连续变化的情况下,为不同相机姿态下的物体分配通用组 ID。
- 对稀疏性的鲁棒性:即使在视频跟踪失效的稀疏输入视图下也能保持性能。
- 实用价值:支持高质量的下游应用,如 3D 场景理解和精确的场景操作。
论文结论指出,这些进步使 Gaga 成为现实世界 3D 场景分割和编辑任务的稳健解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。