← 最新论文
⚡ electrical engineering

SparseGS: Sparse View Synthesis using 3D Gaussian Splatting

SparseGS 是一个高效的训练流水线,通过集成深度先验、新型渲染技术和正则化模块来增强用于稀疏视图合成的 3D 高斯泼溅(3D Gaussian Splatting),从而减轻诸如漂浮物和背景塌陷等伪影,使得在仅有 3 到 12 张输入图像的情况下也能实现高质量的实时重建。

原作者: Haolin Xiong, Sairisheek Muttukuru, Hanyuan Xiao, Rishi Upadhyay, Pradyumna Chari, Yajie Zhao, Achuta Kadambi

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Haolin Xiong, Sairisheek Muttukuru, Hanyuan Xiao, Rishi Upadhyay, Pradyumna Chari, Yajie Zhao, Achuta Kadambi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅凭几张照片来构建一个房间的 3D 模型。如果你有从各个角度拍摄的数百张照片,确定墙壁、家具和人的位置会非常容易。但如果你只有十几张照片,甚至只有三张,这就会变成一场猜谜游戏。

这就是 SparseGS 这篇论文所解决的问题。它专注于一种流行的新技术——3D 高斯泼溅(3D Gaussian Splatting, 3DGS)。可以将 3DGS 想象成一位数字艺术家,他利用数百万个微小的、模糊的、有颜色的气球(高斯点)来构建一个场景。当你从正确的角度观察这个场景时,这些气球会融合在一起,看起来就像一张完美的照片。

然而,当艺术家只能根据几张照片进行创作时,他们会感到困惑。他们开始把气球放在错误的地方,从而产生两种主要的混乱:

  1. “漂浮物”(Floaters): 这些是悬浮在半空中的游离气球,就像不该存在的幽灵或尘埃。
  2. “背景坍塌”(Background Collapse): 当艺术家对深度判断错误时,会导致背景(如墙壁或天空)意外地漂浮到前景物体前面,使场景看起来像一个破碎的平面拼贴画。

SparseGS 是一套全新的规则和工具,旨在帮助艺术家即使在只有极少数照片(少至 3 张或 12 张)的情况下,也能构建出一个干净、准确的 3D 场景。以下是他们实现这一目标的方法,使用了简单的类比:

1. “最佳猜测” vs. “平均值”(深度渲染)

在原始方法中,艺术家通过计算视线方向上所有气球的平均值来计算物体的距离。如果有一些远离物体的“漂浮”气球,它们可能会将平均距离向后拉,导致艺术家误以为物体比实际位置更远。

SparseGS 引入了两种新的测量距离的方法:

  • 众数选择(Mode-Selection): 与其取平均值,艺术家直接选取单个最显著的气球(即具有最多“不透明度”或权重的一个)并认定:“这就是物体。”它忽略了后面那些微弱的、游离的气球。
  • Softmax 缩放(Softmax-Scaling): 这是一个聪明的折中方案。它主要听从最强气球的声音,但也允许较弱的气球传递一点点信息。这有助于艺术家在学习过程中不被噪声所迷惑。

2. “扩散侦探”(未见视角正则化)

当艺术家尝试想象他们从未在照片中见过的视角(即“新视角”)时,可能会产生奇怪的纹理或锯齿状边缘。

SparseGS 引入了一个 扩散模型(Diffusion Model)(类似于用于根据文本生成艺术图像的 AI)。你可以把它想象成一个“扩散侦探”:

  • 艺术家渲染出一个新视角。
  • 侦探观察它并说:“这看起来太嘈杂且不自然了。真实的照片不会看起来像静电噪声。”
  • 侦探会轻轻地引导艺术家,在保持实际物体锐利边缘的同时,抹平那些奇怪的噪声。这防止了场景看起来像个充满漏洞的游戏画面。

3. “时空穿梭”技巧(深度扭曲)

为了让艺术家学习那些尚未见过的角度,SparseGS 使用了一种叫做**深度扭曲(Depth Warping)**的技巧。

  • 想象一下,你拍了一张房间的照片,并利用已知的深度图(房间的 3D 草图)将这张照片在数字上向左或向右轻微地“弯曲”。
  • 这创造了来自艺术家尚未见过的角度的伪造新照片
  • 艺术家随后在这些伪造的照片上进行练习,学习即使在相机轻微移动时,也要保持背景的一致性。这防止了“背景坍塌”现象,即天空掉到了桌子前面。

4. “大扫除”(漂浮物修剪)

即便有了上述所有手段,仍可能有一些多余的气球卡在场景中。由于 3DGS 是由显式的气球组成的(而不是隐藏的黑盒),团队可以直接进去删除它们。

  • 他们会将“最佳猜测”距离(众数选择)与“平均”距离(Alpha 混合)进行比较。
  • 如果这两个数值不匹配,就说明有一个“漂浮物”正在干扰数学计算。
  • 他们会应用一个修剪掩模(Pruning Mask)(就像一个数字橡皮擦),找出并删除所有在错误位置漂浮的气球,只留下那些构成真实物体的气球。

结果

论文声称,通过将这四种工具结合使用,SparseGS 可以利用极少的照片(对于前向视角场景仅需 3 张,对于 360 度全景场景仅需 12 张)构建出高质量的 3D 场景。

  • 速度: 训练速度快,且可以实时渲染(你可以瞬间在 3D 模型中行走)。
  • 质量: 产生的图像更干净,比以往的方法产生的“幽灵”伪影更少。
  • 通用性: 它在“前向视角”场景(如一个人坐在书桌前)和“无界限” 360 度场景(如整个房间或风景)中表现均出色。

简而言之,SparseGS 教会了这位 3D 艺术家如何成为一名更好的侦探,通过更聪明的数学、AI 指导以及最后的清理小组,即使在仅有极少线索的情况下,也能构建出一个完美的 3D 世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →