想象一下,你正试图构建一个完美的 3D 房间模型,但你手里只有几张模糊的照片,而不是从各个角度拍摄的全套照片。这就是 稀疏视角 3D 高斯泼溅(Sparse-View 3D Gaussian Splatting, 3DGS) 面临的挑战。
在计算机图形学领域,“3DGS”是一种利用数百万个漂浮在空间中的微小、模糊的球体(高斯体)来构建场景的技术。当你从新的角度观察场景时,计算机通过融合这些球体来生成逼真的图像。
问题在于:如果你只给计算机几张照片,它就会感到困惑。 它会过度努力地去死记硬背这仅有的几张照片(这个问题被称为“过拟合”),导致模型在它看过的角度看起来很完美,但从任何新角度看都会变成模糊且充满瑕疵的混乱景象。
本文作者提出了一种新方法,教计算机如何利用这几张照片进行学习,而不至于陷入困惑。他们使用一种名为 费舍尔信息量(Fisher Information) 的数学工具作为“智能向导”,来解决两个主要问题。
以下是本文内容的解释,采用了简单的类比:
1. 问题:“空洞”与“随机”猜测
以往的方法尝试通过使用深度图(类似于 3D 雷达扫描)来创建伪地面真值(即生成的虚假训练照片)来辅助计算机。
- 旧方法: 想象一个学生试图通过只看一张照片来学习地图,并以此猜测地图的其他部分。他们可能会猜错,导致在应该有建筑的地方留下“空洞”。此外,他们可能会随机选择一个点来进行猜测,这会导致过程变得混乱且不可靠。
- 本文的解决方案(基于费舍尔信息的立体增强): 计算机不再进行随机猜测,而是扮演一名 聪明的侦探。它利用费舍尔信息量来询问:“我现有的这几张照片中,哪一张能为这个新视角提供最多的信息?”
- 它挑选出 最具信息量 的照片(即那些能提供最佳线索的照片)。
- 它结合来自多张照片的线索,来构建一张高质量的“伪造”照片进行学习。
- 结果: 计算机停止了随机猜测,开始从最优秀的示例中学习,从而准确地填补了那些“空洞”的部分。
2. 问题:“盲目”剪枝
为了防止计算机过于死板地记忆那几张照片,以往的方法使用了名为 Dropout 的技术。这就像一位老师随机擦掉学生作业中的一部分,以迫使他们更努力地思考。
- 旧方法: 老师 随机 擦除作业内容。
- 坏处之一: 有时,老师会擦掉学生 已经 理解得非常完美的题目(过度优化)。
- 坏处之二: 有时,老师却放任学生 还没理解 的部分不动(优化不足)。
- 这造成了一团糟:学生会感到困惑,因为他们在被测试已经掌握的内容,却在需要学习的地方被忽视了。
- 本文的解决方案(不确定性感知正则化): 现在的老师使用一张 智能计分卡(费舍尔信息量)来检查学生对每个特定知识点的掌握信心。
- 如果学生过于自信(过度优化):老师会轻轻地移除那部分作业,迫使他们重新检查自己的工作。
- 如果学生感到不确定(优化不足):老师会 保护 那部分内容,让他们继续练习直到掌握为止。
- “柔和”的处理方式: 老师不会完全删除作业的一部分(因为这会导致学生惊慌失措并开始胡乱猜测),而是仅仅将其 调暗 一些。这让学生的注意力保持在背景细节上,而不会感到压力过大。
宏观图景
把整个过程想象成是在用仅有的三份食谱来训练一位厨师:
- 旧方法: 厨师试图通过随机混合三份食谱中的食材来猜测新菜肴的味道。结果往往是一道味道怪异、咸苦交加的混乱菜肴。
- 新方法(本文方法):
- 厨师使用 智能向导 来判断哪份食谱能为新菜肴提供最好的线索(立体增强)。
- 厨师在练习时,有一位 智能教练 在旁密切观察。如果厨师切洋葱的技术已经完美了,教练会让其停止切洋葱,转而专注于酱汁;如果厨师在处理酱汁时遇到困难,教练会让他可以不受干扰地继续练习(不确定性感知正则化)。
最终结果:
通过使用这个“智能向导”(费舍尔信息量)来选择最佳训练示例,并决定精确的练习内容,计算机即使在只有少量照片的情况下,也能构建出一个视觉效果极其真实的 3D 模型。本文证明,在标准测试数据集上,该方法优于以往的任何方法。
技术摘要:利用费舍尔信息引导稀疏视角下的 3D 高斯泼溅
问题陈述
3D 高斯泼溅(3DGS)已成为新视角合成(NVS)领域的领先技术,与神经辐射场(NeRF)相比,它提供了实时渲染速度和高保真度。然而,3DGS 高度依赖密集的输入视角。在稀疏视角场景下(例如 3 到 9 张输入图像),由于几何和外观信息不足,模型会遭受严重的过拟合问题。这会导致明显的伪影、渲染质量下降以及对未见视角的泛化能力变差。
现有的缓解此类问题的方法通常分为两类:
- 基于先验的增强: 使用预训练模型(如深度估计器)来生成伪地面真值(pseudo ground truths)。然而,这些方法通常依赖于视角的随机采样或对单张训练视图进行变形,这无法充分利用立体几何先验,并会在增强数据中引入“空洞”区域。
- 正则化技术: 使用 Dropout 等方法来防止过拟合。然而,传统的 Dropout 对所有高斯函数应用统一的移除概率。这种缺乏选择性的做法可能会在移除欠优化高斯(例如代表遮挡区域的高斯)的同时,保留了过度优化的高斯,从而导致不稳定性以及诸如过度补偿之类的视觉伪影。
这两种方法都受到复合随机性的影响,引入了限制最终合成保真度的不确定性和不稳定性。
方法论
作者提出了一种利用**费舍尔信息(Fisher Information)**来定量引导数据增强和正则化的新颖框架,实现了从随机启发式向原则性选择的转变。该方法由两个核心组件组成:
1. 基于费舍尔信息的立体增强(SAFI)
为了解决“空洞与随机增强”的问题,SAFI 通过主动选择最具信息量的训练视图来策划高质量的伪地面真值。
- 视角采样: 通过扰动现有的训练相机位姿(在位置和方向上添加随机噪声)来采样一个新的视角。
- 信息量视角选择: 该方法并非随机选择支持视图或使用简单的欧几里得距离,而是采用源自费舍尔信息的信息增益(Information Gain, IG)。它计算当添加一个候选视图时模型不确定性的减少量。
- IG 通过 Hessian 矩阵的迹(由费舍尔信息导出)进行近似,以识别能够最大化相对于新视角在视觉相似性和几何约束方面的视图。
- 根据相对于最小 IG 的阈值选择一组支持视图,以确保多视图几何一致性。
- 伪地面真值策划: 使用预训练的深度模型(Depth-Anything-3),将选定的视图反投影为 3D 点云,并从新视角进行光栅化以创建高质量的伪地面真值图像。随后将该数据集整合到训练集中。
2. 不确定性感知正则化(UAR)
为了解决“缺乏选择性的正则化”问题,UAR 根据每个 3D 高斯函数的优化状态自适应地调整其 Dropout 概率。
- 不确定性量化: 该方法利用费舍尔信息矩阵计算每个高斯函数 Gi 的不确定性得分 Ui。较高的得分表示该高斯是欠优化的(扰动它对渲染影响很小),而较低的得分则表示它是过度优化的。
- 基于排名的选择性 Dropout: 高斯函数按不确定性进行排序。该方法优先移除过度优化的高斯(低不确定性),同时保留欠优化的高斯(高不确定性)。这确保了遮挡或训练不足的区域能够得到充分的优化。
- 软尺度 Dropout(Soft-scale Dropout): 与完全将所选高斯的透明度归零(导致射线穿透到遮挡区域并引发过度补偿)的传统 Dropout 不同,UAR 采用了软尺度策略。所选高斯的透明度通过衰减因子 λ∈(0,1) 进行缩放,而不是被完全移除。这保持了在光栅化中的软存在感,保护了遮挡的高斯函数免受错误更新的影响。
核心贡献
- SAFI 策略: 一种新型增强策略,利用费舍尔信息来选择用于策划伪地面真值的最具信息量的视图,从而最大限度地利用几何先验并减少数据增强中的随机性。
- UAR 策略: 一种不确定性感知正则化机制,能够定量测量每个 3D 高斯函数的优化状态,并自适应地调整 Dropout 概率,从而实现更稳定的优化和更高的渲染保真度。
- 软尺度 Dropout: 集成了软尺度 Dropout 机制,以防止在稀疏视角设置中与硬移除策略相关的过度补偿伪影。
实验结果
该方法在三个标准基准测试集上进行了评估:LLFF、Mip-NeRF 360 和 DTU,采用稀疏视角设置(LLFF/DTU 为 3、6 和 9 视图;Mip-NeRF 360 为 12 和 24 视图)。
- 定量性能: 所提方法在几乎所有指标(PSNR、SSIM、LPIPS)上均达到了最先进水平(SOTA)。
- 在 LLFF (3-view) 上,其 PSNR 比之前的最佳方法(DropGaussian)高出 0.36 dB。
- 在 DTU (3-view) 上,它实现了 22.44 dB 的 PSNR,显著优于基准方法如 3DGS (10.99 dB) 和 DropGaussian (21.44 dB)。
- 在 Mip-NeRF 360 (12-view) 上,其 PSNR 比之前的 SOTA 提升了 0.35 dB。
- 稳定性: 该方法显著降低了多次运行之间的 PSNR 标准差(例如,在增强对比中从 0.084 降至 0.027),证明了优化稳定性的提升。
- 定性结果: 视觉对比显示,与 CoR-GS 和 DropGaussian 等基准方法相比,该方法生成的视角伪影更少(例如,减少了空洞区域、悬浮伪影),且具有更好的结构保真度。
意义与主张
本文声称通过解决当前增强和正则化技术中存在的随机性和缺乏选择性的根本问题,建立了稀疏视角新视角合成的新 SOTA。通过将伪地面真值的选择和正则化的应用建立在费舍尔信息之上,作者提供了一种原则性的方法来:
- 减少随机采样和统一 Dropout 带来的不确定性和不稳定性。
- 通过多视图立体约束充分利用几何先验。
- 区分过度优化与欠优化的高斯函数,以防止诸如过度补偿之类的视觉伪影。
作者得出结论,其方法有效地缓解了稀疏视角 3DGS 中的过拟合问题,在不需要额外密集输入数据的情况下,实现了卓越的渲染保真度和稳定的优化。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。