想象一下,你正试图用数百万个微小的、发光的、毛茸茸的球体(高斯球)来重现一个三维场景(比如一个房间或一座花园)。这正是名为**3D 高斯泼溅(3D Gaussian Splatting)**的流行技术所做的事情。它速度极快且效果出色,但存在一个缺陷:它依靠一套僵硬的、人工编写的规则来管理这些球体。如果一个球体位置错误,计算机必须猜测是移动它、将其分裂成两个,还是删除它。有时这些规则会陷入混乱,导致重建结果杂乱无章。
本文介绍了一种名为欧拉高斯泼溅(Eulerian Gaussian Splatting, EGS)的新方法。作者不再手动移动这些球体,而是将整个三维空间视为一张天气图。
以下是他们方法的分解,使用了简单的类比:
1. 天气图 vs. 移动卡车
- 旧方法(拉格朗日): 想象你有一支在城市中穿梭的送货卡车车队(即那些球体)。如果某个包裹需要送往新地点,你必须指示某辆特定卡车驶向那里,或者指示某辆卡车分裂成两半。这需要一位复杂的交通指挥官(启发式算法)来决定哪辆卡车该做什么。
- 新方法(欧拉): 与其移动卡车,不如想象你有一张显示哪里“可能下雨”的天气图。你不需要移动雨水,只需更改地图。如果地图显示某个特定区域有“暴雨”,你就会自动在那里生成雨滴。如果显示“干燥”,就不会出现雨滴。
- 在本文中,这张“天气图”是一个可学习的概率密度。计算机不移动球体;它学习一张地图,告诉它在哪里生成新球体,在哪里停止生成,完全基于图像呈现的效果。
2. “哈希概率金字塔”(智能地图)
在微观层面上为整个城市创建一张天气图需要过多的计算机内存。为了解决这个问题,作者构建了一个哈希概率金字塔。
- 类比: 想象一张从低分辨率网格(如像素化图像)开始的地图。当你放大时,地图会变得更加详细。然而,这张地图并没有存储每个像素的数据,而是利用巧妙的“哈希”技巧(像一种秘密代码)来复用空白区域的信息。
- 为何有帮助: 它使计算机能够在不耗尽内存的情况下,拥有场景的超详细地图。它可以将“脑力”集中在场景的复杂部分(如枝叶繁茂的树木),同时保持空旷天空的简洁。
3. “控制变量”(降噪器)
当计算机尝试学习这张地图时,它必须猜测球体的放置位置,观察结果,然后调整地图。由于它是随机猜测的,它获得的“反馈”(梯度)非常嘈杂,就像试图在喧闹的音乐会中听清低语。这通常会导致学习过程缓慢且不稳定。
- 创新点: 作者发明了一种特殊的数学技巧,称为控制变量。
- 类比: 想象你试图判断一名歌手对合唱团声音的贡献有多大。如果你听整个合唱团,很难分辨。但如果你想象没有那名歌手的合唱团,你就能轻易听出差异。
- 作者的数学技巧通过比较完整图像与移除特定球体后的图像,精确计算出每个球体对最终图像的贡献。这消除了背景噪声,为计算机提供了关于如何改进地图的非常清晰、稳定的信号。
4. 结果:一个自我组织的花园
通过结合这些想法,该系统就像一个自我组织的花园:
- 它从空白画布和一张“概率地图”开始。
- 它根据地图随机“发芽”出“种子”(高斯球)。
- 它观察图像。如果花园的某部分看起来模糊或错误,地图会自动增加该处“种子”生长的“概率”。如果某部分看起来太拥挤或错误,地图则会降低概率。
- 不需要人为规则来指示计算机“分裂这个球”或“删除那个球”。数学自然地将概率的“质量”移动到需要的地方。
核心结论
该论文声称,这种方法在复杂三维场景上实现了最先进(state-of-the-art)的质量(比之前的方法效果更好),同时保持了与原始 3D 高斯泼溅一样快的渲染速度。
关键在于,它无需对场景进行预扫描(如 3D 激光扫描)即可启动。它可以从一个完全随机的猜测开始,仅通过观察照片就能推断出世界的形状,这要归功于它能够直接通过梯度下降学习“概率地图”。它弥合了连续数学(如 NeRFs)的稳定性与离散物体(如 3DGS)的速度之间的鸿沟。
技术摘要:基于哈希概率金字塔的欧拉高斯泼溅
问题陈述
当前的 3D 高斯泼溅(3DGS)方法通过离散高斯原语表示场景,实现了实时渲染。然而,这些场景的优化依赖于“自适应密度控制”(ADC),这是一套手动调整的启发式规则(例如分裂、克隆、剔除),用于在训练过程中添加或移除原语。这些启发式方法可能较为脆弱,并可能导致次优的局部极小值。相反,神经辐射场(NeRFs)通过梯度下降优化连续体密度,提供了更高的稳定性,但渲染速度较慢。本文旨在解决一种框架的需求,该框架既能保留 3DGS 的渲染效率,又能采用连续场的基于梯度的原则性优化,从而消除对启发式原语操作的需求。
方法论
作者提出了欧拉高斯泼溅(EGS),这是一种概率框架,它将视角从拉格朗日视角(显式移动原语)转变为欧拉视角(优化场景体积上的概率密度函数)。
概率渲染模型:
EGS 不再优化单个高斯位置,而是定义了一个 3D 空间上的体概率密度函数 pθ(μ)。在每个训练迭代中,从该分布中采样一组离散的 N 个高斯中心 μi。随后,这些采样中心使用标准的 3DGS 光栅化进行渲染。通过优化底层概率分布的参数 θ 和高斯属性 ϕ(颜色、尺度、旋转、不透明度)来最小化损失。
哈希概率金字塔:
为了在高分辨率下高效地表示概率密度 pθ(μ),同时避免不可行的内存增长,作者引入了哈希概率金字塔。
- 结构: 这是一个多尺度分层网格,其中概率密度被参数化为跨越 L 个层级的分段常数函数的乘积。
- 内存效率: 为了避免参数的立方级增长,该方法使用了哈希编码。在每个层级,网格被平铺为有限预算(B)的 2×2×2 块。哈希函数将网格索引映射到这些块,从而允许使用紧凑的参数集表示高分辨率分布(例如,对于 40963 网格,仅需约 8600 万个参数,占用内存仅 0.33 GB)。
- 采样: 采样通过从粗到细遍历层级高效完成。通过将不同层级的随机样本通过确定性小数部分函数关联起来,使该过程成为端到端可微的。
梯度估计与方差降低:
通过随机梯度下降优化分布会引入高方差。研究发现,标准的路径估计器(通过采样过程使用自动微分)是不稳定的。
- 控制变量: 作者推导了一种基于得分函数的无偏梯度估计器,并辅以控制变量进行增强。
- 关键洞察: 特定样本的梯度贡献由其渲染图像中的个体影响加权。具体而言,使用了完整图像 I 与移除第 i 个高斯后渲染的图像 I−i 之间的差值。
- 效率: 关键在于,论文证明了 (I−I−i) 可以直接从标准反向传播过程中的不透明度 oi 以及损失对不透明度的梯度(∂I/∂oi)计算得出。这避免了渲染 M 张独立图像的计算成本,同时显著降低了梯度方差。
训练策略:
- 防御性采样: 在训练早期,向部分样本添加高斯噪声,以防止概率密度在那些未来可能变得重要的区域坍缩为零。
- 样本取整: 将样本位置四舍五入到其最细网格单元的中心,以减少由微小位置偏移引起的方差。
- 重复移除: 在渲染前移除重复样本(由取整产生),随着模型优化,自然地修剪高斯数量。
- 细化: 在优化概率和属性网格后,最后一步细化阶段对采样的离散高斯集合运行标准的基于梯度的优化,持续 5,000 次迭代。
主要贡献
- 欧拉公式化: 一种新颖的方法,通过优化连续概率场来控制离散高斯的放置,从而弥合了 NeRF 与 3DGS 之间的鸿沟,消除了对启发式密度控制的需求。
- 哈希概率金字塔: 一种内存高效、全局归一化、多尺度的 3D 概率密度表示方法,使得在单张 GPU 上进行高分辨率优化成为可能。
- 低方差梯度估计器: 一种基于控制变量的估计器,它隔离了每个高斯对渲染图像的贡献,使得概率分布的训练能够稳定进行,而无需承担标准路径估计器的高方差。
- 无启发式训练: 该方法从均匀随机初始化开始即可达到最先进(SOTA)的结果,无需依赖运动恢复结构(SfM)点或手动调整的分裂/剔除规则。
结果
该方法在 mip-NeRF 360、Tanks & Temples 和 Deep Blending 数据集上进行了评估。
- 性能: EGS 在随机初始化的模型中实现了最先进的重建质量,在整体 PSNR 方面优于 3DGS-MCMC 和 Taming-3DGS 等基线模型。
- 与基于 SfM 方法的比较: 虽然使用 COLMAP 点初始化的模型通常表现略好,但从随机初始化开始的 EGS 缩小了这一差距的大部分,展示了其鲁棒性。
- 消融研究: 自定义梯度估计器被确定为最关键组件;如果没有它,训练将变得不稳定并收敛到糟糕的结果。不透明度正则化和防御性采样也提供了显著的稳定性收益。
- 效率: 由于样本数量庞大和哈希网格查询,训练过程比标准 3DGS 更慢且更占用内存,但最终渲染速度仍与 3DGS 相当。
意义
论文声称,EGS 在连续场优化与离散高斯渲染之间提供了一座“原则性的桥梁”。通过用可学习的概率分布取代脆弱的启发式规则,该框架允许场景几何纯粹从梯度线索中涌现。这使得一种简单的端到端训练过程成为可能,该过程能够泛化到多样化的场景,而无需先验几何初始化(SfM)或人工干预,证明了基于采样的公式可以在保持泼溅渲染效率的同时实现高质量的重建。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。