这篇论文介绍了一种名为 GoDe (Gaussians on Demand,按需高斯) 的新技术,旨在解决 3D 场景渲染中“既要画质好,又要体积小,还要能随时调整”的难题。
为了让你轻松理解,我们可以把 3D 场景想象成一座正在装修的豪华别墅,而 3D 高斯(3D Gaussian Splatting)就是用来构建这座别墅的无数个小光点(或乐高积木)。
1. 以前的痛点:只能“死板”地装修
在 GoDe 出现之前,如果你想在不同设备上展示这座别墅,面临着一个尴尬的局面:
- 手机用户:内存小,网速慢,需要看一个“极简版”的别墅(只有几块砖,大概能看出轮廓)。
- 电脑用户:内存大,网速快,需要看一个“超高清版”的别墅(几百万块砖,连墙上的花纹都清晰可见)。
以前的做法是: 装修队(算法)必须为每种需求单独盖一栋房子。
- 盖“极简版”房子,需要专门训练一次。
- 盖“高清版”房子,又要专门训练一次。
- 如果你想盖 8 个不同档次的版本,就得训练 8 次,存 8 个文件。这不仅费时费力,而且当你从手机切换到电脑时,你得重新下载整个新文件,无法平滑过渡。
2. GoDe 的创意:一套“乐高积木”,按需组装
GoDe 的核心思想是:我们不需要盖 8 栋房子,我们只需要盖一栋“可进化”的房子。
想象一下,你有一盒巨大的乐高积木(训练好的 3D 高斯模型)。GoDe 并不是把这些积木随机堆在一起,而是给它们排好了队,分成了不同的“层级”:
- 第 0 层(地基):只有最核心的几块大积木,能拼出房子的基本轮廓(比如四面墙、屋顶)。哪怕只有 1MB 大小,也能让人一眼看出“哦,这是一栋房子”。
- 第 1 层(加砖):在基础上,加上一些中等大小的积木,让墙壁变厚,窗户出现。
- 第 2 层(精装修):加上更小的积木,开始有门把手、窗帘褶皱。
- ...直到第 7 层(极致细节):加上最微小的积木,连墙上的灰尘、玻璃的反光都清晰可见。
GoDe 的神奇之处在于:
- 一次训练,全家通用:只需要训练一次,就能得到这套完整的“分层积木”。
- 按需加载(On Demand):
- 手机用户只下载“第 0 层”,瞬间就能看,速度极快。
- 网速变快了,系统自动下载“第 1 层”,画面瞬间变清晰,不需要重新下载整个文件。
- 到了电脑前,直接加载到“第 7 层”,享受极致画质。
- 平滑过渡:当从“第 0 层”升级到“第 1 层”时,新加进来的积木不会突然“啪”地一下弹出来(这叫 Pop-in 瑕疵),而是像变魔术一样慢慢浮现,看起来非常自然。
3. 它是怎么做到的?(简单的原理)
GoDe 用了一个很聪明的“排兵布阵”策略:
4. 为什么要这么做?(实际意义)
- 省流量、省空间:你不需要为了适应不同设备而准备 8 个不同的文件,只需要存这一个“万能包”。
- 适应性强:无论是在卡顿的 4G 网络下,还是在千兆光纤下,GoDe 都能自动调整,给用户最好的体验。
- 速度快:因为不需要重新训练不同的模型,开发者和用户都能节省大量时间。
总结
GoDe 就像是一个“智能的 3D 场景流媒体服务”。
以前的 3D 技术像是买 DVD:你要看标清版就得买标清碟,想看 4K 就得买 4K 碟,还得换碟。
现在的 GoDe 像是Netflix 流媒体:它只有一个视频源,但能根据你的网速和设备,自动从“模糊”平滑过渡到“超清”,而且不需要你重新下载,随时都能看。
这项技术让 3D 场景在网页、手机、VR 设备上的应用变得更加灵活和高效,是 3D 渲染领域的一大步。
GoDe: 高斯按需(Gaussians on Demand)——面向 3D 高斯泼溅的渐进式 LOD 与可扩展压缩技术总结
1. 研究背景与问题 (Problem)
背景:
3D 高斯泼溅(3D Gaussian Splatting, 3DGS)作为一种显式辐射场表示方法,因其卓越的重建质量和实时渲染性能,已成为神经辐射场(NeRF)的有力替代方案。然而,随着场景复杂度的提升,3DGS 模型需要数百万个高斯原语,导致巨大的内存占用和传输成本。
核心痛点:
现有的 3DGS 压缩方法(如剪枝、量化、熵编码等)大多是**单速率(Single-rate)**的。这意味着:
- 缺乏可扩展性:每个目标压缩级别(如不同的内存预算或带宽限制)都需要单独训练或微调一个独立的模型。
- 部署困难:在设备资源动态变化(如网络带宽波动、不同硬件性能)的场景下,维护、存储和传输多个专用模型是不切实际的。
- 灵活性不足:无法在推理阶段根据当前资源情况动态调整细节层次(Level of Detail, LoD),而无需重新编码或重新训练。
目标:
提出一种**可扩展压缩(Scalable Compression)**框架,使得单个训练好的模型能够自然地支持多个速率 - 失真(Rate-Distortion)工作点,实现渐进式细节控制和自适应渲染。
2. 方法论 (Methodology)
作者提出了 GoDe (Gaussians on Demand) 框架,其核心思想是将训练好的 3DGS 模型中的高斯原语重新组织为一个固定的渐进式层次结构(Progressive Hierarchy)。该方法主要包含三个关键步骤:
2.1 基于梯度的渐进式层次构建 (Gradient-Induced Hierarchical Organization)
- 原理:利用训练过程中已有的优化信号。作者发现,3DGS 的优化动力学自然地将高斯原语排序为从“粗粒度全局结构”到“细粒度局部细节”。
- 重要性评分:计算每个高斯原语在所有参数(位置、缩放、旋转、不透明度、球谐系数)上的聚合梯度敏感度(Aggregated Gradient Sensitivity),即损失函数对参数的梯度范数平方和(si=∥∂θi∂L∥2)。
- 迭代掩码策略:
- 从完整模型开始,自顶向下构建。
- 在每一层,选择重要性评分最低的高斯原语作为该层的“增强集(Enhancement Set)”,将其从当前集合中移除并分配给当前层级。
- 重复此过程,直到所有高斯被分配到不同的层级(L 层)。
- 低层级(LoD 0)包含对场景最关键的粗粒度结构,高层级逐步添加精细细节。
2.2 量化感知联合微调 (Quantization-Aware Fine-Tuning)
- 目的:确保在低精度存储(量化)下,所有层级都能保持一致的高质量重建,并减少层级切换时的伪影。
- 过程:
- 在构建好层次结构后,进行单次联合微调。
- 在每次迭代中,随机采样一个层级 l,仅使用该层级的原子进行渲染和损失计算。
- 模拟量化过程(对位置、缩放、旋转等参数进行量化),并使用直通估计器(Straight-Through Estimator)传播梯度。
- 引入稀疏性惩罚(ℓ1 正则化)以进一步减少外观系数的存储。
- 优势:这种随机采样迫使共享参数(尤其是低层级参数)在量化约束下保持鲁棒性,无需为每个层级单独微调。
2.3 可扩展压缩与自适应渲染 (Scalable Compression & Adaptive Rendering)
- 压缩:将基础层 G0 和各个增强集 {El} 独立压缩。使用 Zstandard (ZSTD) 算法,并配合预训练的共享字典(几何字典和外观字典),生成可扩展比特流。
- 解码:支持渐进式解码。解码 G0 即可获得粗略场景,随后可按需解码增强层以逐步提升质量。
- 平滑过渡:在渲染时,当切换层级时,新激活的高斯原语的不透明度从 0 线性插值到目标值,以消除“Pop-in"(突然出现的视觉伪影)。
3. 关键贡献 (Key Contributions)
- 单流水线可扩展压缩:首次提出从单个预训练模型中导出多个离散压缩级别的方法,无需为每个目标速率重新训练模型。
- 梯度驱动的层次化组织:提出了一种迭代、基于梯度的掩码策略,利用聚合梯度信息构建稳定的 LOD 层次结构,无需修改模型架构。
- 模型无关设计:该方法仅依赖通用的优化信号(梯度)和标准训练技术,适用于显式 3DGS、神经 3DGS(如 Scaffold-GS)以及分层 3DGS(如 Octree-GS)等多种变体。
- 实际部署优化:结合量化感知微调、不透明度插值和快速熵编码,实现了高效的存储、渐进式解码和跨异构场景的自适应渲染。
4. 实验结果 (Results)
作者在 Mip-NeRF360、Tanks&Temples 和 DeepBlending 等标准数据集上,针对多种 3DGS 骨干网络(3DGS, Scaffold-GS, Octree-GS)进行了广泛评估。
- 率失真性能 (Rate-Distortion Performance):
- GoDe 在多个数据集上实现了与最先进(SOTA)的单速率压缩方法(如 HAC, Context-GS, RDO-GS 等)相当甚至更优的重建质量(PSNR, SSIM, LPIPS)。
- 例如,在 Mip-NeRF360 上,GoDe 基于 3DGS 的曲线在多个压缩点上超越了 Context-GS 和 HAC。
- 可扩展性与灵活性:
- 单个模型支持从几 MB(LoD 0)到几十 MB(LoD 7+)的多种压缩率,覆盖广泛的带宽和存储需求。
- 在相同硬件上,GoDe 生成所有 8 个工作点仅需一次训练流程,而对比方法需要训练 8 个独立模型。
- 渲染性能:
- 低层级模型极其轻量,渲染速度极快(例如在 DeepBlending 数据集上,LoD 0 可达 846 FPS,模型大小仅 4.1 MB),而完整模型约为 146 FPS。
- 解码速度比现有方法快 1762 倍,使得流式传输和即时解压成为可能。
- 消融实验:
- 证明了基于梯度的重要性排序优于基于不透明度或位置梯度的剪枝策略。
- 证明了迭代掩码策略比一次性排序(One-shot)能产生更稳定的层次结构。
- 虽然分层约束导致性能比独立优化的单速率模型有轻微下降(BD-PSNR 差距约 0.4-0.96 dB),但考虑到部署效率和灵活性,这一代价是可以接受的。
5. 意义与影响 (Significance)
- 范式转变:GoDe 将“可扩展压缩”定义为表示本身的固有属性,而非事后处理的特性。它解决了 3DGS 在实际部署中面临的最大瓶颈之一——如何在动态资源约束下高效传输和渲染。
- 通用性:该方法不依赖于特定的网络架构或复杂的训练技巧,为显式和神经辐射场的压缩提供了一套通用的解决方案。
- 应用前景:
- 自适应流媒体:根据用户网络状况动态加载不同细节层级的 3D 场景。
- 边缘计算:在低算力设备上运行低层级模型,在高性能设备上运行全量模型。
- VR/AR:实现无缝的 LOD 切换,提升用户体验。
总结:GoDe 通过巧妙利用训练过程中的梯度信息,将 3DGS 模型重构为可扩展的层次结构,成功在保持 SOTA 重建质量的同时,实现了真正的单模型多速率自适应渲染,为 3D 高斯泼溅技术的实际落地铺平了道路。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。