这篇论文介绍了一种名为 Smol-GS 的新方法,它的核心目标是让 3D 场景的存储变得极其小巧,同时还能保持高清画质。
为了让你更容易理解,我们可以把传统的 3D 场景重建(3D Gaussian Splatting)想象成在搭建一个巨大的乐高城堡。
1. 传统方法的痛点:笨重的“乐高城堡”
以前的 3D 技术(如 3DGS)就像是用几百万块独立的乐高积木来搭建一个场景。
- 问题:每一块积木(也就是“高斯点”)都要单独记录它的精确位置、颜色、透明度、旋转角度等所有信息。
- 后果:这就好比你要把整个城堡的图纸发给朋友,文件大得吓人(几个 GB),传输慢,手机也存不下。而且,如果城堡很大,为了省空间,你不得不把积木拆掉,结果城堡就变模糊了。
2. Smol-GS 的魔法:聪明的“压缩包”
Smol-GS 提出了一种全新的打包思路,它不再死板地记录每一块积木的绝对坐标,而是学会了“偷懒”和“概括”。我们可以用三个生动的比喻来解释它的核心技巧:
比喻一:从“记坐标”到“记楼层” (八叉树编码)
- 传统做法:就像你要告诉朋友“积木 A 在房间里的具体位置是 (X=10.523, Y=20.987, Z=5.123)"。这需要很多数字,非常占空间。
- Smol-GS 的做法:它把整个房间想象成一个八层的魔方大楼(八叉树)。
- 它先问:“积木在哪个大房间?”(比如:2 楼)。
- 再问:“在 2 楼的哪个小隔间?”(比如:3 号隔间)。
- 一直问下去,直到找到那个小格子。
- 优势:它不需要记录精确的坐标,只需要记录“它住在哪一层、哪个格子”。因为大部分格子是空的,这种“楼层索引”非常短,就像把“住在 2 楼 3 号”压缩成几个比特,比记一串长数字省多了。
比喻二:从“给每个人画肖像”到“发通用面具” (抽象特征)
- 传统做法:每一块积木都要单独画一张详细的脸(颜色、光泽、材质),就像给几百万个乐高小人每人发一张高清照片。
- Smol-GS 的做法:它发现,虽然积木位置不同,但它们的“长相”是有规律的。
- 它不再给每个积木发照片,而是给每个积木发一个通用的“身份 ID"(位置编码)。
- 然后,它只带了一个超级聪明的“画师”(微型神经网络)。当你想看某个积木时,画师会根据这个积木的“位置 ID",现场快速画出它应该有的颜色和光泽。
- 优势:你不需要存储几百万张照片,只需要存储那个“画师”的说明书(很小)和所有积木的“位置 ID"。
比喻三:从“存原图”到“存压缩包” (熵编码)
- 传统做法:把所有数据原封不动地存起来。
- Smol-GS 的做法:它利用统计学原理,发现很多数据是重复的或者可以预测的。它像 ZIP 压缩包一样,把那些重复的、没用的信息全部扔掉,只保留最核心的“差异信息”。
- 优势:这就像把一件蓬松的羽绒服抽气压缩,体积瞬间变小,但拿出来充气后,衣服还是那件衣服。
3. 最终效果:小巧玲珑,画质惊人
通过这套组合拳,Smol-GS 实现了惊人的效果:
- 体积:原本需要 700 多 MB 甚至 几个 GB 的 3D 场景文件,现在只需要 4-5 MB(相当于压缩了 100 多倍!)。
- 画质:虽然文件变小了,但渲染出来的画面依然清晰锐利,连玻璃的反光、阴影的边缘都保留得很好,肉眼几乎看不出和原版有什么区别。
- 速度:因为数据量小,加载和传输速度极快,甚至可以在手机或网页上流畅运行。
总结
Smol-GS 就像是给 3D 世界装上了一个“智能压缩引擎”。它不再笨拙地记录每一个像素的绝对位置,而是学会了用“楼层索引”找位置,用“现场画师”生成细节,用“智能压缩”省空间。
这意味着未来我们可以在手机里轻松下载整个城市的 3D 模型,或者在 VR 游戏中瞬间加载超逼真的场景,而不再受限于巨大的存储空间和缓慢的网络速度。
Smol-GS: 3D 高斯泼溅(3DGS)的紧凑表示技术总结
1. 研究背景与问题 (Problem)
3D 高斯泼溅 (3D Gaussian Splatting, 3DGS) 是一种新兴的神经辐射场表示方法,能够实现实时的新视角合成和高保真渲染。然而,原始的 3DGS 存在严重的内存效率低下问题:
- 存储开销巨大:为了表示复杂场景,通常需要数百万个高斯点(Splats),导致模型文件高达数 GB。
- 现有压缩方法的局限性:
- 信号处理方法(如量化):虽然能节省空间,但未能充分利用高斯点之间的局部空间相关性和重复模式。
- 基于学习的方法(如 Scaffold-GS 及其变体 HAC++、ContextGS):采用“锚点 - 偏移量”(Anchor-Offset)层级结构。这种方法虽然有效,但引入了额外的结构开销(如透明偏移量、启发式规则),且坐标压缩往往受限,因为重建对空间误差非常敏感。
核心挑战:如何在保持高渲染质量的同时,显著降低 3DGS 的存储需求,同时避免复杂的结构开销并保留对几何和外观的灵活控制能力。
2. 方法论 (Methodology)
作者提出了 Smol-GS,一种新颖的神经高斯泼溅模型。其核心思想是:显式且高效地打包几何结构(坐标),并将视图依赖的外观特征抽象为低维特征。
Smol-GS 由以下五个关键部分组成:
2.1 坐标压缩:占用八叉树编码 (Coordinate Compression)
- 理念:受点云几何压缩启发,利用 3D 空间中的稀疏性。
- 实现:
- 构建一个占用八叉树 (Occupancy-octree)。从包含所有高斯点的包围盒开始,递归地将空间划分为 8 个子块。
- 仅对包含高斯点的非空子块进行进一步划分。
- 每个划分层级生成一个 8 位的占用字节 (Occupancy byte),指示哪些子块非空。
- 量化:高斯点的坐标被量化为最细粒度八叉树单元的中心。
- 熵编码:由于占用字节高度稀疏(大多数节点只有少数子块被占用),使用 Huffman 编码 对这些字节进行无损压缩。
- 优势:避免了“锚点 - 偏移量”结构带来的额外开销,实现了坐标的紧凑存储。
2.2 位置编码:基于空间划分的索引 (Positional Encoding)
- 创新:提出了一种从八叉树层级导出的位置编码 (foct)。
- 机制:每个高斯点根据其所在的最终八叉树叶节点,获得一个唯一的 Morton 码(Z-order 索引)作为位置嵌入。
- 作用:该编码作为 MLP 的输入,帮助网络学习空间局部性,增强了神经高斯泼溅的表示效率,无需显式存储原始浮点坐标即可恢复相对位置信息。
2.3 神经高斯泼溅与微小解码器 (Neural Gaussian Splats)
- 抽象特征:每个高斯点不再直接存储颜色、旋转、缩放等所有属性,而是存储一个低维的抽象特征向量 f (维度 nf=8) 和一个缩放控制器 s。
- 特征生成:在渲染时,将抽象特征 f、视图方向、距离以及位置编码 foct 拼接,输入到一组微小的 MLP 解码器中。
- 输出:MLP 预测出每个高斯点的具体属性:不透明度 (o)、颜色 (c)、旋转 (r) 和缩放 (s∗)。
- 优势:将视图依赖的外观(如高光、材质)从显式参数中解耦,通过神经网络动态生成,大幅减少了存储参数。
2.4 特征压缩:算术编码 (Feature Compression)
- 机制:利用哈希网格辅助的算术编码(借鉴 HAC 方法)。
- 流程:
- 通过哈希网格查询空间描述符。
- 使用微小网络预测特征分布(高斯分布)和量化步长。
- 对特征 f 和缩放控制器 s 进行量化。
- 使用算术编码进行压缩。
- 损失函数:引入负对数似然 (NLL) 作为速率代理项,在训练过程中优化压缩率。
2.5 自适应密度控制与训练流程
- 训练阶段:分为五个阶段(热身、致密化、压缩、特征压缩、坐标压缩)。
- 策略:结合梯度引导的致密化(Densification)和基于不透明度的剪枝(Pruning),平衡重建保真度与模型大小。
3. 主要贡献 (Key Contributions)
- Smol-GS 模型:提出了一种简单高效的策略,利用高度紧凑的逐点抽象特征和轻量级 MLP 来表示 3D 场景,消除了“锚点 - 偏移量”的结构开销,支持直接的逐点操作(如 3D 编辑)。
- 八叉树导出的位置编码:提出了一种新的位置编码方法,显式建模空间局部性,显著提升了神经高斯泼溅的表示效率。
- 极致的压缩性能:在保持高渲染质量的同时,将 3DGS 的存储需求降低了两个数量级(相比原始 3DGS 减少约 150 倍),并在多个基准测试中达到了 SOTA(State-of-the-Art)的压缩率 - 质量权衡。
4. 实验结果 (Results)
- 数据集:在 Mip-NeRF 360、Tanks and Temples 和 Deep Blending 等标准数据集上进行了评估。
- 压缩率:
- 在 Mip-NeRF 360 上,Smol-GS 将模型大小从原始 3DGS 的 734 MB 压缩至 4.87 MB (Smol-GS-small),压缩比高达 150 倍。
- 相比之前的 SOTA 方法(如 HAC++, ContextGS, HEMGS),Smol-GS 在更小的模型体积下实现了相当甚至更好的 PSNR、SSIM 和 LPIPS 指标。
- 渲染质量:
- 定性分析:Smol-GS 能够重建清晰的阴影边缘、材质效果(如高光、玻璃、平面墙壁),且伪影(Artifacts)少于原始 3DGS。
- 定量分析:在 PSNR/SSIM 与模型大小的散点图中,Smol-GS 始终位于帕累托前沿(Pareto frontier),证明了其优越的率失真性能。
- 效率:
- 训练时间:约 26.58 分钟(35k 迭代),与 HAC++ 相当。
- 渲染速度:平均 241.3 fps,满足实时渲染需求。
- 编解码速度:编码和解码时间均在秒级(约 1-3 秒),适合实际传输和存储场景。
5. 意义与影响 (Significance)
- 突破存储瓶颈:Smol-GS 解决了 3DGS 难以在资源受限设备(如移动端、VR/AR 头显)上部署的关键问题,使其从“几 GB"的庞然大物变为“几 MB"的轻量级模型。
- 架构创新:通过分离几何(显式八叉树)和外观(隐式神经特征),Smol-GS 提供了一种新的 3D 表示范式,避免了传统锚点方法的启发式缺陷。
- 应用前景:
- 实时传输:极小的体积使得 3D 场景的流式传输成为可能。
- 3D 编辑:由于保留了显式的几何结构和逐点特征,Smol-GS 兼容现有的 3DGS 编辑工具,支持更灵活的交互。
- 未来方向:离散的抽象特征可作为 3D 信息 Token,为结合大语言模型(LLM)或其他多模态学习提供了新的可能性。
总结:Smol-GS 通过巧妙的八叉树坐标编码和神经特征抽象,成功实现了 3D 高斯泼溅的极致压缩,在保持高质量渲染的同时,将存储需求降低了两个数量级,是 3D 视觉领域迈向实用化、轻量化部署的重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。