这篇论文介绍了一种名为 "Dehaze-then-Splat"(先除雾,再喷绘) 的新方法,旨在解决一个非常有趣的问题:如何从一堆被烟雾笼罩的照片中,不仅把烟“变没”,还能还原出一个清晰、立体的 3D 世界?
为了让你更容易理解,我们可以把这个过程想象成**“修复一幅被烟雾模糊的立体拼图”**。
1. 核心难题:为什么“修好单张图”不等于“修好 3D 世界”?
想象你有一组照片,每张照片都拍的是同一个房间,但都被浓烟笼罩。
- 传统的做法(单张修复): 你请了一位超级厉害的修图大师(论文里叫 Nano Banana Pro),让他把每一张照片里的烟都擦掉。
- 结果: 每一张单独看,照片都变得非常清晰、漂亮,甚至大师还能“脑补”出烟雾后面被挡住的细节(比如把模糊的树叶画得更绿)。
- 问题: 这位大师是**“各修各的”**。他修第一张图时,觉得树叶是深绿的;修第二张图时,可能觉得是浅绿的。虽然单张图都很完美,但当你把这些图拼起来做 3D 模型时,电脑就懵了:“这棵树到底在哪?颜色到底是深是浅?”
- 后果: 拼出来的 3D 模型会像**“融化的冰淇淋”**,边缘模糊,结构不稳,甚至出现奇怪的漂浮物(就像幽灵一样)。
这篇论文的核心发现就是: 单张图修得再好,如果照片之间“步调不一致”,3D 重建就会失败。
2. 解决方案:两步走的“魔法流水线”
为了解决这个问题,作者设计了一个两步走的流程:
第一步:强力除雾(生成式修复)
- 动作: 使用那个超级修图大师(Nano Banana Pro),把每一张烟雾照片都变成“伪干净”的照片。
- 小插曲: 大师修完图后,每张照片的亮度可能不一样(有的偏亮,有的偏暗)。作者加了一个**“亮度校准”**步骤,就像给所有照片统一调了个白平衡,让它们看起来是在同样的光线下。
第二步:物理约束的 3D 喷绘(3D Gaussian Splatting)
这是最关键的一步。作者没有直接把修好的图扔给 3D 软件,而是给软件加上了**“物理法则”**作为约束,强迫它必须“听话”。
我们可以把 3D 重建想象成**“用无数个小光点(高斯球)去堆砌一个 3D 雕塑”**。作者加了三个“紧箍咒”来防止雕塑乱长:
- 深度监督(给个“距离尺子”):
- 虽然照片是烟雾的,但烟雾的厚度是有规律的。作者用 AI 估算了一个“烟雾深度图”,告诉 3D 模型:“这个物体大概离镜头这么远”。这就像给雕塑家一个**“距离标尺”**,防止他把树堆得太近或太远。
- 暗通道先验(给个“去雾过滤器”):
- 物理上,干净的物体在阴影里应该是很暗的,不会发灰。作者加了一个规则,强迫模型生成的图像里,阴影部分必须足够黑,不能残留烟雾的灰蒙蒙感。这就像给雕塑家一个**“去灰指令”**。
- 双源梯度匹配(给个“轮廓描边”):
- 为了防止模型把烟雾里的噪点当成真实的纹理,作者让模型去对比“修图大师”和“传统去雾算法”画出来的边缘。只有两边都认可的边缘,模型才敢画上去。这就像**“双重确认”**,防止乱画。
关键技巧:见好就收(早停策略)
- 现象: 作者发现,如果让 3D 模型训练太久,它会为了迎合每一张照片的微小差异,拼命增加“小光点”的数量,最后导致模型“过拟合”,产生很多漂浮的幽灵(Floaters)。
- 对策: 作者决定**“见好就收”**。在训练刚开始不久(光点数量还很少,大概 10 万个左右)就停止增加光点。
- 比喻: 这就像**“在面团刚揉好、还没发酵过度时就停止”**。虽然光点少,但因为它们代表了所有照片的“平均共识”,所以拼出来的 3D 模型反而最清晰、最稳定。
3. 最终效果
通过这套“先除雾,再物理约束喷绘”的方法,他们在测试场景(Akikaze)中取得了很好的成绩:
- 清晰度提升: 比没有加这些“紧箍咒”的普通方法,清晰度提升了 1.5 分贝(在图像领域,这已经是巨大的进步)。
- 画面更稳: 新视角的渲染不再模糊,结构更稳固,没有奇怪的漂浮物。
总结
这篇论文就像是在告诉我们要**“既要单兵作战能力强,又要团队协作好”**:
- 先用最强的 AI 把每张照片修得漂漂亮亮(单兵能力)。
- 再用物理规则强迫这些照片在 3D 空间里“步调一致”(团队协作)。
- 最后,在模型还没“想太多”(过拟合)之前,及时叫停,保留最精华的部分。
这就好比修一座被大雾笼罩的城堡,你不仅要擦干净每一块砖(单图修复),还要确保所有砖块拼在一起时,城堡的轮廓是连贯的(多视图一致性),而不是拼出一堆散乱的碎片。
论文技术总结:Dehaze-then-Splat
论文标题:Dehaze-then-Splat: Generative Dehazing with Physics-Informed 3D Gaussian Splatting for Smoke-Free Novel View Synthesis
会议/挑战:NTIRE 2026 3D 恢复与重建挑战赛(Track 2)
核心任务:多视角烟雾去除及新视角合成(Novel View Synthesis, NVS)
1. 问题背景与挑战
多视角烟雾/ haze 去除面临一个核心矛盾:单帧图像恢复质量与多视角一致性之间的张力。
- 现有困境:最先进的生成式去雾模型(如 Nano Banana Pro)在单帧去雾上表现优异,但它们独立处理每一帧,缺乏跨视角的几何或光度约束。这导致生成的“伪清洁”图像在颜色、纹理和细节上存在随机性差异(Cross-view Inconsistencies)。
- 后果:当直接将这些不一致的图像用于 3D 高斯泼溅(3DGS)训练时,优化过程会试图平均化冲突的光度信号,导致新视角渲染模糊、纹理漂移、几何结构不稳定以及出现“漂浮物(floaters)”伪影。
- 极端尝试的失败:
- 纯 2D 去雾后重建:单帧质量高,但多视角不一致导致 3D 重建失败。
- 端到端散射分解(如 DehazeGS):虽然保证了多视角一致性,但缺乏强先验导致去雾质量极低(模型坍塌为 β→0,即无法有效去雾)。
2. 方法论:Dehaze-then-Splat 两阶段流水线
作者提出了一种结合生成式去雾与物理先验约束的 3DGS 训练框架。
阶段一:生成式去雾与亮度归一化
- 去雾模型:使用 Nano Banana Pro (Gemini API) 进行逐帧去雾。
- 通过精心设计的 Prompt(6 点结构化提示)确保去除烟雾的同时保留场景几何和真实感。
- 相比传统方法(DCP, MB-TaylorFormer),其单帧 PSNR 显著提升(20.07 dB vs 17.00 dB)。
- 亮度归一化:
- 解决逐帧处理带来的帧间亮度不一致(最大偏移 0.12)。
- 采用逐通道均值/标准差归一化。若有真值(GT),则对齐 GT 统计量;若无 GT,则对齐所有帧的中值统计量。
阶段二:物理先验引导的 3DGS 训练
为了弥补生成式去雾带来的多视角不一致性,作者在 3DGS 训练中引入了物理信息辅助损失(Physics-Informed Auxiliary Losses),作为隐式的多视角一致性正则化项。
总损失函数:
L=(1−λs)L1+λsLSSIM+λdLDCP+λpLdepth+λgLgrad
- 深度监督(Depth Supervision, Ldepth):
- 利用 Depth Anything V2 从原始烟雾图像生成伪深度图。
- 使用尺度不变的加权 Pearson 相关系数损失,约束渲染深度与伪深度的一致性。这是提升效果最显著的模块(+0.79 dB)。
- 暗通道先验正则化(Dark Channel Prior, LDCP):
- 约束渲染图像的暗通道值趋近于零,以抑制残留的烟雾/ haze 伪影,提升感知质量。
- 双源梯度匹配(Dual-source Gradient, Lgrad):
- 利用 Sobel 算子,将渲染图像的梯度与另一个结构参考源(MB-TaylorFormer 的输出)进行匹配,确保边缘结构的一致性。
- MCMC 致密化策略与早停(Early Stopping):
- MCMC:采用随机噪声注入和重定位策略管理高斯密度,优于传统的分裂/克隆/修剪启发式方法(+0.47 dB)。
- 早停:发现最佳渲染质量出现在训练早期(约 2000 步,高斯数量 104k-161k)。延迟致密化会导致模型过拟合单帧噪声,产生漂浮物。因此将致密化停止步数设为 3000,限制高斯数量,防止过拟合。
3. 关键贡献
- 揭示了“去雾 - 重建”流程的根本矛盾:明确指出单帧生成式去雾的高质量并不等同于多视角一致性,后者是高质量 3D 重建的前提。
- 提出了物理先验正则化方案:通过引入深度监督、暗通道先验和梯度匹配,有效补偿了逐帧生成带来的跨视角不一致性,无需在去雾阶段引入复杂的跨视角建模。
- 优化了 3DGS 训练策略:证明了在数据存在不一致性时,限制模型容量(早停)和使用 MCMC 致密化比传统训练策略更能避免伪影,获得更锐利的渲染结果。
- 性能突破:在 Akikaze 验证场景上,相比无正则化基线,PSNR 提升了 1.50 dB(达到 20.98 dB),SSIM 提升了 0.051。
4. 实验结果
- 数据集:基于 RealX3D 基准,包含真实烟雾和低光照条件的多视角数据。
- 主要指标(Akikaze 验证集):
- PSNR: 20.98 dB (提升 +1.50 dB)
- SSIM: 0.683
- LPIPS: 0.600
- 消融实验结论:
- 深度监督贡献最大(+0.79 dB)。
- MCMC 策略优于默认策略(+0.47 dB)。
- 早停(STOP=3k)比长训练(STOP=15k)效果好 0.35 dB,证实了过拟合单帧噪声是性能下降的主因。
- 端到端散射分解方法(Route B)仅获得 10.28 dB,验证了混合架构的必要性。
5. 意义与展望
- 理论意义:该工作为“生成式 2D 恢复 + 3D 重建”的范式提供了新的视角,即通过3D 训练阶段的物理约束来修正 2D 生成阶段的分布不一致,而非强行要求 2D 模型具备多视角一致性。
- 实际应用:为烟雾、雾霾等恶劣天气下的 3D 场景重建提供了高效且高质量的解决方案,特别适用于 NTIRE 等竞赛及实际工业场景。
- 未来方向:
- 在去雾阶段直接引入跨视角一致性约束(如视频生成模型、多视角注意力机制)。
- 开发自适应容量调度策略,仅在跨视角一致性建立后才增加高斯数量。
总结:Dehaze-then-Splat 通过巧妙的“两阶段”设计,利用物理先验损失和训练策略控制,成功解决了生成式去雾模型在 3D 重建中的一致性难题,实现了烟雾场景下的高质量新视角合成。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。