← 最新论文
💻 computer science

Towards Robust Monocular Depth Estimation in Non-Lambertian Surfaces

本文提出了一种针对非朗伯表面(non-Lambertian surfaces)的鲁棒单目深度估计框架,该框架利用基于梯度的区域引导、随机色调映射增强以及一个可选的基于变分自编码器(VAE)的照明融合模块,在不依赖外部掩码的情况下,在零样本测试和 TRICKY2024 竞赛中实现了最先进的性能。

原作者: Junrui Zhang, Jiaqi Li, Yachuan Huang, Yiran Wang, Jinghong Zheng, Liao Shen, Zhiguo Cao

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Junrui Zhang, Jiaqi Li, Yachuan Huang, Yiran Wang, Jinghong Zheng, Liao Shen, Zhiguo Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:迈向非朗伯表面鲁棒单目深度估计

问题陈述
单目深度估计(MDE)的最新进展已使模型在通用场景中展现出令人印象深刻的零样本泛化能力。然而,当遇到非朗伯表面,特别是透明或镜面(ToM)区域时,这些模型经常失效。这些表面的独特反射特性导致标准模型根据反射内容而非表面本身来预测错误的深度结构。以往解决此问题的尝试(如 Depth4ToM)依赖于外部分割掩码,在处理前将 RGB 图像进行随机颜色的图像修复(in-painting)。这些方法存在两个主要局限性:它们高度依赖于额外输入掩码的准确性,且在图像修复过程中使用随机颜色缺乏鲁棒性,需要大量的超参数调优。此外,光照条件显著影响非朗伯表面深度的恢复;过强的光照会淹没纹理,而光照不足则会引入噪声和失真,尤其影响透明物体和镜面反射。

方法论
作者提出了一种训练框架,旨在通过增量学习的方式,使基准模型(具体为 Depth Anything V2)直接学习非朗伯表面的独特特征,从而消除对 RGB 图像修复的需求。该方法由三个核心组件组成:

  1. 随机色调映射增强 (RTA):
    为了解决非朗伯深度估计对光照的敏感性,作者在合成数据集 Hypersim 上训练阶段采用了随机色调映射。通过应用变换 Iaug=αIoriγI_{aug} = \alpha I_{ori}^{\gamma}(其中 γ\gamma 是标准伽马校正因子,α\alpha 是源自随机百分比强度值 [介于第 70 和第 99 百分位数之间] 的缩放因子),使模型暴露在多样化的光照条件下。这旨在增强模型在不同照明情况下的零样本泛化能力。

  2. 非朗伯表面区域引导 (NSRG):
    作者并未采用图像修复,而是引入了一种区域引导机制,在梯度域内约束 MDE 模型的预测。基于“大多数 ToM 物体是连续平面”的先验知识,该方法强制要求在被遮罩的非朗伯区域内,预测的深度梯度与地面真值(ground truth)梯度保持一致。
    损失函数 LToM\mathcal{L}_{ToM} 利用鲁棒估计器来对齐预测深度 (D\nabla D) 与地面真值 (D\nabla D^\star) 的梯度。它计算缩放系数 (ss) 和偏移系数 (tt) 来归一化梯度,并通过剔除前 20% 的残差来去除异常值。最终损失最小化归一化梯度的 L1L_1 距离,确保预测的深度平面在 ToM 区域保持平滑且与地面真值一致。

  3. 多样化光照图像融合 (DLIF)(可选):
    针对存在同一场景多曝光图像的情景,作者提出了一个可选的融合模块。该模块利用来自 Stable Diffusion 的预训练变分自编码器(VAE),将具有不同光照条件的多个图像编码为潜在特征(latent features)。通过对这些潜在特征进行平均并解码,系统生成单张融合后的 RGB 图像,该图像在理论上具备最有利于深度估计的光照条件,并充分利用了 VAE 的语义先验。

核心贡献

  • 随机色调映射增强: 一种数据增强策略,通过丰富的多样化光照条件来扩充训练数据集,显著提升了 MDE 模型在多样化照明场景下的鲁棒性和零样本泛化能力。
  • 非朗伯表面区域引导: 一种在梯度域内运行的新型训练约束。它通过分割掩码直接引导网络在非朗伯表面上估计正确的深度平面,避免了 RGB 图像修复方法的稳定性问题。
  • 可选图像融合模块: 一种利用 VAE 融合多曝光图像的机制,在可用多光照条件时,为深度估计提供更有利的输入。

实验结果
该方法在 Booster 数据集、NYU Depth Dataset V2(经 Mirror3D 精炼)以及 TRICKY2024 竞赛测试集上进行了评估。

  • 定量性能:Depth Anything V2 基准相比,所提方法在 Booster 数据集的 ToM 区域实现了 33.39% 的精度提升,在 Mirror3D 数据集的 ToM 区域实现了 5.21% 的提升(以 δ1.05\delta_{1.05} 衡量)。
  • 达到先进水平(SOTA):TRICKY2024 竞赛测试集上,该方法在 ToM 区域取得了 90.75δ1.05\delta_{1.05} 分数,展示了最先进的性能。
  • 消融实验: 实验证实,随机色调映射增强和非朗伯表面区域引导均能独立贡献于性能提升,两者结合效果最佳。当利用多曝光输入时,可选的图像融合模块进一步提升了结果。

意义与局限性
论文声称其主要意义在于将范式从后处理图像修复转向通过精心设计的训练框架直接学习非朗伯特性。通过专注于梯度一致性和光照鲁棒性,该方法简化了流程并在不依赖于随机颜色经验性调整的情况下增强了稳定性。

作者承认了局限性,指出在极端过曝导致非朗伯表面(如玻璃)纹理完全丢失的情况下,网络仍可能失效。他们建议未来的工作可以整合图像质量优化和语义信息融合,以在这些极端条件下进一步提高定性和定量结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →