想象一下,试图在漆黑的房间里拍出一张完美的照片。你对准相机,按下快门,得到的却是一团充满颗粒感的、混乱的静态噪声。这就是计算机视觉中“低光成像”面临的日常困境。几十年来,科学家们一直试图解决这个问题,要么让相机等待更长时间以收集光线(这会导致运动模糊),要么利用复杂的数学运算来推测图像“应该”是什么样子。但有一个聪明的窍门:近红外(NIR)光。虽然我们的眼睛看不见它,但相机可以,而且近红外光就像一把幽灵般的闪光灯,即使在全黑的环境下也能揭示物体的形状和纹理,尽管它呈现的是单色的灰阶图像。一个核心问题一直是:我们能否利用这张幽灵般的灰色地图来修复那些充满噪声的彩色照片,而不需要一个“完美”的参考图来教计算机该怎么做?通常,为了教会计算机如何清理照片,你需要向它展示一张脏的版本和一张干净的版本并排对比。但在现实世界中,要在黑暗中获得那个“干净”的版本往往是不可能的。
这篇题为《迈向鲁棒且具备3D感知能力的暗光RGB-NIR成像》的论文,提出了一种解决这一谜题的新方法。作者们是来自东京大学及其他机构的一个团队,他们建议,我们不应该尝试去清理单张2D图像,而应该先构建场景的3D模型。可以这样理解:如果你有一张在黑暗中拍摄的、模糊且充满噪声的乐高城堡照片,以及一张用红外相机拍摄的同一座城堡的清晰灰色照片,旧的方法试图将灰色的细节像贴纸一样粘贴到彩色照片上。而这篇论文认为,这种做法是错误的。相反,他们在计算机的脑海中构建了一个虚拟的3D雕塑。他们利用清晰的灰色(NIR)照片来定义雕塑的形状,然后利用那张带有噪声的彩色(RGB)照片来进行“绘画”,但他们进行绘画的方式是强制要求“油漆”只能涂抹在符合形状逻辑的地方。
研究人员发现,通过在3D空间中结合这两类光线,他们可以在从未见过原始照片“干净”版本的情况下,重建出清晰且彩色的图像。他们发现了这一过程中的两个主要障碍。首先,计算机总是试图将彩色照片中的随机静态噪声当作真实的细节来学习,从而产生一种奇怪的“棋盘格”图案。为了修复这个问题,他们教会了计算机去聆听红外照片的“节奏”(频率),而不是噪声严重的彩色照片,从而有效地消除了这些静态噪声。其次,他们意识到红外照片中的同一种灰色可能对应现实生活中的多种不同颜色(例如,一个灰色的墙可以是红色、蓝色或绿色)。为了解决这个问题,他们增加了一个特殊的“颜色代码”系统,让计算机能从一系列可能性中推测出正确的颜色,而不是简单地将它们混合成浑浊的棕色。
该团队在计算机生成的场景以及包括一只猫头鹰和一辆漫游车在内的真实捕捉场景上测试了他们的想法。他们将自己的方法与许多现有技术进行了对比,其中包括那些依赖大量干净训练数据的技术。结果表明,他们的3D感知方法能够产生更锐利、色彩更好且伪影更少的图像,即使在噪声极其严重的情况下也是如此。他们证明了这种方法可以在不同的黑暗程度和噪声水平下工作,且不需要其他方法所要求的那些并不存在的“干净”参考照片。虽然该系统目前在处理静止场景时表现最好,且如果相机没有完美对齐则会遇到困难,但论文指出,这标志着朝着实现仅利用已捕获的光线就能在黑暗中看清事物的相机迈出了重要一步。
技术摘要:迈向黑暗环境下鲁棒且具备 3D 感知的 RGB-NIR 成像
问题陈述
鲁棒的低光成像仍然是计算机视觉领域的一个基本挑战。虽然传统的策略(如长曝光和连拍)会受到运动模糊和可见性问题的困扰,且现有的基于深度学习的增强方法通常依赖于“噪声 RGB–NIR–洁净 RGB”三元组,但这些有监督模型在跨域泛化能力和不同噪声水平下的鲁棒性方面表现较差。目前存在一个关键空白:即如何在仅使用近红外(NIR)和噪声 RGB 观测值的情况下,实现鲁棒的低光增强,而不依赖任何形式的洁净 RGB 监督。
方法论
本文提出了一种新型的 3D 感知神经隐式融合架构,该架构利用体渲染框架在 3D 空间中隐式地融合极高噪声的 RGB 观测值与 NIR 线索。该方法基于多层感知器(MLP)和体渲染构建,旨在重新设计以利用 RGB-NIR 模态的互补特性,且无需洁净的 RGB 真值(ground truth)。
核心架构组件
3D 感知融合结构(NIR 条件化 MLP):
- 不同于处理 RGB 和 NIR 的独立 MLP 的并行结构,所提出的方法采用了 NIR 条件化结构。
- 一个 NIR MLP 利用 NIR 观测值来估计体密度 (σ)。
- NIR MLP 的输出被输入到 RGB MLP 中,以提供结构引导。至关重要的是,采用了一种梯度停止(gradient-stopping)策略,以防止噪声 RGB 观测值退化 NIR 表示的学习。
- 这种设计允许 RGB MLP 在利用 NIR 所编码的结构信息的同时,保持 NIR 表示的完整性,从而有效地恢复纯 3D 一致性可能遗漏的精细 2D 纹理细节。
NIR 调制位置编码(NIR-P.E.):
- 应用于 3D 坐标 (x) 和视线方向 (d) 的标准正弦位置编码(P.E.)在严重噪声下往往会导致“棋盘格伪影”,因为网络会过度拟合高频噪声而非结构细节。
- 频域分析表明,洁净的 RGB 和 NIR 具有相似的平滑频率分布,而噪声 RGB 则由随机高频噪声主导。
- 为了解决这一问题,作者将 P.E. 应用于 NIR 估计值 (cN) 而非空间坐标。RGB MLP 接收 x、d 以及编码后的 γ(cN) 作为输入。
- 这起到了一种频率对齐调制的作用,在放大 NIR 中存在的结构一致性频率的同时,抑制了来自噪声 RGB 监督的噪声驱动成分。
颜色代码 MLP(C.C. MLP):
- 从 NIR 到 RGB 的映射本质上是病态的;单个 NIR 值可能对应多种不同的 RGB 颜色(例如,在 NIR 下反射率相似的不同颜色物体)。由于 MLP 的平滑特性,标准的 MLP 往往会对具有相同 NIR 值的点产生“混合”或平均化的 RGB 估计。
- 为了解决这种歧义,引入了 颜色代码 MLP 来学习每个 NIR 值的概率颜色分布。
- 它预测一个非均匀对数概率分布 (π),并使用 Gumbel-Softmax 采样出一个独热(one-hot)颜色代码 (δ)。
- 该代码被输入到 RGB MLP 中,使模型能够区分具有相同 NIR 值的不同 RGB 颜色,从而保留多样化的颜色表示。
优化
模型通过最小化渲染估计值与观测值之间的 L2 光度损失进行优化。值得注意的是,该损失函数不包含洁净 RGB 监督。相反,它最小化了渲染的 NIR/RGB 与观测到的噪声 RGB/NIR 之间的差异。噪声 RGB 观测值通过超参数 ϕ 进行放大,以补偿曝光差异。
核心贡献
- 一种新的 3D 感知融合模型: 本文提出了一种用于 RGB-NIR 暗光成像的模型,该模型能够在无需洁净 RGB 监督的情况下,在 3D 空间中有效融合噪声 RGB 观测值与 NIR 线索。
- 富有洞察力的架构组件: 引入了两个特定组件以释放 RGB-NIR 模态的互补潜力:
- NIR 调制位置编码: 用于抑制噪声诱发的过拟合并消除棋盘格伪影。
- 颜色代码 MLP: 用于解决根本性的 NIR-to-RGB 歧义并防止颜色混合。
- 数据集: 作者贡献了包含 NIR 图像和噪声 RGB 观测值的合成及真实世界多视图数据集,以促进未来的研究。
结果与评估
所提出的框架在合成数据集(通过 Mitsuba3 生成)和真实世界采集的数据(使用 JAI FS-3200T10GE-NNC 相机)上进行了评估。
- 合成数据: 模型在五种噪声水平(s∈{1/10,…,1/200})下进行了测试。在 SSIM、PSNR 和 LPIPS 方面,它始终优于有监督方法(SANet、NAID)、无监督方法(NVEU)以及其他基于 NeRF 的方法(RawNeRF、LLNeRF)。
- 真实世界数据: 评估包括无参考指标(PI、MUSIQ、MANIQA)和人类主观评价(HSE)。所提方法在所有指标上均取得了最佳得分,证明了其相比现有基准模型具有更优越的结构完整性和色彩忠实度。
- 消融实验: 去除 NIR-P.E. 会导致严重的棋盘格伪影。去除 C.C. MLP 会导致不同颜色合并的混合伪影。完整的模型对于实现高保真重建是必要的。
- RAW 域泛化: 该方法也在 12 位 RAW 域进行了评估,显示出其在不需要白平衡或色彩校正的情况下,能有效泛化并超越 RawNeRF 和 NVEU 等基准模型。
重要性与声明
本文声称,仅使用 NIR 和噪声 RGB 观测值即可实现鲁棒的低光增强,从而消除了获取困难的洁净 RGB 监督数据的需求。通过结合 3D 感知神经建模,该方法能够在不同噪声水平和场景下实现泛化,而传统的监督模型在这些场景下往往会失效。这项工作表明,通过针对 RGB-NIR 模态的特定特征(频率对齐和颜色歧义)进行精心设计的隐式神经表示,可以有效地从极高噪声的输入中恢复出洁净图像。作者强调,这种方法为暗光成像提供了一个新视角,提供了一种既鲁棒又无需受限于配对训练数据的解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。