想象一下,你正试图欣赏一幅美丽的画作,但有人在上面喷洒了雾气、溅上了泥浆,或者覆盖了一层厚厚的雨水。在计算机世界中,这被称为“图像退化”。当相机在黑暗的洞穴、水下或暴风雨中拍摄照片时,生成的图像往往是模糊、多噪点或颜色错误的。这不仅仅是摄影师的烦恼;对于需要清晰视野来做出决策的机器人、自动驾驶汽车和医生来说,这是一个巨大的难题。多年来,计算机一直尝试使用“判别式”模型来修复这些图像。把这些模型想象成一位严厉的美术老师,他看着一幅泥泞的画作,试图去猜测原本的艺术品“必须”是什么样子的,并遵循一条单一且僵化的路径来寻找答案。但现实世界的混乱很少如此简单。有时,一个模糊的点可以用许多种不同的方式来修复,而单一且僵化的猜测往往会偏离目标。
扩散模型(Diffusion Models)这一更新颖、更具创造性的方法应运而生。如果说旧的方法是一位严厉的老师,那么扩散模型就像是一位用粘土创作的雕塑家。雕塑家并不立即猜测最终的形状,而是从一团随机的噪声(就像一堆混乱的粘土粉尘)开始,通过一步步地、循序渐进地剔除噪声,从而显现出隐藏在下方的图像。这篇论文介绍了一个名为 TDiR(基于 Transformer 的扩散图像修复模型)的新工具。它将扩散模型的逐步“雕塑”能力与 “Transformer” 架构结合在一起——Transformer 是一种非常擅长理解图像不同部分之间如何相互关联的计算机“大脑”,就像我们通过观察单词之间的联系来理解一个句子一样。作者希望看看这种结合能否修复三种非常混乱类型的照片:水下拍摄的照片(通常带有绿色且朦胧)、被雨水覆盖的照片以及充满静态噪声的照片。
研究人员通过对现有的智能网络 PromptIR 进行“噪声调节型”升级,构建了 TDiR。他们添加了一个特殊的解码器路径,用来告诉计算机:“嘿,我们现在处于这个特定的清理步骤,且噪声水平是这么高。”这使得模型能够随着工作进程调整其策略。他们在五个不同的标准基准测试上测试了这个新系统,并将其与 18 种其他顶尖技术进行了对比。结果令人印象深刻。在水下类别中,TDiR 在 PSNR(衡量修复图像与原图接近程度的指标)上达到了 22.90 dB,在 SSIM(衡量结构相似度的指标)上达到了 0.8724,超过了最接近的竞争对手 MetaUE 0.89dB 和 0.011 个 SSIM 点。在去除雨水方面,它在 Rain100L 数据集上得分 37.43 dB,以微弱优势击败了一个专门针对该任务进行重训的模型(PromptIR*),领先了 0.40dB。
然而,论文谨慎地指出,这并不意味着问题已经完美解决。作者发现,虽然 TDiR 是一个可以同时处理噪声、雨水和水下问题的“全才”,但它并不总是能击败那些只做一项工作的“专才”。事实上,对于低噪声水平下的去噪任务,专门针对该任务训练的模型表现仍然更好。他们还注意到一个特定的特征:由于该模型是以小块(类似于马赛克)的形式处理图像,因此在块与块交界处有时会留下细微的“分块”伪影,即使图像在人眼看来效果很好,这也会略微降低技术评分。此外,由于需要通过许多步骤来将图像“雕刻”回原貌,该过程比旧方法更慢,且计算成本更高。
最终,这项研究表明,将扩散模型与 Transformer 结合是修复退化图像的一种强大方式,通常能产生比旧方法看起来更自然、且能更好地处理复杂多层混乱情况的结果。这表明,对于像水下探索或自动驾驶这类“正确答案”并不总是显而易见的任务,这种灵活的、循序渐进的方法在视觉质量上提供了显著的提升,即便它伴随着更高的计算成本和一些细微的技术权衡。
技术摘要:TDiR(基于 Transformer 的图像修复扩散模型)
问题陈述
图像修复是计算机视觉领域的一个关键挑战,旨在从受噪声、模糊、色彩偏差和光散射影响的退化图像中恢复出清晰、原始的图像。这些退化显著损害了图像在目标检测、制图和分类等下游任务中的效用。虽然非生成式方法在高级视觉任务中已取得成功,但在处理如水下重建、去噪和去雨等低级视觉任务时,往往难以应对复杂的、多模态的分布。特别是水下图像,由于光散射、吸收以及随环境条件变化的色彩偏移,呈现出独特的挑战,这通常需要模型能够应对多种潜在的退化状态,而非仅仅将单一的退化输入映射到单一的清晰输出。
方法论
本文提出了 TDiR,一种基于 Transformer 的条件扩散模型,旨在统一框架内解决多种图像修复任务。
- 架构: TDiR 的核心是基于 Transformer U-Net 的架构,该架构改编自 PromptIR 主干网络。PromptIR 利用提示模块(prompt modules)来适应不同程度的退化,而无需为每个任务构建不同的模型。
- 扩散过程: 该模型运行在一个由前向扩散过程(逐步添加高斯噪声)和反向去噪阶段组成的扩散框架内。
- 前向过程: 高斯噪声被添加到输入图像 y0 中,经过 T 次迭代,直到其呈现为纯噪声。
- 反向过程: 去噪网络学习逆转这一过程,从高斯分布回到数据集的经验分布。
- 关键架构修改: 作者引入了一种轻量级的修改方案,即一个专门的解码器路径,将退化输入与扩散时间步(diffusion timestep)的嵌入进行拼接。这使得网络能够根据前向传递过程中引入的具体噪声水平来调节其修复过程。
- 训练策略: 为了解决 Transformer 对数据量需求大的问题,作者使用了一个预训练的编码器(冻结状态)作为主干。在训练期间,仅优化解码器的参数。模型在涵盖三个任务(水下增强、去噪和去雨)的组合数据集上进行训练。目标函数最小化预测噪声与添加到图像中的实际噪声之间的 L1 损失。
- 推理: 修复过程涉及迭代去噪程序,每张图像都需要进行多次前向传递。
主要贡献
- 统一的条件扩散模型: 提出了 TDiR,它将预训练的 PromptIR 主干转换为噪声调节的去噪器,从而实现跨多种不同修复任务(水下、去噪、去雨)的应用,而无需进行任务特定的模型切换。
- 轻量级时间步调节: 引入了一个解码器路径,通过将退化输入与扩散时间步嵌入进行拼接,使模型能够根据噪声水平动态调整其修复策略。
- 全面的评估: 通过五个基准数据集(UIEB、Test-60、BSD68、Rain100L 等)和四种评估指标(PSNR、SSIM、UCIQE、UIQM)对 TDiR 进行了严格的评估。研究将 TDiR 与 18 种最先进的技术进行了对比。
- 定性分析: 对基于扩散的修复过程与纯判别式网络进行了对比分析,强调了其在处理多模态退化方面的优势,同时也承认了诸如残差补丁(residual patch)导致的伪影等限制。
实验结果
论文报告称,TDiR 在所评估的任务中均优于当前的先进方法:
- 水下图像增强: 在 UIEB 数据集上,TDiR 取得了最高的全参考得分,PSNR 为 22.90 dB,SSIM 为 0.8724,超过了最接近的竞争对手(MetaUE)0.89 dB 和 0.011 SSIM。在无参考的 Test-60 子集上,它实现了 2.73 的 UIQM 分数,显著优于其他方法。定性结果显示,与 PromptIR 及其他基线模型相比,TDiR 具有更优的色彩忠实度和对绿色色偏的抑制能力。
- 图像去噪: 在 BSD68 数据集上,TDiR 在噪声水平 σ=15,25,50 时均优于所有基准方法(包括专门的单任务模型)。值得注意的是,在 σ=50 时,TDiR 超越了专家模型 PromptIR。虽然在高噪声水平下由于补丁伪影导致 SSIM 略有下降,但该模型生成的图像在感知上更干净,在均匀区域产生的可见颗粒感更少。
- 图像去雨: 在 Rain100L 数据集上,TDiR 实现了 37.43 的 PSNR,超过了重新训练的 PromptIR* 基线 0.40 dB,并显著超过了 AirNet 和 MPRNet 等其他方法。定性分析证实,该模型完全消除了均匀区域(天空、沙地)的雨痕,并且与竞争对手相比,能更好地保留精细纹理。
重要性与声明
论文声称,扩散模型与 Transformer 的结合为图像修复提供了一个鲁棒的解决方案,特别是在涉及复杂、多模态退化的场景中。作者强调,扩散模型擅长处理多样化的分布,能够实现更细腻的修复,以反映现实世界的变异性,这对于光照和清晰度变化剧烈的水下成像尤其有利。
然而,论文在讨论其局限性时保持了谦逊的语气。作者承认:
- 计算成本: 扩散模型的迭代特性使得 TDiR 的推理成本显著高于单次传递的判别式模型,这可能会限制其在实时应用中的表现。
- 伪影: 基于 Transformer 的去噪器的补丁处理(patch-wise processing)可能会在拼接边界产生块状伪影,这可能会相对于感知质量略微降低 PSIM/SSIM 分数。
- 泛化权衡: 虽然统一模型具有通用性,但在特定场景下(例如具有平坦背景的低深度水下场景),其表现始终逊于专门的单任务模型,这表明在通用性与峰值精度之间存在权衡。
- 深度依赖性: 模型依赖于与深度相关的线索来进行有效的还原,而这些线索在某些具有挑战性的场景中可能并不存在。
作者总结道,尽管 TDiR 在多个任务中展示了图像质量的显著提升,但未来的工作可以通过重叠补丁推理(overlapping-patch inference)、蒸馏至更少的扩散步数或任务条件微调等技术来解决其局限性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。