Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform
本文提出了 MSFT,一种集成了多尺度注意力与傅里叶变换幅度融合的监督式单阶段深度学习网络,旨在有效增强低光照图像中的纹理细节与全局上下文,并在多个基准数据集上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:结合傅里叶变换的多尺度注意力机制用于低光照图像增强 (MSFT)
1. 问题陈述
低光照图像增强(LLIE)旨在从具有挑战性环境(如由于光照不足导致的暗室内场景或具有剧烈亮度变化的室外场景)中捕获的输入中,恢复高质量、正常光照的图像。这些条件会导致亮度退化、严重的图像模糊和噪声。
现有的基于深度学习的 LLIE 方法面临以下局限性:
- 纹理与照明恢复: 许多方法难以同时准确捕捉现实世界的照明分布并恢复精细的纹理细节。
- 自适应能力受限: 主流方法往往无法根据区域纹理信息自适应地调整亮度,从而导致过曝光或欠曝光问题。
- 计算与先验依赖: 虽然扩散模型提供了极高的真实感,但它们通常依赖于假设的退化过程或沉重的预训练先验,限制了其在退化过程模糊的现实场景中的适用性。此外,依赖语义先验的方法通常需要过多的计算资源。
- 噪声与背景处理: 虽然信噪比(SNR)感知优化技术可以提高信噪比,但往往无法捕捉深层尺度信息,也无法充分增强包含极光前景元素的背景区域。
2. 方法论
作者提出了 MSFT(结合傅里叶变换的多尺度注意力机制),这是一个监督式的频域深度学习网络。该架构是一个两阶段、U 型框架,集成了卷积神经网络(CNN)和 Transformer,并受傅里叶变换原理的指导。
核心架构组件
A. 傅里叶变换引导的多尺度注意力 (FTG-MSA)
这是嵌入在网络尺度中的核心恢复模块。它利用了频率域幅度编码亮度信息、而相位与结构细节相关的观察结果。
- 引导构建: 网络通过将低光照图像与最大灰度值先验图(通过 Retinex 理论从照明层导出)进行拼接,创建一个四通道特征亮度图。
- 频率融合: 该模块对低光照图像特征和四通道引导图执行快速傅里叶变换(FFT)。它将引导图的幅度谱添加到低光照图像的幅度谱中,同时保留低光照图像的相位。
- 逆变换: 通过逆快速傅里叶变换(IFFT)重建引导特征图,该图作为亮度先验以防止过曝或欠曝。
- 注意力机制: 这种融合后的幅度信息引导多头自注意力机制。注意力权重被动态计算,以选择性地提取相关特征,在丰富图像内容的同时保留纹理。
B. 多形状协同注意力 (MSSA)
旨在提取深层尺度纹理信息并集成高维稀疏特征,MSSA 模块被插入在最高通道尺度处。它由三个串联组件组成:
- 空间与通道协同注意力 (SCSA): 自适应地权衡通道重要性并增强关键空间信息。
- 多形状注意力 (MSA): 由并行的扩张正方形注意力 (DSA) 和扩张矩形注意力 (DRA) 组成。
- DSA: 使用双曲正切(Tanh)激活函数代替 Softmax,以避免低通滤波器限制,从而增强高频成分。
- DRA: 在矩形区域内聚合信息,以捕捉多形状特征。
- CMUNeXt: 一个轻量级模块,可同时提取所有通道的全局信息,在集成空间-通道信息的同时减少参数量和计算成本。
C. 网络结构
整体框架是一个三尺度的 U 型架构。
- 编码器: 低光照图像和四通道引导图通过卷积层和 FTGT(傅里叶变换引导 Transformer)块进行处理,生成层次化特征。
- 解码器: 编码器的多尺度特征直接输入到相应的解码器通道中以引导重建,消除了额外的特征提取并减少了冗余。
- 损失函数: 模型使用 Charbonnier 损失进行训练,以最小化增强输出与地面真值(Ground Truth)之间的误差。
3. 核心贡献
- MSFT 架构: 提出了一种结合傅里叶变换与 CNN-Transformer 混合 U-net 框架的两阶段集成网络。这种混合设计平衡了 CNN 捕捉局部特征的高效性与 Transformer 构建全局上下文的能力。
- FTG-MSA 模块: 设计了一种将频域幅度信息作为动态引导信号的自注意力机制。这使得网络能够根据低光区域的最大灰度值自适应地调整增强权重,防止曝光伪影。
- MSSA 模块: 在最高维度的引导空间中引入了多形状协同注意力模块。该模块通过结合 SCSA、MSA(DSA/DRA)和 CMUNeXt,有效地整合了稀疏信息,使通道密度均匀化,并提取深层尺度纹理信息。
- 卓越性能: 大量实验证明,MSFT 在多个数据集(LOL, SID, SMID, SDSD)上的 PSNR 和 SSIM 表现均优于最先进(SOTA)的方法,特别是在保留纹理细节和恢复照明而不产生过曝光方面。
4. 实验结果
作者在七个数据集上评估了 MSFT:LOL-v1, LOL-v2-real, LOL-v2-synthetic, SID, SMID, SDSD-indoor, 以及 SDSD-outdoor。
- 定量性能:
- 在 SDSD-outdoor 数据集上,MSF 实现了 41.76 dB 的 PSNR 和 0.988 的 SSIM。这比 Retinexformer 高出 11.92 dB,SSIM 提升了 13.80%。
- 与 SOTA 有监督方法 Retinexformer 相比,MSFT 在所有基准测试中均取得了显著的 PSNR 增益,范围从 0.11 dB 到 11.92 dB 不等。
- 与无监督方法 Retinexformer 相比,提升更为显著,在某些数据集上增益高达 16.48 dB。
- 效率:
- MSFT 拥有 1.25 百万个参数 和 18.07 GFLOPs。与 SNR-Net(4.01M 参数,26.35 GFLOPs)等其他高性能模型相比,其参数量相对较低,在性能与计算成本之间提供了更好的平衡。
- 消融实验:
- 去除 Retinex 引导(四通道输入)导致性能大幅下降(例如在 SDSD-outdoor 上下降约 9 dB),验证了照明先验的重要性。
- 去除 MSSA 模块导致 PSNR 和 SSIM 均出现实质性下降,证实了其在结构相似性和纹理恢复中的作用。
- 在 FTGT 中去除 FFT 组件导致性能下降最为严重,证明了频域引导对于全局一致性的不可或缺性。
- 定性结果: 视觉对比显示,MSFT 能有效捕捉背景纹理并保持真实的照明,而其他方法往往会引入暗点、伪影或亮区的过曝光现象。
5. 重要性与局限性
重要性:
论文声称 MSFT 通过有效地将频域幅度信息与多尺度注意力机制融合,为低光照增强提供了一个鲁棒的解决方案。它为构建利用频域引导注意力来恢复退化图像的模型提供了参考,在实现精确照明恢复与精细纹理增强之间达到了平衡,且没有扩散模型那样的沉重计算负担或固定 ViT 结构的局限。
局限性:
作者承认存在若干约束:
- 光污染: 该方法在处理受强光污染的图像方面能力有限,因为它难以去除过曝光部分的噪声。
- 实时处理: 对于自然光场景下的实时处理,其效率尚不够高。
- 数据依赖: 该模型需要大量的配对数据进行训练,目前不适用于缺乏配对数据的无监督增强领域。
- 噪声敏感性: 该模型未考虑在严重噪声污染场景下采集的图像;它需要相对干净的配对数据集或预处理后的数据。
未来工作:
作者提出了以下研究方向:
- 将傅里叶变换真正集成到注意力层中,以便直接在频域(使用幅度谱和相位谱)进行注意力计算。
- 探索扩散模型在频域中的应用,通过优化扩散结构来降低计算资源消耗,同时利用其生成能力进行无监督增强。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。