这篇论文介绍了一种名为 Flickerformer 的新 AI 技术,专门用来解决拍照时遇到的一个恼人问题:频闪(Flicker)。
想象一下,你在商场或办公室拍照,灯光忽明忽暗,照片上出现了一道道奇怪的横纹或暗带,就像老式电视机信号不好时的雪花屏,或者像有人拿着手电筒在你脸上快速扫过。这就是“频闪”。
这篇论文的核心思想是:不要盲目地修图,要理解频闪的“脾气”和“规律”。
作者把频闪比作一个有两个特殊性格的捣蛋鬼:
- 周期性(Periodicity): 它像心跳一样,有节奏地跳动。
- 方向性(Directionality): 它像扫帚扫地一样,总是沿着一个方向(通常是水平或垂直)扫过。
基于这两个特点,作者设计了一个名为 Flickerformer 的“超级修图师”,它由三个核心“助手”组成,我们给它们起个外号:
1. 节奏同步器(PFM - 基于相位的融合模块)
- 它的作用: 解决“周期性”问题。
- 生活比喻: 想象你在拍一组连拍照片(比如 3 张)。因为频闪有节奏,第一张照片亮的时候,第二张可能暗,第三张又亮。
- 普通的修图师会把这三张图硬拼在一起,结果画面乱糟糟。
- 节奏同步器就像是一个懂音乐的指挥家。它不看图片的亮度,而是看图片的“相位”(可以理解为灯光跳动的“时间点”)。它能精准地计算出:“哦,这张图里的亮条纹对应那张图里的暗条纹。”
- 于是,它把三张图里“互补”的部分完美拼合,就像把拼图碎片严丝合缝地对齐,从而消除闪烁,同时不会让画面出现重影(Ghosting)。
2. 规律侦探(AFFN - 自相关前馈网络)
- 它的作用: 在单张图片内部寻找重复的规律。
- 生活比喻: 想象你在一张满是噪点的纸上找规律。
- 普通的修图师可能觉得全是杂音。
- 规律侦探擅长**“自我比对”**。它会问自己:“这张图里,左边有条纹,右边是不是也有类似的条纹?”
- 通过这种“自己和自己比”的方式,它能识别出哪些是真正的频闪条纹(因为它们有规律),哪些是真实的物体纹理(因为它们没规律)。这样,它就能把频闪“过滤”掉,保留真实的细节。
3. 方向指南针(WDAM - 基于小波的方向注意力模块)
- 它的作用: 解决“方向性”问题。
- 生活比喻: 频闪通常像扫帚一样,要么横着扫,要么竖着扫。
- 普通的修图师(比如传统的卷积神经网络)像是一个无差别扫描的吸尘器,不管灰尘(频闪)是横着还是竖着,它都一视同仁地吸,结果可能把真实的头发丝也吸走了,或者没吸干净。
- 方向指南针则像是一个拿着特定方向扫帚的清洁工。它利用一种叫“小波变换”的技术,把图片拆解成不同的方向(横向、纵向)。
- 它能敏锐地发现:“看!这里有一道横向的高频亮纹,这肯定是频闪!”然后它专门针对这个方向进行修复,把暗部提亮,把亮部压暗,精准地只修频闪,不伤及无辜。
总结:为什么它这么厉害?
以前的修图方法,要么像大力出奇迹(强行把图变亮),要么像盲人摸象(没抓住频闪的规律),导致修出来的图要么有鬼影,要么颜色怪怪的。
Flickerformer 就像是一个既懂音乐节奏(周期性),又懂扫地方向(方向性)的顶级工匠。
- 它利用多张连拍照片互相配合(像合唱团找音准)。
- 它利用数学规律识别真假纹理。
- 它利用方向感精准打击频闪区域。
最终效果:
在实验测试中,Flickerformer 不仅把频闪去得干干净净,还保留了照片原本清晰的细节和自然的色彩,而且计算速度很快,参数很少(相当于它很聪明,不需要背很多书就能学会修图)。
简单来说,以前修频闪是“瞎蒙”,现在是用Flickerformer,是**“懂行”的精准修复**。
以下是基于论文《It Takes Two: A Duet of Periodicity and Directionality for Burst Flicker Removal》的详细技术总结:
1. 研究背景与问题定义 (Problem)
- 核心问题:在短曝光摄影中,由于交流电(AC)光源的不稳定照明和滚动快门(Rolling-shutter)导致的行曝光不一致,图像会出现频闪(Flicker)伪影。
- 现有挑战:
- 频闪是一种具有特定时空模式的结构化退化,不同于普通的噪声或低光照问题。
- 现有的通用图像恢复框架(如去噪、去模糊模型)往往忽略了频闪的物理先验,导致恢复效果次优,且容易引入**重影(Ghosting)**伪影。
- 传统的基于硬件或简单周期匹配的方法在复杂场景或通用设备上适用性有限。
- 目标:开发一种能够利用连拍(Burst)图像序列,有效去除频闪且不产生重影的通用解决方案。
2. 核心方法论 (Methodology)
作者提出了 Flickerformer,这是一种基于 Transformer 的架构,其核心创新在于将频闪的两个内在物理特性——周期性(Periodicity)和方向性(Directionality)——显式地嵌入到网络设计中。
2.1 整体架构
Flickerformer 采用非对称的 U 型编码器 - 解码器结构。输入为连拍序列中的三帧图像(1 帧基准帧 + 2 帧参考帧),输出为去频闪后的单帧高质量图像。网络包含三个关键模块:
2.2 关键组件详解
基于相位的融合模块 (Phase-based Fusion Module, PFM)
- 原理:利用频闪的周期性。研究发现,频闪的空间分布主要由图像的相位谱编码。
- 机制:
- 对基准帧和参考帧进行快速傅里叶变换(FFT)。
- 计算参考帧与基准帧之间的相位相关性,生成频率域权重图。
- 利用该权重在频域内对参考帧特征进行增强,然后变换回空间域进行融合。
- 作用:自适应地聚合多帧特征,有效区分频闪区域和正常区域,减少重影。
自相关前馈网络 (Autocorrelation Feed-forward Network, AFFN)
- 原理:利用频闪的帧内周期性结构。
- 机制:
- 基于维纳 - 辛钦定理(Wiener-Khinchin theorem),通过计算特征图幅值的平方并做逆傅里叶变换(IFFT)来提取**自相关(Autocorrelation)**信息。
- 自相关能放大重复的空间结构(即频闪条纹),抑制非相关噪声。
- 结合频域调制和空间域增强,自适应地强化融合特征中的周期性规律。
- 作用:在单帧内部检测并增强重复的频闪模式,提升恢复的连贯性。
基于小波的方向注意力模块 (Wavelet-based Directional Attention Module, WDAM)
- 原理:利用频闪的方向性(由滚动快门扫描机制导致,通常表现为水平或垂直条纹)。
- 机制:
- 使用 Haar 小波变换将特征分解为低频(LL)和高频(LH, HL, HH)子带。
- 高频子带(LH/HL):包含频闪的边缘和方向性变化信息。
- 注意力引导:利用高频子带生成方向性权重图(Directional Weight Map),引导低频注意力分支(Low-frequency Attention Branch)精准定位并恢复受频闪影响的暗区。
- 作用:相比传统各向同性的注意力机制,WDAM 能更精确地定位条纹状频闪,同时通过仅在低频子带进行注意力计算,降低了约 75% 的计算和内存成本。
3. 主要贡献 (Key Contributions)
- 提出 Flickerformer:首个专门针对连拍频闪去除设计的 Transformer 框架,在不引入重影的情况下实现了高质量恢复。
- 物理先验嵌入:
- 设计了 PFM 和 AFFN,分别利用帧间相位相关性和帧内自相关性来建模频闪的周期性。
- 设计了 WDAM,利用小波域的方向性特征来建模频闪的方向性,实现了精准定位。
- 性能突破:在真实世界数据集上,该方法在定量指标(PSNR, SSIM, LPIPS)和视觉质量上均超越了现有的最先进(SOTA)方法。
4. 实验结果 (Results)
- 数据集:在首个连拍频闪去除基准数据集 BurstDeflicker 上进行评估。
- 定量表现:
- PSNR:达到 31.226 dB,比第二名(AST, 30.646 dB)高出 0.580 dB。
- 效率:在取得最佳性能的同时,参数量仅为 3.92M,FLOPs 为 128.76G,显著低于许多对比模型(如 Restormer, Uformer 等)。
- 定性表现:
- 有效去除了严重的条纹状频闪,同时保留了丰富的纹理细节和色彩。
- 相比其他方法,显著减少了在动态场景中的重影伪影和颜色偏差(如黄色或红色偏移)。
- 消融实验:
- 移除 PFM、AFFN 或 WDAM 中的任何一个模块,PSNR 均会下降(分别下降约 0.28dB, 0.38dB, 0.37dB),证明了各模块的有效性。
- 对比不同的前馈网络(FFN)和注意力机制,证明了 AFFN 和 WDAM 的优越性。
5. 意义与局限性 (Significance & Limitations)
- 科学意义:
- 填补了基于物理模型与深度学习之间的鸿沟,首次将频闪的“周期性”和“方向性”先验显式地嵌入 Transformer 架构。
- 为结构化退化(Structured Degradation)的图像恢复提供了新的思路,即利用频域和小波域的特性来指导恢复过程。
- 应用价值:
- 提升了短曝光摄影(如 HDR、慢动作视频、运动捕捉)的图像质量。
- 改善了下游视觉任务(如目标检测、分割)在频闪环境下的性能。
- 局限性:
- 当连拍帧中的干净区域无法覆盖整个场景(例如长条形光源完全熄灭且无其他帧补全信息)时,模型难以恢复缺失区域,导致部分恢复失败。
总结:Flickerformer 通过深入分析频闪的物理本质,巧妙地将信号处理理论(相位相关、自相关、小波变换)与现代深度学习架构(Transformer)相结合,解决了连拍频闪去除中的重影和恢复不彻底难题,是目前该领域的 SOTA 方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。