这篇论文讲的是NTIRE 2026 挑战赛中的一个特别项目,叫做“动态场景下的多曝光图像融合”。
为了让你轻松理解,我们可以把这项技术想象成**“给手机拍照开‘超级美颜’和‘时间暂停’魔法”**。
1. 核心问题:为什么手机拍照有时候会“翻车”?
想象一下,你拿着手机在户外拍风景。
- 场景太亮(比如太阳):天空一片白,看不清云彩。
- 场景太暗(比如树荫下):树叶黑乎乎,看不清纹理。
- 手抖了:照片糊了。
- 有人跑过:照片里的人变成了“鬼影”或者断成了两半。
传统的手机拍照只能拍一张,要么亮处过曝,要么暗处死黑。为了解决这个问题,现在的手机会连续拍好几张(多曝光):一张拍亮的,一张拍暗的,一张拍正常的。
难点在于:如果这几张照片里,人动了、云飘了、或者手抖了,把它们强行拼在一起,就会像拼图拼错了一样,出现重影(Ghosting)或者错位。这就好比你想把三个不同时间点的视频剪辑成一张完美的照片,但主角一直在动,这太难了!
2. 这次比赛在比什么?
这次比赛(Track 2)就是给全球顶尖的 AI 科学家出了一道难题:
“请设计一个 AI 程序,能把动态场景(有运动、有抖动)下拍的一堆曝光不同的照片,完美地融合成一张既清晰、又明亮、还没有鬼影的高清照片。”
- 数据量:比赛提供了 100 组训练题(7 张图一组)和 100 组考试题(5 张图一组)。
- 评委标准:不仅要看照片有多清晰(像显微镜一样),还要看照片看起来自不自然(像人眼一样),以及 AI 算得够不够快(能不能在手机里跑动)。
3. 获胜者是怎么做到的?(创意类比版)
这次有 114 支队伍参赛,最终WHU-VIP 团队拔得头筹。我们可以看看他们的“独门秘籍”:
🏆 冠军:WHU-VIP —— “聪明的剪辑师”
- 策略:他们不贪心,只选 3 张最关键的图(一张正常的,一张极亮的,一张极暗的)来融合,而不是把 7 张全塞进去。这就像做沙拉,只选最新鲜的三样食材,比把一整筐烂菜叶都倒进去要好。
- 黑科技:
- SFT 模块(空间特征变换):像一个智能调光师。如果某块区域太亮或太暗,它会自动调整该区域的“亮度滤镜”,让细节显现出来。
- DCM-RG 模块(可靠性门控):像一个安检员。如果它发现某张照片里的人手抖了(不可靠),它就会把这个人的“鬼影”部分屏蔽掉,只保留清晰的部分。
- 训练法:他们用了“课程学习”。先教 AI 学简单的对齐,再教它处理剧烈运动,最后教它怎么把照片修得像真的一样(感知增强)。
🥈 亚军:SHL —— “全局视野的向导”
- 策略:他们给 AI 加了一个“上帝视角”。虽然 AI 是在处理小方块(局部),但他们把整张图缩小后给 AI 看,告诉它:“嘿,整体结构是这样的,别把房子修歪了。”
- 黑科技:引入了NPR 损失(邻域像素关系),就像修图时的“防抖动”功能,强制让相邻的像素保持和谐,防止边缘出现锯齿或模糊。
🥉 季军:nunucccb —— “专注细节的 Transformer"
- 策略:使用了Transformer架构(现在最火的 AI 模型类型)。它像一个超级侦探,能同时看到所有照片里的所有细节,并找出它们之间的关联,把对齐做得非常精准。
其他选手的绝招:
- untrafusion:像搭积木一样,从小的碎片开始拼,慢慢拼成大图,避免一开始就拼错。
- I2 Group & Transsion:像筛沙子,把照片分成“粗糙的沙子”(低频信息,决定整体形状)和“细腻的沙子”(高频信息,决定纹理),分别处理后再合起来。
- NTR:像去噪一样,把照片当成有杂音的录音,通过“时间条件”把杂音(鬼影、模糊)一点点抹去。
4. 比赛结果说明了什么?
- 赢家通吃:冠军 WHU-VIP 不仅照片清晰,而且没有鬼影,看起来最自然。
- 稳定性是关键:很多队伍在简单的测试题上表现很好,但一到复杂的动态场景(手抖、人跑)就崩了。这说明真正的 AI 不仅要聪明,还要“皮实”,能在各种混乱环境下稳定工作。
- 未来展望:这次比赛证明了,未来的手机拍照将不再受限于手抖或光线复杂。AI 可以像魔法一样,把几秒内拍的一堆“废片”瞬间变成一张电影级的大片。
总结
这篇论文记录了一场AI 摄影大师赛。参赛者们用各种巧妙的算法,解决了“在乱动和光线复杂的情况下,如何把多张照片完美拼成一张”的世界级难题。
最终,WHU-VIP 团队凭借“精选食材 + 智能安检 + 循序渐进”的策略获胜。这意味着,未来的手机相机将更聪明,让你随手一拍,就能得到完美的大片,再也不用担心手抖或逆光了!
1. 问题背景与挑战 (Problem & Challenge)
核心问题:
多曝光图像融合(Multi-Exposure Image Fusion, MEF)旨在通过合并不同曝光水平的图像来扩展动态范围,恢复高光和阴影细节。然而,现有的学术基准大多基于静态场景,而现实世界(特别是移动摄影)中的场景通常是动态的。
主要挑战:
在动态场景下进行多曝光融合面临以下严峻挑战:
- 物体运动与相机抖动:手持拍摄时的抖动和场景中物体的移动会导致帧间错位(Misalignment)。
- 鬼影与伪影:错位会导致融合后的图像出现严重的“鬼影”(Ghosting)和结构失真。
- 光照变化:局部光照变化和不同曝光级别之间的差异增加了配准难度。
- 效率要求:实际部署(如智能手机)要求算法在处理高分辨率输入时具备高效性和稳定性。
目标:
本次挑战赛旨在建立一个贴近真实世界的基准,评估模型在运动、光照变化和相机抖动条件下的鲁棒性,同时兼顾细节恢复、伪影抑制和计算效率。
2. 数据集与评估协议 (Dataset & Evaluation)
数据集设计:
- 训练集:100 个序列,每个序列包含 7 个曝光级别(EV-2 到 EV+2),用于模型训练和验证。
- 测试集:100 个序列,每个序列包含 5 个曝光级别。相比训练集,帧数减少增加了融合约束,考验模型在信息较少时的稳定性。
- 场景特征:包含物体运动、局部光照变化、手持抖动、局部过曝/欠曝等真实退化情况。
评估指标:
- 综合得分公式:结合客观指标与感知质量。
Score=30⋅50PSNR+22.5⋅0.5SSIM−0.5+30⋅(1−0.4LPIPS)
- 该公式平衡了像素级保真度(PSNR, SSIM)和感知质量(LPIPS)。
- 其他考量:最终评审还考虑了推理时间、参数量、FLOPs 以及代码的可复现性。
3. 参赛方法与技术亮点 (Key Methodologies)
本次挑战赛吸引了 114 支团队,987 次提交。以下是获奖及代表性团队的技术方案:
WHU-VIP (冠军)
- 核心架构:基于 AFUNet(Swin Transformer 骨干),针对动态场景进行了改进。
- 输入策略:仅使用 3 帧输入(0 EV 参考帧 + ±2 EV 辅助帧),而非全部 7 帧,以提高效率并减少运动错位。
- 关键模块:
- SFT (空间特征变换):在通道融合后插入,根据局部光照条件自适应调整特征响应,解决运动遮挡和极端曝光问题。
- DCM-RG (带可靠性门控的数据一致性模块):用可学习的像素级门控机制替代固定权重,抑制不可靠区域(如错位或过曝区域)的特征,优先融合鲁棒特征。
- 训练策略:采用课程学习(Curriculum Learning),分四个阶段从基础对齐逐步过渡到感知增强和量化感知训练(8-bit)。
SHL (亚军)
- 核心策略:轻量级全局引导。
- 方法:将全分辨率图像下采样后作为全局上下文输入,与模型输入拼接,提供全局结构先验。
- 损失函数:引入邻域像素关系损失 (NPR Loss),显式约束局部结构一致性,防止像素级优化导致的模糊,保留高频细节。
- 集成:融合 Restormer, Uformer, MST++ 三个骨干网络的预测结果。
nunucccb (季军)
- 核心架构:基于 Context-Aware Vision Transformer (CA-ViT) 的 HDR-Transformer 框架。
- 流程:
- 特征提取:独立卷积提取浅层特征。
- 空间注意力:对非参考特征应用空间注意力,抑制前景运动引起的错位。
- 重建网络:通过 Patch Embedding 和 CA-ViT 块建模全局依赖,利用空洞卷积扩大感受野,并通过残差连接保持参考帧的结构完整性。
untrafusion
- 核心创新:物理曝光先验与尺度演化训练。
- 对齐:引入基于亮度先验的曝光对齐模块,将非参考帧的动态范围线性映射到参考亮度。
- 训练策略:采用渐进式分块策略(Curriculum-based progressive tiling),从小块(256)逐步训练到大块(768),以抑制伪影并适应非线性 JPG 域。
I2 Group & Transsion
- 核心架构:基于小波变换的融合网络。
- 方法:
- 使用离散小波变换(DWT)将输入分解为低频(结构)和高频(细节)分量。
- 低频分支:使用 DehazeFormer-s 处理结构信息。
- 高频分支:设计轻量级残差融合模块,以中间曝光的高频分量为参考,学习其他帧的残差图,避免直接融合所有帧带来的鬼影。
NTR
- 核心架构:基于时间条件扩散自编码器(Time-conditioned U-Net)。
- 策略:从预训练模型微调,优化目标函数以直接匹配官方评分标准(结合 L1, SSIM, LPIPS),并采用几何自集成(Geometric Self-ensemble)提升鲁棒性。
4. 实验结果 (Results)
定量结果 (Top 3):
| 排名 |
团队 |
最终得分 |
特点 |
| 1 |
WHU-VIP |
58.889 |
在 LPIPS(感知质量)上表现最佳,整体平衡性最好。 |
| 2 |
SHL |
58.034 |
PSNR 和 SSIM 最高,但在感知指标上略逊于冠军。 |
| 3 |
nunucccb |
57.000 |
性能稳定,泛化能力强。 |
关键发现:
- 跨阶段稳定性:前几名团队在测试集的两个阶段(不同场景分布)中表现稳定,而排名靠后的团队在第二阶段得分下降明显,说明处理动态变化和错位仍是难点。
- 指标权衡:单纯追求 PSNR/SSIM 往往会导致感知质量(LPIPS)下降(如 SHL 虽然 PSNR 最高,但 LPIPS 较差),冠军 WHU-VIP 成功平衡了结构保真度与感知自然度。
- 视觉质量:获胜方法在抑制鬼影、保留运动物体边缘细节以及处理局部过曝/欠曝区域方面表现显著优于基线。
5. 主要贡献与意义 (Contributions & Significance)
填补了动态场景 MEF 的基准空白:
提出了一个包含真实运动、抖动和光照变化的动态场景多曝光融合基准,填补了学术界静态基准与工业界实际需求之间的鸿沟。
推动了高效与鲁棒的算法发展:
通过引入效率约束(推理时间、参数量)和严格的复现性检查,鼓励了不仅“刷榜”而且“可用”的轻量化、鲁棒性算法(如 WHU-VIP 的 3 帧输入策略)。
验证了多种技术路线的有效性:
展示了 Transformer 架构、小波变换、扩散模型、物理先验引导等多种技术路线在解决动态融合问题上的潜力,特别是课程学习和感知损失优化在提升最终得分中的关键作用。
资源开放:
公开了包含 100 训练/100 测试序列的数据集、参考图像以及所有参赛团队的代码,为后续移动计算摄影和 HDR 成像研究提供了宝贵的资源。
总结:
NTIRE 2026 RAIM Track 2 挑战赛成功地将多曝光图像融合的研究焦点从静态理想环境转向了复杂的动态现实场景。获胜方案表明,未来的方向在于结合物理先验、感知优化以及针对移动端部署的效率设计,以实现真正高质量的动态 HDR 成像。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。