这篇论文就像是一份**“2026 年世界顶级修脸大赛”的赛后总结报告**。
想象一下,你手里有一张模糊、有划痕、甚至有点变形的老照片(或者是一张被压缩得很烂的自拍),你想把它变成一张清晰、皮肤纹理逼真、而且长得还是你自己的高清照片。这就是“真实世界人脸修复”的任务。
这篇论文记录了在 NTIRE 2026 研讨会上举办的这场大赛,看看谁最擅长干这个活儿。
🏆 比赛概况:一场“变废为宝”的较量
- 任务目标:把“烂片”变“大片”。不仅要清晰,还要像本人(不能修成另一个人),还要有真实的皮肤质感(不能像塑料假人)。
- 参赛情况:有 96 支队伍报名,最后 10 支队伍提交了作品,其中 9 支队伍因为“修得太像别人了”或者“修坏了”被刷掉,最终只有 9 支队伍拿到了有效排名。
- 裁判标准:
- 长得像不像:用 AI 人脸识别模型(AdaFace)来测,相似度必须达标。
- 看着爽不爽:用一套复杂的“审美打分系统”(IQA 指标),看图片是否自然、清晰、没有噪点。
🥇 冠军是谁?怎么赢的?
冠军队伍:MiPlusCV
- 他们的绝招:“先粗修,后精修”的两步走战略。
- 第一步(粗修):先用一个强大的 AI 把脸的大轮廓、五官位置大概摆正,把严重的模糊和污渍去掉。这就像是用粗砂纸把木头表面的大坑磨平。
- 第二步(精修):再用一个更厉害的“单步生成”模型(基于 Z-Image 技术),像一位精细的化妆师,一笔一划地画出毛孔、皱纹和皮肤光泽。
- 秘诀:他们不仅靠技术,还专门训练 AI 去“讨好”裁判的打分系统(比如让 AI 知道什么样的图片在机器眼里得分高),这叫“应试教育”式的优化。
亚军:CEVI-KLETech
- 他们的绝招:“分区治理” + “波频魔法”。
- 他们发现,脸的不同部位需要不同的处理。比如眼睛和嘴巴需要更清晰的细节,而脸颊皮肤需要柔和。
- 他们把图片像切蛋糕一样,用“波频变换”把低频(大轮廓)和高频(细节纹理)分开。只给需要细节的地方“加料”,保留原本的结构,这样既清晰又不会把脸修歪。
季军:HONORAICamera
- 他们的绝招:“极速生成”。
- 他们利用了一种叫"Z-Image-Turbo"的模型,就像开了“倍速播放”。通常 AI 画图要一步步慢慢来,他们直接一步到位,既快又好,专门针对真实世界的复杂光线和老化效果进行了特训。
🧠 今年的核心趋势:AI 修脸的新哲学
这篇论文揭示了当前 AI 修脸领域的几个重要变化,我们可以用几个比喻来理解:
从“手工作坊”到“超级工厂”:
以前大家喜欢自己从头训练一个小模型来修脸。现在,大家发现直接借用现成的超级大模型(比如 Stable Diffusion, FLUX.2 等)作为“地基”,然后稍微微调一下,效果反而更好。这就像与其自己造一辆车,不如直接买一辆法拉利,然后给它换个适合越野的轮胎。
“一步到位”成为主流:
以前的 AI 画图要像走迷宫一样,走很多步才能出图。现在的冠军们大多用了**“单步生成”**技术,就像变魔术一样,输入烂图,瞬间变出高清图,速度快且质量高。
“懂规矩”比“瞎发挥”更重要:
虽然现在的 AI 生成能力很强,能凭空画出漂亮的脸,但比赛要求必须像本人。所以,大家不再让 AI 自由发挥,而是给 AI 戴上“紧箍咒”(比如人脸识别约束、结构引导),确保它画出来的脸既美,又不会把张三变成李四。
为了“分数”而优化:
这是一个有趣的现象。很多队伍不仅训练 AI 修图,还专门训练 AI 去理解“什么样的图得分高”。这就像学生不仅努力学习,还专门研究考试评分标准,确保每一分都拿到手。
📝 总结
这篇论文告诉我们,现在的 AI 修脸技术已经非常成熟了。它不再是简单的“去模糊”,而是结合了强大的生成能力(能画出逼真的皮肤)、严格的身份约束(保证是你本人)以及聪明的优化策略(针对评分标准微调)。
未来的修图软件,可能就像冠军队伍 MiPlusCV 做的那样:先快速把脸“扶正”,再用超级 AI 瞬间“换皮”,最后还能保证你看起来既年轻又完全像你。这不仅仅是技术的胜利,更是人类对“完美影像”追求的体现。
1. 问题定义 (Problem)
核心任务:从受严重退化的低质量(LQ)输入图像中恢复出高质量(HQ)的人脸图像。
主要挑战:
- 病态问题 (Ill-posed):严重退化(模糊、噪声、压缩伪影等)导致大量视觉信息丢失,恢复过程缺乏唯一解。
- 双重目标:
- 感知质量与真实性:输出需具备丰富的高频细节(如皮肤纹理),看起来自然逼真,而不仅仅是清晰。
- 身份一致性 (Identity Consistency):恢复后的人脸必须保持与原始低质量输入在身份特征上的一致性,不能产生“换脸”效果。
- 真实世界场景:不同于合成数据,挑战聚焦于包含复杂退化(如老化、色彩褪色、遮挡、大姿态变化)的真实场景图像。
2. 方法论与评估体系 (Methodology & Evaluation)
2.1 数据集
- 训练数据:主要推荐使用 FFHQ (70,000 张高质量人脸),允许使用其他数据集(如 FFHQR),但严禁与测试集重叠。
- 测试数据:由 5 个真实世界数据集组成,共 450 张图像:
- CelebChild-Test (儿童名人,黑白/低质)
- LFW-Test (野外人脸)
- WIDER-Test (大姿态、遮挡、困难光照)
- CelebA (标准人脸属性集)
- WebPhoto-Test (网络图片,含老化、褪色等复杂退化)
2.2 评估流程
- 身份验证 (Identity Check):
- 使用预训练的 AdaFace 模型提取身份嵌入。
- 计算输入 LQ 图像与恢复 HQ 图像之间的余弦相似度。
- 不同数据集设定不同阈值(如 WIDER/WebPhoto 为 0.3,LFW/Child 为 0.6)。
- 规则:若失败案例超过 10 个,则取消排名资格。
- 图像质量评估 (IQA):
- 采用无参考(No-Reference)指标:NIQE, CLIP-IQA, MANIQA, MUSIQ, Q-Align。
- 参考数据集 FID (Fréchet Inception Distance)。
- 最终得分公式:
综合加权得分,公式如下:
Score=CLIP-IQA+MANIQA+100MUSIQ+5Q-ALIGN+max(0,1010−NIQE)+max(0,100100−FID)
3. 关键贡献与主要发现 (Key Contributions & Findings)
3.1 参赛概况
- 共有 96 支队伍注册,10 支队伍提交了有效模型,9 支队伍通过身份验证进入最终排名。
- 冠军:MiPlusCV。
3.2 技术趋势总结 (Top Teams 的核心策略)
通过对前几名队伍的分析,论文总结了当前人脸修复的五大关键趋势:
单步/蒸馏扩散先验的主导地位:
- 前三名队伍(MiPlusCV, HONORAICamera, YuFans)均依赖强大的**单步(One-step)**或固定时间步的生成骨干网络(如 OSDFace, Z-Image-Turbo, SDXL-Turbo)。
- 结论:无需昂贵的多步扩散采样,单步生成即可达到极高的感知质量。
面向指标的精细化优化 (Metric-oriented Refinement):
- 顶级队伍不仅依赖基础模型,还针对挑战赛的评分指标进行显式优化。
- 例如:MiPlusCV 使用 CLIPIQA/MUSIQ 进行奖励微调;YuFans 在测试时直接通过可微分的 CLIPIQA 进行像素级优化。
语义与结构引导的必要性:
- 即使使用强大的预训练扩散模型,显式的人脸感知先验(如语义分割、波域校正)对于维持解剖结构稳定性和身份一致性依然至关重要。
- 例如:CEVI-KLETech 在扩散和自然度阶段之间插入了语义感知的波小波修正模块。
模块化多阶段设计:
- 主流方案采用“粗恢复 -> 感知增强 -> 后处理”的模块化流程,而非端到端训练单一模型。
- 这种设计便于复用强大的生成先验,同时添加特定任务的微调模块。
基础模型适配 (Foundation Model Adaptation):
- 趋势从传统的专用修复网络转向适配大型生成基础模型(如 Z-Image, SDXL, FLUX.2, DiffBIR)。
- 通过参数高效微调(LoRA)和任务特定的控制信号(如退化感知控制)来实现。
4. 代表性参赛方案 (Representative Methods)
| 排名 |
团队 |
核心方法 |
技术亮点 |
| 1 |
MiPlusCV |
两阶段 OSDFace + Z-Image |
第一阶段用 OSDFace 恢复结构;第二阶段用基于 Z-Image 的单步扩散进行细节增强。结合 LoRA 和基于 CLIPIQA/MUSIQ 的奖励微调。 |
| 2 |
CEVI-KLETech |
SA-FGRC (语义感知频域修正) |
在 StyleGAN2 + DiffBIR + DINOv2 的三阶段基线中,插入轻量级模块。利用 Haar 小波变换和语义分割,针对不同面部区域(皮肤、眼睛等)进行高频残差修正。 |
| 3 |
HONORAICamera |
Z-Image-Turbo + OMGSR 策略 |
基于 Z-Image-Turbo,采用 OMGSR 训练策略。固定时间步为 244,平衡重建质量与效率。两阶段训练(先迁移先验,后微调)。 |
| 4 |
YuFans |
SDFace + 测试时优化 |
第一阶段用预训练 SDFace (SDXL-Turbo) 生成;第二阶段直接对像素进行可微分的 CLIPIQA 梯度上升优化,同时保持 fidelity 约束。 |
| 5 |
guaguagua |
DeSC-Face (FLUX.2) |
基于 FLUX.2,将退化图像编码为潜在 Token,作为主干条件和结构化控制分支的输入。通过 LoRA 适配,实现退化感知的结构化控制。 |
| 6 |
NTR |
DiffBIR v2.1 |
直接使用预训练的 DiffBIR v2.1。第一阶段 SwinIR 去噪,第二阶段 IRControlNet 基于 Stable Diffusion 2.1 合成纹理。 |
| 7 |
MaDENN |
CodeFormer 增强版 |
在 CodeFormer 基础上,引入二阶 Real-ESRGAN 退化合成,增加 ArcFace 身份损失和 ROI 感知监督(针对眼、嘴)。 |
| 8 |
SN VISION |
SDXL ControlNet + TinyEnhancer |
两阶段流程:先用 TinyEnhancer 预处理,再结合边缘和人脸掩码作为 ControlNet 条件输入 SDXL 进行生成。 |
| 9 |
ALLCAN |
PRIDE-Face (DiffBIR 改进) |
第一阶段用 GFPGAN 提取强结构先验(替代默认模块),第二阶段用 Diffusion 合成细节。引入显式身份损失和引导校准。 |
| N/A |
BVI |
TADSR 改进版 |
基于 TADSR,在单步学生分支中插入残差噪声修正器,并采用细节感知训练策略。因身份验证失败未获排名。 |
5. 结论与意义 (Conclusions & Significance)
- 范式转变:感知驱动的人脸修复正迅速被高效的生成范式(特别是单步和蒸馏扩散模型)所主导。
- 策略重要性:优秀的结果不再仅依赖恢复骨干网络本身,而是依赖于针对性的优化策略,如语义波域修正、基于指标的微调或测试时优化。
- 约束与生成的平衡:强大的结果不依赖于无约束的生成,而是将基础模型生成能力与语义、结构或身份保持约束相结合,以在提升真实感的同时保留身份特征。
- 社区影响:该挑战赛推动了真实世界人脸修复技术的边界,展示了从传统 CNN/GAN 向大模型(Foundation Models)适配的明确趋势,并为后续研究提供了基准代码和评估标准。
该论文不仅是对一次竞赛的总结,更是对当前计算机视觉领域人脸修复技术现状和未来方向的权威综述。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。