这项创新的核心在于如何利用这种三维知识。研究人员并不要求计算机在每次更换脸部时都构建一个完整的 3D 模型;相反,他们仅在系统学习期间使用 3D 信息。一旦训练完成,该模型就可以仅使用标准的 2D 图像进行脸部交换,这使得整个过程既快速又实用。系统获取一个人的一张源图像,以及另一人在不同姿势下的目标图像。然后,它利用从三维训练中学到的经验来重建目标的脸部,将目标特征替换为源人物的特征,同时严格保持目标的头部角度和面部表情。这确保了最终的图像看起来像是源人物自然地出现在场景中,而不是仅仅把一张贴纸贴在另一张脸上。
为了测试这种方法是否真的有效,研究人员使用包含高质量真实人物肖像的公开数据集中的数千张图像进行了广泛的实验。他们将他们的新系统与几种现有的最佳方法进行了比较,包括较旧的基于 GAN 的工具和较新的扩散模型。结果显示出 DiffSwap++ 的明显优势。当研究人员测量交换后的脸部在保留原始人物身份方面的表现时,他们的方法始终比以往任何方法得分更高。在旨在测试交换后的脸部是否能欺骗生物识别系统的测试中,Diff-Swap++ 在保留源身份方面显著优于其竞争对手。与此同时,它并没有牺牲目标姿势或表情的自然感。其他方法往往会产生略显扭曲的脸部,或者无法完全转移身份,而 DiffSwap++ 生成的图像既高度逼真,又忠实于原人物。
换脸涉及将源脸部的身份特征转移到目标脸部,同时保留目标的姿态、表情和背景。虽然生成对抗网络(GAN)已被广泛使用,但它们面临训练不稳定以及经常产生明显伪影和身份一致性差的问题。近期的扩散模型方法提高了保真度,但在处理细微伪影和弱身份保持方面仍存在困难。现有扩散方法的一个主要局限在于缺乏对底层 3D 面部结构的显式建模。由于缺乏 3D 感知,模型难以有效地将身份与姿态及表情进行解耦,导致换脸结果要么无法成功转移源身份,要么扭曲了目标的属性。此外,现有的 3D 感知扩散方法(如 DiffSwap)通常将 3D 特征限制在推理阶段的特征点生成,而不是将其直接用于指导训练过程。
2. 方法论:DiffSwap++
作者提出了 DiffSwap++,一种利用 3D 感知潜表示来引导扩散生成过程的新型流水线。该方法完全在预训练潜扩散模型(LDM)的语义潜空间内运行,并使用去噪扩散隐式模型(DDIM)以提高效率。
核心组件
3D 感知训练,2D 推理: 一个关键创新是,DiffSwap++ 在训练期间结合了 3D 面部信息,但在推理时无需 3D 特征。这确保了模型能够学习鲁棒的几何解耦,而无需在部署时具备 3D 重建能力。
3D 潜特征提取: 系统利用基于 EG3D 的预训练 3D 面部重建模型,将 2D 面部图像投影为 3D 潜嵌入。这些嵌入按三个粒度层级进行组织:
粗粒度(第 1-4 层): 控制低频结构几何(头部形状、姿态)。
中粒度(第 5-9 层): 管理局部特征(眼睛形状、嘴部结构)。
细粒度(第 10-14 层): 代表高频细节(皮肤纹理、光照)。 这些特征被聚合形成一个整体的 3D 潜向量 (f3D),用以捕捉结构化身份。
消融实验: 实验证实,用于 3D 特征聚合(结合粗、中、细粒度层)的“平均池化 (Avg. Pool)”策略比仅使用特定层能获得更好的身份检索率 (79.30%)。研究还验证了身份特征和特征点特征对于训练都是必不可少的,且 4 步 DDIM 在训练期间提供了最佳平衡。
5. 重要性与主张
论文声称 DiffSwap++ 解决了扩散换脸中 3D 感知缺失的关键局限。通过在训练中引入 3D 潜特征,模型有效地将身份与姿态及表情解耦,从而实现了既具有照片级真实感又高度有效转移源身份的换脸效果。
作者强调,该方法在推理时不需要 3D 特征,因此具有实际应用价值。这项工作的意义在于其能够生成难以与真实图像区分开的换脸结果(高 IAPAR),同时保持目标的结构完整性。论文总结道,DiffSwap++ 通过量化指标和人类用户研究的验证,在实现高平均保真度和一致生成质量之间提供了最有效的平衡。代码已公开,以促进该领域的进一步研究。