← 最新论文
💻 computer science

DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping

DiffSwap++ 是一种新颖的 3D 潜空间控制扩散框架,它通过利用 3D 面部结构来解耦身份与姿态及表情,从而增强了换脸过程中的身份保持能力和几何一致性,并在多个基准测试中超越了现有方法。

原作者: Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字图像领域,将一个人的脸部换到另一个人身上的能力长期以来一直是一种令人着迷的现象,它将艺术与复杂的数学结合在一起。多年来,用于创建这些图像的工具依赖于一种被称为生成对抗网络(GAN)的人工智能。这些系统的工作方式就像两位竞争的艺术家:一个试图创造一张伪造的图像,而另一个则试图识破这种伪造。随着时间的推移,这种竞争迫使创造者变得极其熟练。然而,这个过程是出了名的不稳定,经常导致生成的图像看起来有些不对劲,带有肉眼可以轻易察觉的模糊特征或奇怪的扭曲。最近,一种被称为“扩散”(diffusion)的不同方法出现了。扩散模型并不像一场竞争游戏,而是像一位雕塑家在慢慢精炼一块石头,通过逐渐去除噪声来展现出一幅清晰的图像。虽然这些较新的模型能产生更锐利的图像,但它们仍然在解决一个特定的问题:当人被置于新的姿势或表情中时,如何保持其真实的身份特征。由于缺乏对脸部三维结构的深度理解,计算机经常会将一个人的独特特征与头部的角度或微笑的形状混淆,导致结果看起来虽然逼真,却属于另一个人。

北卡罗来纳大学夏洛特分校的研究团队开发了一种名为 DiffSwap++ 的新方法来解决这个特定的谜题。他们的工作重点在于教会计算机理解脸部隐形的、三维的骨架,尽管它最终创建的图像是扁平且二维的。研究人员意识到,要完美地交换脸部,系统不仅需要知道脸部从正面看是什么样子的,还需要知道特征是如何在空间中排列的。为了实现这一目标,他们使用一种特殊的数字地图来训练模型,这种地图能够捕捉脸部的深度和体积。在训练阶段,计算机学习将一张扁平的照片投影到这个三维空间中,在将其转换回标准图像之前分析其底层结构。这个过程允许模型将一个人的身份(其独特的骨骼结构和皮肤纹理)与姿势和表情(仅仅是该结构的临时位置)区分开来。

这项创新的核心在于如何利用这种三维知识。研究人员并不要求计算机在每次更换脸部时都构建一个完整的 3D 模型;相反,他们仅在系统学习期间使用 3D 信息。一旦训练完成,该模型就可以仅使用标准的 2D 图像进行脸部交换,这使得整个过程既快速又实用。系统获取一个人的一张源图像,以及另一人在不同姿势下的目标图像。然后,它利用从三维训练中学到的经验来重建目标的脸部,将目标特征替换为源人物的特征,同时严格保持目标的头部角度和面部表情。这确保了最终的图像看起来像是源人物自然地出现在场景中,而不是仅仅把一张贴纸贴在另一张脸上。

为了测试这种方法是否真的有效,研究人员使用包含高质量真实人物肖像的公开数据集中的数千张图像进行了广泛的实验。他们将他们的新系统与几种现有的最佳方法进行了比较,包括较旧的基于 GAN 的工具和较新的扩散模型。结果显示出 DiffSwap++ 的明显优势。当研究人员测量交换后的脸部在保留原始人物身份方面的表现时,他们的方法始终比以往任何方法得分更高。在旨在测试交换后的脸部是否能欺骗生物识别系统的测试中,Diff-Swap++ 在保留源身份方面显著优于其竞争对手。与此同时,它并没有牺牲目标姿势或表情的自然感。其他方法往往会产生略显扭曲的脸部,或者无法完全转移身份,而 DiffSwap++ 生成的图像既高度逼真,又忠实于原人物。

团队还开展了一项针对人类志愿者的研究,以观察这些图像在肉眼看来有多大的说服力。参与者被展示了一组交换后的脸部,并被要求对身份、表情和姿势的保留程度进行评分。结果证实了计算机测量所呈现的情况:人们发现 DiffSwap++ 创建的图像是最真实且最具说服力的。脸部看起来很自然,没有出现经常暴露数字篡改痕迹的奇怪伪影或不自然的融合。相比之下,其他方法有时会留下伪造的迹象,例如空洞的眼睛或嘴部周围不规则的纹理。通过将三维结构意识整合到学习过程中,研究人员证明了实现此前难以达到的细节度和准确度是可能的,从而创造出不仅视觉效果惊艳,而且在身份保留方面具有科学鲁棒性的脸部交换技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →