← 最新论文
💻 computer science

Face inpainting with Identity Preserving Latent Diffusion Models

本文提出了一种基于潜在扩散模型的 ID-ControlNet,这是一个身份保持的人脸修复框架,它利用面部身份嵌入和一种专门的三元组损失策略,在不进行昂贵微调的情况下重建遮挡区域,同时保持高身份保真度。

原作者: João Santos, Carlos Santiago, Manuel Marques

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: João Santos, Carlos Santiago, Manuel Marques

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张珍贵的家庭合影,但有人用粗黑记号笔涂掉了其中一个人的脸。人脸修复就是一种数字艺术,旨在擦除那笔涂鸦,并在其位置重新绘制一张新面孔,使照片恢复完整。

棘手之处在于?如果你只是让计算机去“填补空白”,它可能会画出一张通用的人脸,虽然看起来不错,却不像原本的那个人。这就像请一位画家重绘你朋友的肖像,但他只知道“人脸”长什么样,却不知道你朋友的脸长什么样。结果画出来的是个陌生人,而不是你的朋友。

本文介绍了一种名为ID-ControlNet的新工具来解决这个问题。以下是其工作原理的通俗解释:

问题所在:“通用”画家

标准的 AI 工具(称为扩散模型)是惊人的艺术家。它们能够填补图片中缺失的部分,效果逼真到难以分辨。然而,它们缺乏关于“这个人是谁”的“记忆”。当它们填补缺失的鼻子或眼睛时,往往会基于“平均”人脸进行猜测。如果缺失的部分对身份至关重要(例如眼睛),AI 可能会无意中完全改变这个人的身份。

解决方案:“身份 GPS"

作者构建了ID-ControlNet,它就像 AI 艺术家的 GPS。

  • 艺术家:他们使用了一个强大的、预训练的 AI 艺术家(基于 Stable Diffusion),它本身就很擅长绘制逼真的人脸。他们并没有重新训练这位艺术家,只是给了它一套新的指令。
  • GPS:他们在艺术家身上附加了一个特殊的“身份检测器”(一个人脸识别系统)。在艺术家开始绘画之前,该检测器会查看人脸的未遮挡部分(如下巴或额头),并生成一张数字“身份证”(嵌入向量),上面写着:“这是 X 号人物。”
  • 引导:随着 AI 绘制缺失部分,“身份证”会持续输入到过程中。这就像有一位严格的监工在艺术家耳边低语:“记住,这是 X 号人物!确保眼睛看起来像 X 号人物的眼睛!”

秘诀:无需重新训练的“训练”

通常,要教会 AI 识别特定的人,你必须花费数小时,用该人物的数百张照片对其进行“微调”。这既缓慢又昂贵。

ID-ControlNet 则不同。它学习了一条通用规则:“我如何利用身份证来指导绘画过程?”一旦学会这条规则,它就能立即将其应用于任何人,而无需为每个新人物重新训练。这就像学会一次游戏规则,而不是为每一位玩家死记硬背一本新的规则书。

新测试:“眼睛”测试

为了证明其方法有效,作者意识到标准测试不够严格。他们创建了一个名为E-Mask的新数据集。

  • 逻辑:他们发现,如果遮住一个人的嘴巴,很难辨认出他是谁。但如果遮住他们的眼睛,就极难认出他们。
  • 实验:他们在数千张照片中仅遮盖眼睛,然后让 AI 进行填补。
  • 结果:当眼睛被遮挡时,标准 AI 工具难以保持身份一致性。然而,ID-ControlNet 成功“记住”了该人物的身份,并绘制出匹配的眼睛,即使它从未见过这个特定的人。

结论

论文表明,ID-ControlNet 是一种“轻量级”升级。它不会拖慢绘画过程,也不需要巨大的计算能力。

  • 视觉质量:图片看起来和以前一样逼真。
  • 身份一致性:即使原图中人物面部有大块缺失,完成后的照片中的人物实际上看起来也与原图中的人物一致。

简而言之,作者给一位才华横溢但健忘的 AI 艺术家配备了一张永久性的身份徽章,使其能够立即重现缺失的面部,并保留正确的身份,而无需事先研究该人物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →