← 最新论文
🤖 AI

Fusion Embedding for Pose-Guided Person Image Synthesis with Diffusion Model

本文提出了一种名为 FPDM 的新型基于扩散的姿态引导人物图像合成框架,该框架利用显式的图像 - 姿态融合模块与对比学习,将源姿态嵌入与目标图像进行对齐,从而显著提升了在不同姿态和外观下的纹理保真度与生成一致性。

原作者: Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张朋友穿着特定服装的照片(源图像),以及一个不同姿势的简笔画(目标姿势)。你的目标是生成一张新照片,展示同一位朋友穿着完全相同的服装,但摆出新的姿势。这被称为姿势引导的人物图像合成

长期以来,计算机在处理这一任务时一直举步维艰。它们要么姿势准确但服装出错,要么服装正确却丢失了人物身份。

本文作者提出的FPDM方法,利用一种全新的 AI 图像生成“配方”解决了这一问题。

1. 问题所在:“困惑的厨师”

以往的方法就像一位厨师收到了两条独立的指令:“做披萨”(服装)和“把它做成圆形”(姿势)。厨师试图在烹饪过程中将这些指令混合在一起。由于指令在锅中混杂,结果往往杂乱无章。有时披萨看起来是方形的,或者配料丢失了。

从技术角度来看,旧的 AI 模型试图在生成的最后一刻将人物的“外观”与姿势的“形状”融合。这导致了结果不一致:如果你用稍微不同的源图像请求相同的姿势,AI 就会感到困惑,从而改变人物身份或服装纹理。

2. 解决方案:“主蓝图”(融合嵌入)

作者提出了一种名为FPDM的新方法。他们不是在烹饪过程中混合指令,而是在烹饪开始前就创建一份主蓝图

可以这样理解:

  • 旧方法:你递给厨师一张衬衫照片和一张姿势草图,并说:“边做边想吧。”
  • FPDM 方法:你首先将衬衫照片和姿势草图输入,利用一种特殊的翻译器将它们合并为一份单一且完美的蓝图。这份蓝图明确说明:“这是衬衫,以及当人物摆出这个姿势时它看起来的样子。”

3. 如何制作蓝图:“媒人”

他们如何制作这份完美的蓝图?他们使用了一种称为对比学习的技术,它充当了一位严格的媒人

  • AI 通过混合“源照片”和“姿势草图”来创建蓝图。
  • 媒人随后将此蓝图与真实目标照片(真实值)进行比较。
  • 如果蓝图与真实照片不完全匹配,媒人会说:“不,那是错的!”并将它们推开。
  • 如果它们看起来相似,媒人则将它们拉近。

关键在于,作者添加了一个特殊技巧:他们还向媒人展示源照片,并说:“这不是目标;不要将它们混淆。”这迫使 AI 学会区分“人物长什么样”和“他们如何摆姿势”,确保蓝图捕捉到两者之间的关系,而不仅仅是两者的模糊混合。

4. 烹饪过程:“去噪网络”

一旦 AI 拥有了这份完美的融合蓝图,它就会使用一个名为扩散模型的强大引擎。

想象一下,扩散模型就像一位雕塑家,从一块充满噪声和静电的粘土开始。蓝图充当了雕塑家的指南。

  • 雕塑家慢慢去除噪声(即“去噪”部分)。
  • 由于蓝图非常精确且预先对齐,雕塑家确切地知道衬衫上的每一道褶皱和织物上的每一处折痕应该出现在哪里。
  • 最终生成的图像质量极高,既保留了人物身份,服装看起来真实,姿势也完全符合请求。

5. 效果如何?(结果)

作者在两个主要方面测试了该方法:

  1. 时尚照片:他们使用了一个庞大的服装照片数据集(DeepFashion)。他们的方法在保持服装纹理(如条纹或图案)一致性方面表现更好,即使人物转身或改变姿势也是如此。
  2. 手语:他们在手语视频(RWTH-PHOENIX 数据集)上进行了测试。这很棘手,因为手部细节微小且复杂。与以前的 AI 模型相比,他们的方法生成了更清晰的手部图像和更准确的动作。

总结类比

  • 旧 AI:就像试图在有人同时大声喊叫关于姿势和服装的指令时画一幅肖像。你最终得到的是一团模糊的混乱。
  • FPDM:就像一位首席建筑师在动工之前,绘制了一份完美的详细蓝图,将客户的风格与建筑的形状结合在一起。施工队(扩散模型)只需遵循蓝图,从而每次都建成完美的建筑。

该论文得出结论,通过首先创建这种明确的“融合蓝图”,AI 能够生成一致且高质量的图像,既尊重人物身份,又符合新姿势,从而解决了计算机视觉领域的一个主要难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →