← 最新の論文
🤖 AI

Fusion Embedding for Pose-Guided Person Image Synthesis with Diffusion Model

本論文は、明示的な画像・姿勢融合モジュールと対照学習を用いてソース姿勢埋め込みをターゲット画像に整合させることで、多様な姿勢や外見におけるテクスチャ忠実度と生成の一貫性を大幅に向上させる、姿勢誘導型人物画像合成のための新規拡散ベースフレームワークであるFPDMを提案する。

原著者: Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Donghwna Lee, Kirok Kim, Jisu Lee, Kyungha Min, Wooju Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人が特定の服装を着た写真(ソース画像)と、異なるポーズの棒人形の描画(ターゲットポーズ)を持っていると想像してください。あなたの目標は、その友人がその正確な服装を着たまま、新しいポーズで立っている新しい写真を作成することです。これをポーズ誘導型人物画像合成と呼びます。

長い間、コンピュータはこの課題に苦慮していました。ポーズは正しくても服を崩したり、服は正しくても人物の同一性を失ったりするのです。

ここで、この論文の著者であるFPDMが、AI 画像生成のための新しい「レシピ」を用いてこの問題を解決した方法をご紹介します。

1. 問題:「混乱したシェフ」

従来の手法は、2 つの別々の指示、「ピザを作れ」(服装)と「それを丸くしろ」(ポーズ)を受け取ったシェフのようでした。シェフは調理中にこれらの指示を混ぜ合わせようとします。指示が鍋の中で混ざり合っているため、結果はしばしば乱雑になります。ピザが四角く見えたり、トッピングが失われたりすることがあります。

技術的な用語で言えば、古い AI モデルは、生成の最後の瞬間に人物の「外観」とポーズの「形状」をブレンドしようとしました。これにより結果が一貫しませんでした。わずかに異なるソース画像で同じポーズを要求すると、AI は混乱し、人物の同一性や服の質感を変えてしまうのです。

2. 解決策:「マスター設計図」(融合埋め込み)

著者たちは、調理中に指示を混ぜるのではなく、調理が始まる前にマスター設計図を作成する新しい手法FPDMを提案します。

次のように考えてみてください。

  • 古い方法: シェフにシャツの写真とポーズのスケッチを渡し、「調理しながら考えてくれ」と言う。
  • FPDM の方法: まずシャツの写真とポーズのスケッチを取り、特別な翻訳者を使ってそれらを単一の完璧な設計図に結合する。この設計図は正確にこう言う。「これがシャツであり、これが人物がこのポーズをとったときの見た目だ」と。

3. 設計図の作り方:「仲人」

この完璧な設計図はどのように作られるのでしょうか?彼らはコントラスト学習と呼ばれる技術を使用し、それは厳格な仲人として機能します。

  • AI は「ソース写真」と「ポーズスケッチ」を混ぜて設計図を作成します。
  • 仲人は次に、この設計図を実際のターゲット写真(正解)と比較します。
  • 設計図が実際の写真と完全に一致しない場合、仲人は「いいえ、それは間違っている!」と言い、それらを遠ざけます。
  • 似ている場合、仲人はそれらを近づけます。

重要なのは、著者たちが特別なトリックを加えたことです。彼らは仲人にソース写真も示し、「これはターゲットではない。混同するな」と言います。これにより、AI は「人物がどのように見えるか」と「どのようにポーズをとっているか」の違いを学ぶよう強制され、設計図が両者の単なるぼやけた混合ではなく、両者の間の関係性を捉えることが保証されます。

4. 調理プロセス:「ノイズ除去ネットワーク」

AI がこの完璧な融合設計図を得ると、拡散モデルと呼ばれる強力なエンジンを使用します。

拡散モデルを、ノイズと静電気で満たされた粘土の塊から始める彫刻家だと想像してください。設計図は彫刻家へのガイドとして機能します。

  • 彫刻家はゆっくりとノイズを取り除きます(「ノイズ除去」部分)。
  • 設計図が非常に精密で事前に整合が取れているため、彫刻家はシャツのしわや布の折り目がどこにあるべきかを正確に知っています。
  • その結果、人物の同一性が保たれ、服がリアルに見え、ポーズが要求通り正確に再現された高品質な画像が生まれます。

5. 機能するか?(結果)

著者たちはこれを主に 2 つのことでテストしました。

  1. ファッション写真: 彼らは衣服写真の巨大なデータセット(DeepFashion)を使用しました。彼らの手法は、人物が振り返ったりポーズを変えたりしても、衣服の質感(ストライプや模様など)を一貫して保つのに優れていました。
  2. 手話: 彼らは手話をする人の動画(RWTH-PHOENIX データセット)でテストしました。これは指の細部が小さく複雑であるため難しい課題です。彼らの手法は、従来の AI モデルよりも明確な手とより正確な動きを生み出しました。

要約の比喩

  • 古い AI: 誰かが同時にポーズと服装について指示を叫んでいる間に、肖像画を描こうとするようなもの。結果はぼやけた混乱物になります。
  • FPDM: 建設が始まる前に、マスター建築家がクライアントのスタイルと建物の形状を組み合わせた完璧で詳細な設計図を描くようなもの。建設チーム(拡散モデル)は単に設計図に従うだけで、毎回完璧な建物が完成します。

この論文は、まずこの明示的な「融合設計図」を作成することによって、AI は人物の同一性と新しいポーズの両方を尊重する一貫性のある高品質な画像を生成でき、コンピュータビジョンにおける大きな頭痛の種を解決できると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →