← 最新の論文
💻 computer science

DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping

DiffSwap++は、3D顔構造を利用してアイデンティティをポーズや表情から分離することで、顔の入れ替えにおけるアイデンティティ保持と幾何学的整合性を向上させる新しい3D潜在制御型拡散フレームワークであり、複数のベンチマークにおいて既存の手法を凌駕しています。

原著者: Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Weston Bondurant, Arkaprava Sinha, Hieu Le, Srijan Das, Stephanie Schuckers

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルイメージングの領域において、ある人の顔を別の人の体に置き換える能力は、芸術と複雑な数学を融合させたものとして、長らく人々を魅了してきました。長年、これらの画像を作成するために使用されてきたツールは、敵対的生成ネットワーク(GAN)として知られる一種の人工知能に依存してきました。これらのシステムは、一方が偽の画像を生成しようとし、もう一方がその偽造品を見破ろうとする、二人の競い合う芸術家のように機能します。時間の経過とともに、この競争が、作成者を驚異的な熟練へと駆り立てるのです。しかし、このプロセスは極めて不安定であることで知られており、しばしば、人間の目でも容易に判別できるような、特徴のぼやけや奇妙な歪みを伴う、わずかに違和感のある画像を生み出します。より最近では、拡散(ディフュージョン)と呼ばれる異なるアプローチが登場しました。競争ゲームではなく、拡散モデルは、石の塊をゆっくりと精緻化していく彫刻家のように、ノイズを徐々に取り除いて鮮明な絵を浮かび上がらせます。これらの新しいモデルは、よりシャープな画像を生成しますが、依然として特定の課題に直面しています。それは、新しいポーズや表情の中に配置された際に、その人の真のアイデンティティを維持することです。顔の三次元構造に対する深い理解がなければ、コンピュータは、その人の独特な特徴を、頭の角度や笑顔の形と混同してしまうことがあり、その結果、リアルではあるものの、別人に見えてしまうという結果を招きます。

ノースカロライナ大学シャーロット校の研究チームは、この特定のパズルを解くために、「DiffSwap++」と呼ばれる新しい手法を開発しました。彼らの研究は、最終的に作成される画像は平坦な二次元であるにもかかわらず、コンピュータに顔の目に見えない三次元の骨格を理解させることに焦点を当てています。研究者たちは、顔を完璧にスワップするためには、システムが顔が正面からどのように見えるかだけでなく、特徴が空間の中でどのように配置されているかを知る必要があることに気づきました。これを達成するために、彼らは顔の奥行きと容積を捉える特殊なデジタルマップを用いてモデルを訓練しました。訓練フェーズにおいて、コンピュータは平坦な写真をこの三次元空間へと投影する方法を学び、標準的な画像へと戻す前に、その基礎となる構造を分析します。このプロセスにより、モデルは、その人のアイデンティティ(独特の骨格や肌の質感)を、ポーズや表情(それらの構造の一時的な位置)から分離することができるのです。

この革新性は、この三次元的な知識がどのように使用されるかにあります。研究者たちは、顔をスワップするたびにコンピュータに完全な3Dモデルを構築させることは要求しません。代わりに、学習している間のみ、この3D情報を使用します。一度訓練されれば、モデルは標準的な2D画像のみを使用してスワップを実行できるため、プロセスは高速かつ実用的です。システムは、ある人物のソース画像と、異なるポーズをとっている別の人物のターゲット画像を取り込みます。そして、三次元的な学習から得られた教訓を用いてターゲットの顔を再構成し、ターゲットの頭の角度と表情を厳格に維持しながら、その特徴をソースとなる人物の特徴へと置き換えます。これにより、最終的な画像が、単に異なる顔の上にステッカーを貼り付けたようなものではなく、ソースの人物が自然にそのシーンに存在しているかのように見えるようになります。

彼らの手法が実際に機能するかどうかをテストするために、研究者たちは、実在の人物の高画質なポートレートを含む公開データセットから数千枚の画像を用いて、広範な実験を行いました。彼らは、古いGANベースのツールや新しい拡散モデルを含む、既存の最良の手法と比較しました。結果は、DiffSwap++に明確な優位性があることを示しました。スワップされた顔が元の人物のアイデンティティをどの程度保持しているかを測定した際、彼らの手法は以前のどのアプローチよりも一貫して高いスコアを記録しました。スワップされた顔が生体認証システムを欺けるかどうかを検証するテストにおいて、DiffSwap++は、競合する手法よりもソースのアイデンティティを保持することにおいて著しく成功しました。同時に、ターゲットのポーズや表情の自然さも損ないませんでした。他の手法はしばしば、顔がわずかに歪んで見えたり、アイデンティティの転送に失敗したりすることがありましたが、DiffSwap++は、非常に写実的でありながら、元の人物に忠実な画像を生み出しました。

チームはまた、人間の目にとって画像がいかに説得力があるかを確認するために、ボランティアを対象とした調査も行いました。参加者は、スワップされた顔のセットを見せられ、アイデンティティ、表情、およびポーズがどの程度保持されているかを評価するよう求められました。結果は、コンピュータによる測定が示した内容を裏付けるものでした。人々は、DiffSwap++によって作成された画像が最も写実的で説得力があると感じました。顔は自然で、デジタル操作を露呈させるような奇妙なアーティファクトや不自然な混ざり合いは見られませんでした。対照的に、他の手法では、虚ろな目や口の周りの不規則な質感など、偽造を示す兆候が残されることがありました。三次元的な構造への意識を学習プロセスに統合することで、研究者たちは、視覚的に素晴らしいだけでなく、アイデンティティの保持において科学的に堅牢なレベルの細部と正確性を達成することが可能であることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →