← 最新の論文
💻 computer science

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

本論文は、パーソナライズされた人物画像生成における顔の忠実度と全体的な外観の一貫性の間のトレードオフを解決するために、動的バランシング・スケーリング(DBS)戦略によって強化されたデュアルブランチ・フレームワークを導入するとともに、包括的なアイデンティティ評価のためのPexels-100ベンチマークを公開するものである。

原著者: Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは映画スタジオの監督だと想像してください。ただし、俳優を雇う代わりに、あなたが描写した通りのキャラクターを呼び出すことができる魔法のカメラを持っています。あなたは、親友と全く同じ笑顔、同じ瞳、同じ癖のある鼻を持つヒーローが、火星で宇宙服を着ている姿や、中世の森でドラゴンに乗っている姿を見たいと考えています。これが「パーソナライズされた画像生成」という夢です。長い間、AIアーティストは、二つのもどかしい選択肢のどちらかを選ばなければなりませんでした。親友の顔にはそっくりだが、服装や体つきがどうなっているかを忘れてしまうか、あるいは、完璧な衣装とポーズを実現したが、結局見知らぬ人の顔になってしまうかです。それは、ケーキを焼く際に、デコレーションのクリームを完璧にするか、スポンジを完璧にするかのどちらかしか選べず、両方を同時に完璧にすることができないようなものでした。この論文は、人工知能のこの特定の領域を掘り下げ、人物の「全身のアイデンティティ(顔、そして服装や雰囲気のすべて)」を一貫させるという難しい問題に取り組んでいます。

ユシュアン・シャオ(Yuxuan Xiao)氏らの研究チームによるこの研究は、どちらか一方の側につくことをやめることにしました。彼らはまず、「ネイティブ・デュアル・ブランチ(Naive Dual-Branch)」システムを構築しました。これは本質的に、AIのための二車線の高速道路のようなものです。一方のレーンは全体像(服、体型、ヘアスタイル)に焦点を当て、もう一方のレーンは顔の細部にズームインします。彼らは、この二車線のアプローチは良い出発点ではあるものの、少し混沌としていることを見出しました。「顔のレーン」はスピードを出しすぎて車全体を支配してしまい、「外見のレーン」はバックミラーの中で見失われてしまっていたのです。その結果はどうでしょう? 顔は素晴らしいのですが、服が時々奇妙なものに変形したり、体型が押しつぶされたりしてしまうのです。

この交通渋滞を解消するために、チームは**ダイナミック・バランシング・スケーリング(DBS)という賢い交通管制システムを発明しました。これは、オーケストラのスマートな指揮者のようなものです。指揮者は主に二つのテクニックを使います。第一に、彼らは適応型テンポラル・ゲーティング(Adaptive Temporal Goring)を使用します。これは、曲のさまざまな瞬間において、顔と体の演奏者の音量を調節するディマー・スイッチのようなものです。プロセスの初期段階では、指揮者はアイデンティティを確立するために顔に安定した信頼できる旋律を奏でさせますが、曲が進むにつれて、顔に埋もれないように体や服のボリュームを緩やかに上げていきます。第二に、彼らはリージョン・アウェア・オプティマイゼーション(Region-Aware Optimization)**を導入しました。AIが絵を描いている場面を想像してください。通常、AIはキャンバス全体に同じ筆圧で描いてしまいます。この新しいテクニックは、AIにこう伝えます。「おい、顔を描くときは非常に慎重かつ精密に描きなさい。でも、服や背景にも同じくらい注意を払うのを忘れないように。」これにより、AIが目だけに執着してシャツを無視してしまうことがなくなります。

チームは、人物のアイデンティティがさまざまなシーンでどれほど維持されているかを確認するために、Pexels-100と名付けた独自のベンチマークを用いて、新しい手法をテストしました。これには、全身画像100枚が含まれています。結果は有望でした。彼らの手法は、他のオープンソースのツールよりもはるかに優れたバランスを実現し、顔の認識性を保ちつつ、服や体も正しく見えるようにすることに成功しました。実際、彼らのアプローチは非常に優れた性能を発揮し、一部の高価なクローズドソースの商用システムにも匹つきました。しかし、著者らは、これがまだあらゆる問題に対する魔法の杖ではないことも注意深く述べています。もしAIに、複雑な体操の宙返りや手の細かな動きを描かせようとすると、基礎となるAIモデルがいまだにそれらのトリッキーな物理的構造に苦戦しているため、画像が少しぐにゃぐにゃしたり歪んだりすることがあります。しかし、ほとんどの日常的なシナリオにおいては、この新しい「指揮者」がAIを調和させ、顔だけでなく人物全体がその人らしく見えるように助けてくれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →