✨ 要約🔬 技術概要
ある人物の静止画を、話したり動いたりするように生き生きとさせることを想像してみてください。現在の多くの手法は、監督に非常に漠然とした台本を与えるようなものです。「彼を怒ったように見せろ」あるいは「彼女を幸せそうに見せろ」といった具合です。結果はまあまあのものですが、目はしばしば死んだように見えたり、動きが滑らかすぎてロボットのように見えたりします。一方、一部の手法ではあらゆる微小な筋肉の動きを制御できますが、それは監督にまぶたや眉毛のすべてのピクセルを手作業で動かすよう依頼するに等しく、驚くほど大変な作業であり、高度な技術スキルを必要とします。
CogPortrait は、完璧な中庸を探ろうとする新しいシステムです。あなたは「彼は一生懸命考えている」や「彼女は眠くなってきた」といったシンプルで高レベルな指示を与えるだけで、目や頭がどのように動かればリアルに見えるかを自動的に計算し、あなたが重労働を担うことなく、それを実現します。
その仕組みは、以下の 2 つの主要な幕に分けて説明できます。
第 1 幕:「脳」(エージェントチーム)
動画が生成される前に、システムは 3 人の AI「エージェント」(専門的な制作クルーと考えるとよいでしょう)のチームを用いて、あなたのシンプルなアイデアを詳細な動きの計画に変換します。
プランナー(監督) : このエージェントは、あなたのシンプルなラベル(例:「認知的努力」)を受け取り、タイムラインに分解します。「まず、人物が 1 秒間上を見上げ、次にわずかに目を細め、その後左を向く」といった具合に決定します。これは出来事のストーリーボードを作成するものです。
コンポーザー(司書) : このエージェントは、実際の人間の行動記録のライブラリに入ります。「考えながら目を細める」や「眠気を感じてゆっくり瞬きをする」人々の実際の例を見つけ出します。これらの実生活の断片を継ぎ接ぎして、現実的な動きのシーケンスを作成し、目が奇妙でロボットのような動きをしないように保証します。
クリティク(品質管理検査員) : このエージェントは計画を二重にチェックします。「これは実際に考えているように見えるか?人間がそんなに速く瞬きをするのは物理的に可能か?」と問いかけます。計画がおかしい場合、それをコンポーザーまたはプランナーに戻して修正させます。
このチームの成果は、コンピュータにまぶた、眉、瞳孔が各瞬間に正確にどこにあるべきかを伝える、正確な座標(キーポイント)のセットです。
第 2 幕:「体」(動画生成器)
動きの計画が整うと、第 2 段階が引き継ぎます。これは実際に動画を描画する部分です。
ペインター : 元の写真、音声(これにより口唇が声に合わせて動く)、そして第 1 幕からの詳細な動きの計画を受け取ります。
スマートブラシ(動的ガイダンス) : 通常、AI が描画する際、顔の色と背景の色が混ざってしまったり、目がぼやけて見えたりすることがあります。CogPortrait は、目に特別な注目を払う「スマートブラシ」を使用します。「背景は安定して自然に保ちつつ、目と眉には追加の精度を適用して、瞬きや視線移動がリアルに感じられるようにせよ」という具合です。
セーフティネット(KTO 精製) : 時には、AI が人物がほぼ横を向く、あるいは片方の眉だけを上げるような厄介な状況に直面することがあります。これを修正するため、システムは特別な「ハードモード」データセットで訓練されました。これらの困難なケースにおける自らの失敗から学び、奇妙な角度であっても人物の顔が歪んだり、同一性が保たれなくなったりしないことを保証します。
なぜこれが重要なのか?
この論文は、これらのシステムの性能を評価するための新しいテストEMH (Emotions and Beyond-Emotions:感情とそれを超えたもの)を導入しています。これは「幸せ」や「悲しみ」といった基本的な感情だけでなく、以下のような微妙な状態もテストします。
認知的努力 : 深い集中の表情。
眠気 : 重たいまぶたとゆっくりとしたうなずき。
回避的反応 : 素早く視線をそらすこと。
結果は、CogPortrait が以前の手法よりも目を制御する能力がはるかに優れていることを示しています。それはキャラクターを「疲れている」ように、あるいは「考えている」ように、高い精度で表現できつつ、人物が自分自身に見えるように保ち、動画の品質も高く維持します。これは「使いやすい」(ラベルを入力するだけ)と「非常にリアル」(精密な目の動き)の間のギャップを埋めるものです。
技術概要:CogPortrait
問題定義 既存のポートレートアニメーション手法は、特に眼領域の微細な操作に関して、入力粒度と運動精度の間に大きなトレードオフに直面している。現在の手法は一般的に 2 つのカテゴリーに分類される:
高レベルラベル駆動型手法 :これらは感情ラベルや粗いテキストプロンプトのような単純な入力を受理する。ユーザーフレンドリーではあるが、マクロな意味レベル(例:「怒り」)で動作し、非対称な瞬き、視線の逸れ、眠気や思考といった認知状態のような、微妙で不規則な眼の動態を捉えられない。
運動駆動型手法 :これらは顔のキープポイント、アクションユニット(AU)、または駆動動画のような精密な信号を利用する。高い忠実度を提供する一方で、ユーザーに運動信号の構築という重い入力負担を強いる。さらに、データ不足とトレーニングセットにおける不十分な代表性により、不規則なパターン(例:大きな角度の頭部運動)に直面すると困難をきたすことが多い。
この研究が取り組む核心的な課題は、手動の運動レベル入力を必要とすることなく、高レベルの意味ラベルから眼領域の動態(視線、まぶた、瞬き、眉毛)および頭部姿勢に対する直接的かつ微細な制御を実現することである。
手法 著者は、高レベルラベルを実行可能な顔のキープポイントにコンパイルし、その後高品質なポートレートアニメーションを生成するように設計された 2 段階フレームワークであるCogPortrait を提案する。
ステージ 1:階層的エージェント計画(ラベルからキープポイントへ) テキストから運動信号を直接回帰させること(しばしば過度に平滑化された軌道をもたらす)の代わりに、著者は構造化された思考の連鎖(CoT)マルチモーダル大規模言語モデル(MLLM)エージェントシステムを用いて、高レベルラベルを時間的イベントに分解し、行動プロトタイプを取得する。
計画エージェント :ターゲットラベル(例:「認知的努力」)と任意の微細な指示を、タイムスタンプ、フレームスパン、および局所制約を指定する時間的に構造化されたイベントのシーケンスに分解する。
構成エージェント :選り抜かれたプロトタイプライブラリ から行動プロトタイプを取得し、組み立てる。このライブラリには、真の時間的動態を確保するための実世界の顔の行動データ(AU 強度、視線、頭部姿勢)が含まれている。エージェントは段階化されたイベントをこれらのプロトタイプに一致させ、ターゲット期間に適合するようにトリミングおよびリスケールする。
クリティックエージェント :意味的一貫性と生理学的妥当性を強制する。瞬きの持続時間、瞬き間隔、AU の共活性化、および視線 - 頭部の協調に関する規則に対してシーケンスを検証する。不一致を修正するために、構成エージェントまたは計画エージェントへ修正信号を送信できる。
マッピング層 :FLAME メッシュ変形と剛体回転を用いて、洗練された制御シーケンス(AU、視線、頭部姿勢)を 62 個の特定の顔のキープポイント(まぶた、眉毛、瞳孔、虹彩)に投影する。
ステージ 2:DiT ベースの動画生成 Wan2.2 に基づく拡散トランスフォーマ(DiT)バックボーンが、参照ポートレート、駆動音声、テキストプロンプト、および生成された顔のキープポイントを条件として、最終動画を合成する。
動的クラスターフリーガイダンス(CFG) :一様な背景に共通するグローバルな色シフトと、弱い高周波数の眼の運動に対処するため、著者は動的 CFG 戦略を導入する。これには、グローバルな外観を修正するためにノイズ除去の初期段階でより強いガイダンスを行い、後で弱める時間的再重み付け と、背景のベースガイダンスを維持しながら眼領域にガイダンスを集中させるガウスマップによる空間的再重み付け が含まれる。
KTO ベースの微調整 :トレーニングデータで不十分である「境界ケース」(例:非対称な眉毛制御、大きな角度の頭部回転中のアイデンティティの劣化)に対処するため、モデルは**カネマン - トベルスキー最適化(KTO)**を用いて微調整される。これは、制御精度とアイデンティティの一貫性に対する人間の嗜好にモデルを整合させるために、選り抜かれた望ましい(実データ)および望ましくない(モデル生成の失敗)サンプルを使用し、ペア化された嗜好データを必要としない。
主要な貢献
CogPortrait フレームワーク :階層的エージェント計画、プロトタイプ検索、および制約強制を通じて、高レベルの意味ラベルを微細な眼領域の顔のキープポイントに変換する新しい 2 段階パイプライン。
強化された生成戦略 :局所的な制御性とグローバルな視覚品質のバランスを取るための眼領域認識型再重み付けを備えた動的 CFG の導入と、長尾の不規則な運動パターンにおけるパフォーマンスを向上させるための KTO ベースの微調整。
EMH ベンチマーク :6 つの主要な感情と 6 つの「感情を超えた」状態(例:認知的努力、眠気、社会的関与)を網羅する新しい評価ベンチマーク。微細な眼領域および頭部運動制御を特に評価するために、2 つの AU レベル指標であるAU-F1 (活性化の正しさ)とAU-Temp (時間的軌跡の忠実度)を導入する。
結果 HDTF データセットと新しい EMH ベンチマークにおいて広範な実験が行われた:
HDTF パフォーマンス :CogPortrait は、視覚品質(FID: 16.68, FVD: 32.90)、アイデンティティの一貫性(ID-Sim: 0.9214)、およびリップシンクロにおいて最先端のパフォーマンスを達成した。特に、Eye-LMD(0.0107)で最低値を記録し、2 番目に良い手法に対して 38% の相対改善を示し、優れた眼領域制御を確認した。
EMH ベンチマークパフォーマンス :EMH ベンチマークにおいて、完全なパイプライン(Ours Full)は AU-F1 で 0.9017、AU-Temp で 0.7397 を達成した。これは音声駆動およびラベル駆動のベースライン(例:Sonic, FLOAT, EDTalk)を著しく上回り、真の運動入力を使用していないにもかかわらず、運動駆動型手法(HunyuanPortrait)と互角の性能を示した。
アブレーション研究 :
エージェントベースの計画を除去し、ラベルからキープポイントへの直接マッピングに依存すると、時間的動態が悪化し(AU-Temp が 0.5676 に低下)、
動的 CFG を除去すると、グローバルな色シフトとアイデンティティの一貫性の低下を招き、
KTO 微調整を除去すると、非対称な眉毛運動や大きな角度の頭部回転などの境界ケースにおいて、エラー率が高まり(Eye-LMD が 0.0377 から 0.0311 へ)、アイデンティティの一貫性が低下した(ID-Sim が 0.9089 から 0.9394 へ)。
意義 本論文は、CogPortrait がポートレートアニメーションにおける高レベルの意味的意図と低レベルの運動実行の間のギャップを成功裏に埋めたと主張している。階層的エージェント計画とプロトタイプライブラリを活用することで、以前は手動の駆動信号なしでは制御が困難だった、思考や眠気のような複雑な「感情を超えた」状態の生成を可能にする。この研究は、高レベルラベルから直接微細な眼領域制御を実現しつつ、優れた視覚品質とアイデンティティの一貫性を維持できることを実証し、仮想現実、人間 - コンピュータインタラクション、映画制作におけるポートレートアニメーションの表現範囲を拡大する。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×