← 最新の論文
💻 computer science

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait は、高レベルなラベルを精密な顔のキーポイントに変換するために階層的なマルチモーダル大規模言語モデルエージェントを活用する 2 段階のフレームワークであり、これによりポートレートアニメーションにおける目元領域の微細な制御や感情を超えた状態の表現を可能にしつつ、高い視覚的品質と同一性の整合性を維持します。

原著者: He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある人物の静止画を、話したり動いたりするように生き生きとさせることを想像してみてください。現在の多くの手法は、監督に非常に漠然とした台本を与えるようなものです。「彼を怒ったように見せろ」あるいは「彼女を幸せそうに見せろ」といった具合です。結果はまあまあのものですが、目はしばしば死んだように見えたり、動きが滑らかすぎてロボットのように見えたりします。一方、一部の手法ではあらゆる微小な筋肉の動きを制御できますが、それは監督にまぶたや眉毛のすべてのピクセルを手作業で動かすよう依頼するに等しく、驚くほど大変な作業であり、高度な技術スキルを必要とします。

CogPortraitは、完璧な中庸を探ろうとする新しいシステムです。あなたは「彼は一生懸命考えている」や「彼女は眠くなってきた」といったシンプルで高レベルな指示を与えるだけで、目や頭がどのように動かればリアルに見えるかを自動的に計算し、あなたが重労働を担うことなく、それを実現します。

その仕組みは、以下の 2 つの主要な幕に分けて説明できます。

第 1 幕:「脳」(エージェントチーム)

動画が生成される前に、システムは 3 人の AI「エージェント」(専門的な制作クルーと考えるとよいでしょう)のチームを用いて、あなたのシンプルなアイデアを詳細な動きの計画に変換します。

  1. プランナー(監督): このエージェントは、あなたのシンプルなラベル(例:「認知的努力」)を受け取り、タイムラインに分解します。「まず、人物が 1 秒間上を見上げ、次にわずかに目を細め、その後左を向く」といった具合に決定します。これは出来事のストーリーボードを作成するものです。
  2. コンポーザー(司書): このエージェントは、実際の人間の行動記録のライブラリに入ります。「考えながら目を細める」や「眠気を感じてゆっくり瞬きをする」人々の実際の例を見つけ出します。これらの実生活の断片を継ぎ接ぎして、現実的な動きのシーケンスを作成し、目が奇妙でロボットのような動きをしないように保証します。
  3. クリティク(品質管理検査員): このエージェントは計画を二重にチェックします。「これは実際に考えているように見えるか?人間がそんなに速く瞬きをするのは物理的に可能か?」と問いかけます。計画がおかしい場合、それをコンポーザーまたはプランナーに戻して修正させます。

このチームの成果は、コンピュータにまぶた、眉、瞳孔が各瞬間に正確にどこにあるべきかを伝える、正確な座標(キーポイント)のセットです。

第 2 幕:「体」(動画生成器)

動きの計画が整うと、第 2 段階が引き継ぎます。これは実際に動画を描画する部分です。

  • ペインター: 元の写真、音声(これにより口唇が声に合わせて動く)、そして第 1 幕からの詳細な動きの計画を受け取ります。
  • スマートブラシ(動的ガイダンス): 通常、AI が描画する際、顔の色と背景の色が混ざってしまったり、目がぼやけて見えたりすることがあります。CogPortrait は、目に特別な注目を払う「スマートブラシ」を使用します。「背景は安定して自然に保ちつつ、目と眉には追加の精度を適用して、瞬きや視線移動がリアルに感じられるようにせよ」という具合です。
  • セーフティネット(KTO 精製): 時には、AI が人物がほぼ横を向く、あるいは片方の眉だけを上げるような厄介な状況に直面することがあります。これを修正するため、システムは特別な「ハードモード」データセットで訓練されました。これらの困難なケースにおける自らの失敗から学び、奇妙な角度であっても人物の顔が歪んだり、同一性が保たれなくなったりしないことを保証します。

なぜこれが重要なのか?

この論文は、これらのシステムの性能を評価するための新しいテストEMH(Emotions and Beyond-Emotions:感情とそれを超えたもの)を導入しています。これは「幸せ」や「悲しみ」といった基本的な感情だけでなく、以下のような微妙な状態もテストします。

  • 認知的努力: 深い集中の表情。
  • 眠気: 重たいまぶたとゆっくりとしたうなずき。
  • 回避的反応: 素早く視線をそらすこと。

結果は、CogPortrait が以前の手法よりも目を制御する能力がはるかに優れていることを示しています。それはキャラクターを「疲れている」ように、あるいは「考えている」ように、高い精度で表現できつつ、人物が自分自身に見えるように保ち、動画の品質も高く維持します。これは「使いやすい」(ラベルを入力するだけ)と「非常にリアル」(精密な目の動き)の間のギャップを埋めるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →