← 最新の論文
🤖 AI

CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation

本論文は、離散的な感情カテゴリの限界を克服するために、連続的なバレンス・アローザル(価数・覚醒度)表現とマルチスケール・テンポラル・モデリング・アーキテクチャを活用することで、きめ細かな感情制御と正確なリップシンクロナイゼーションを実現する、オーディオ駆動型の3Dトーキングヘッド生成フレームワークであるCETalkを提案する。

原著者: Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化するデジタルメディアの世界において、実物そっくりのバーチャルヒューマンを作成する能力は、もはや空想科学の領域から実用的な応用の段階へと移行しています。これらのデジタルアバターは、バーチャルアシスタントやバーチャルリアリティにおけるコミュニケーション、そしてインタラクティブなエンターテインメントにおいてますます活用されるようになっています。この分野における中心的な課題は、これらのキャラクターに、単に口だけでなく顔全体で語らせることにあります。初期のシステムは、音声と言葉の動きを一致させることには成功していましたが、人間の会話をリアルに感じさせる微妙で移ろいゆく感情を伝えることには、しばしば苦慮してきました。従来のアプローチでは、感情を「喜び」「悲しみ」「怒り」といった、個別の独立した箱として扱っていました。この手法は、大まかな表現には機能しましたが、笑顔がゆっくりと消えていく様子や、興奮が爆発する前に静かに高まっていく様子といった、人間の感情が持つ流動的で連続的な性質を捉えることはできませんでした。さらに、発話のタイミングと感情のタイミングは根本的に異なります。口は言葉の素早い音に合わせて迅速に動かなければなりませんが、感情による表情は、顔全体を通じてより緩やかに変化していくものです。

合肥工業大学の研究者たちは、これらの特定の問題を解決するために、「CETalk」と呼ばれる新しいシステムを開発しました。感情を硬直したカテゴリーに押し込める代わりに、このシステムは、感情がどれほどポジティブか、あるいはネガジティブか、そしてどれほど活動的か、あるいは受動的かということを追跡する、連続的な二次元マップを使用して感情を記述します。このアプローチにより、コンピュータは人間の会話の自然な満ち引きを反映するように、滑らかに変化する顔の 애니메이션(アニメーション)を生成することが可能になります。研究チームは、既存のビデオ録画から3Dの顔の動きを再構成し、すべてのフレームに対してこれらの連続的な感情値を自動的に推定することで、システムを訓練するための大規模な新しいデータセットを構築しました。このデータは、音声に求められる高速で精密な動きと、気分を伝えるためのより緩やかで広範な動きを、コンピュータに区別させるための必要な基礎を提供しました。

この新システムの核心は、時間の扱い方にあります。研究者たちは、音声と感情が異なる速度で作動することに気づきました。それは、ドラマーが一定の速いビートを刻む一方で、歌手が長くゆっくりとした音を保持する様子に似ています。これを管理するために、システムは処理を2つの並行したパスに分割します。一方のパスは、口や顎の高精度なディテールに焦力し、すべての音節がオーディオと完璧に同期していることを保証します。もう一方のパスは、眉をひそめる、あるいは目を見開くといった、感情を表現するより緩やかで広範な顔の動きに焦点を当てます。これら2つの情報のストリームは、スマートな統合システムによって再び結合され、音声の動きと感情表現のどちらにどの程度の重みを与えるかを、瞬間ごとに決定します。これにより、最終的なアニメーションは、リップシンク(口の動きの同期)において正確であると同時に、感情的な深みも豊かなものとなります。

彼らの成果を検証するため、チームは3種類のビデオデータを用いて、彼らのシステムをいくつかの既存の手法と比較しました。その結果、彼らのアプローチは、従来の最良の手法よりも大幅に正確な唇の動きと、よりリアルな表情を生み出すことが示されました。MEADデータセットを用いたテストでは、彼らのシステムは唇の動きの誤差を約7.48ミリメートルに、顔全体の動きの誤差を約9.91ミリメートルに抑え、この特定のベンチマークにおいて、テストされたすべての技術を上回りました。正確さだけでなく、このシステムは連続的な感情の指示に従う優れた能力も示しました。負の状態から正の状態へと徐々に移行する顔を生成するよう求められた際、システムは高い精度でその経路を辿り、意図された感情の軌跡を競合他社よりもはるかに良く一致させました。

研究者たちはまた、このシステムによって、感情の強さを細かく制御できることも実証しました。入力値を調整することで、声との同期を崩すことなく、キャラクターの表情を微妙に強めたり、あるいは抑えたりすることができました。このレベルの制御は、デジタルヒューマンに真に生命を吹き込み、現実の人間同士の相互作用を定義づけるような、ニュアンスに富んだ連続的な感情の変化を可能にするために極めて重要です。離散的なカテゴリーから脱却し、人間の情動の連続的な性質を受け入れることで、この研究は、バーチャルなコミュニケーションを「機械を見ている」感覚から「人とつながっている」感覚へと変えるための、重要な一歩を踏み出しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →