Emotion Intensity Matters: Generating Realistic Expressions in Virtual Humans with CVAEs
本論文は、少数の実在する人間の表情データセットを用いて学習された条件付き変分オートエンコーダ(CVAE)を提案し、手動の介入を必要とすることなく、意味的な一貫性を維持しつつ、変化する感情の強度を正確に反映した、制御可能でリアルなバーチャルヒューマンのアニメーションを生成する手法を提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータグラフィックスの世界において、真に生命を感じさせるキャラクターを創造することは、アーティストが直面する最も困難な課題の一つです。私たちは長らく、リアルな外見を持つバーチャルな人間を構築できるようになってきましたが、彼らに「実在感」を持たせるには、単に優れた顔を作るだけでは不十分であり、感情という微細で変化し続ける言語が必要となります。数十年にわたり、アニメーターはパフォーマンス駆動型アニメーションと呼ばれる手法に頼ってきました。これは、カメラで実際の俳優の顔を捉え、その動きをデジタルキャラクターにマッピングする手法です。この方法は効果的ですが、あらゆる表情に対して人間のパフォーマーを必要とし、最初からやり直すことなくバリエーションを生み出す能力を制限してしまいます。新しいアプローチは、コンピュータに人間の感情のルールを教え込み、俳優の前にカメラを置くことなく、自律的に新しい表情を考案させることを目指しています。課題は、感情は静的なものではなく、かすかな悲しみから圧倒的な嘆きに至るまで、強弱が変化することでした。ほとんどのコンピュータモデルはこのニュアンスを捉えるのが苦手であり、顔が滑らかすぎたり一般的すぎたりして、感情の信憑性を生む特定の強度が欠けてしまうことがよくあります。
ブラジルのポンティフィカル・カトリック・リオグランデ・ド・スル大学の研究者たちは、この問題を解決するための新しい方法を開発し、さまざまな強度のレベルを持つリアルな感情表現をコンピュータに生成させることを目指しました。彼らは、幸福、怒り、恐怖、悲しみ、嫌悪、驚きの6つの基本的な人間の感情に焦点を当てました。コンピュータに単にビデオをコピーさせるのではなく、彼らは一連の実演からこれらの感情の根底にある構造を学習するようにシステムを訓練しました。研究チームは、16人の異なる人物(男性8人、女性8人)がこれら6つの感情を「低強度」と「高強度」という2つの明確な強さで演じているビデオ映像を集めました。この映像から、眉がどれほど高く上がるか、あるいは口がどれほど広く開くかといった、バーチャルな顔の動きを制御する特定の数値値を抽出しました。その結果、7,680の特定の表情の瞬間というデータセットが得られました。これはこのような複雑なタスクとしては比較的少ない数ですが、研究者たちはこれを用いてモデルを学習させました。
彼らの手法の核となるのは、条件付き変分オートエンコーダーと呼ばれる一種の人工知能です。簡単に言えば、このシステムは、一連の例を研究し、その記述に基づいて新しい絵を描くことを学ぶ学生のように機能します。コンピュータには、どの感情が表示されているか、その強度はどの程度か、そしてその人物が男性か女性かを示すラベルと共に、顔のデータが与えられました。システムは、この情報をコンパクトな内部表現へと圧縮することを学習しました。これは、本質的に、それぞれの感情が異なる強さにおいてどのような外見になるかという「心の地図」を作成することに相当します。新しい表情を生成するよう求められた際、コンピュータには「女性の高強度の笑顔」や「男性の低強度の悲しい顔」といった指示を与えることができ、指示に一致する新しい一連の顔の動きを生み出すことができました。研究者たちは、システムが首尾一貫した感情のバリエーションを正常に作成できることを見出しましたが、初期の結果にはこの種のテクノロジーに共通する欠陥がありました。それは、表情が滑らかすぎることでした。コンピュータは詳細を平均化してしまう傾向があり、顔が穏やかで少し退屈な印象を与え、現実の人間の感情が持つ鋭いピークを逃してしまったのです。
この平滑化効果を修正するために、チームはプロセスに第2のステップ、すなわち「精緻化レイヤー」を追加しました。彼らは、最初に使用した実在の人間による表情と、最初のコンピュータモデルによって作成されたわずかに退屈なバージョンとの間の差異を算出しました。そして、その差異のパターンを学習するために、2つ目の特化したシステムを訓練しました。この第2のシステムは、最初のモデルがどこで的外れであったかを特定し、失われたエネルギーとダイナミクスを付け戻す修正ツールとして機能しました。この補正が適用されると、バーチャルの顔は自然な活力を取り戻しました。口の動きはより際立ち、感情の強度は元の人間によるパフォーマンスに近いレベルへと戻りました。統計テストにより、最終的に補正された表情は、初期のコンピュータ生成バージョンよりも実在の人間によるデータに遥かに近く、顔の制御の動きにおける類似性が事実上倍増したことが確認されました。
また、この研究では、独立した別のコンピュータプログラムが、これらの新しいバーチャルな顔の感情をどの程度正確に認識できるかを測定しました。補正ステップの前では、コンピュータは特に恐怖や驚きのような複雑な感情の識別において苦戦することがありました。しかし、精緻化ステップの後には、ほとんどの感情において認識率が大幅に向上しました。これは、加えられた詳細が単なるランダムなノイズではなく、真の感情的な手がかりであることを示唆しています。研究者たちは、システムが低強度と高強度の両方のレベルでうまく機能していることを指摘しており、これは、新しいシナリオごとに再学習させることなく、人間の表現の全範囲を扱えることを証明しています。このシステムが、実際の観客にとってどれほど自然に感じられるかについては、さらなる人間による観察が必要ですが、結果は、比較的少ない実世界のデータセットから、制御可能で表現力豊かなバーチャルキャラクターを作成することが可能であることを示しています。このアプローチは、人間による俳優や手動の芸術的調整を絶えず必要とすることなく、人間の感情の全スペクトルを表現できるデジタルキャラクターを作成するための前進となる道筋を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。