Multi-View Face and Gesture Animation with Dynamic Gaussians
本論文では、顔と手の個別のモデリングをパラメトリックな上半身メッシュおよび3D Gaussian Splattingと組み合わせることで、正確な表情と手のジェスチャーを伴うフォトリアルで高忠実度な上半身アバターを生成する新しいマルチビュー・パイプラインであるMVFGAを提案し、併せてMVFGA-MoCapデータセットの公開を行う。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ビデオゲームやバーチャル会議のために、実在する人物のデジタルツインを構築しようとしていると想像してください。コンピュータグラフィックスの世界において、これは、人間と全く同じように見え、かつ自然に動き、話すことができるパペット(人形)を作るようなものです。長い間、科学者たちはトリッキーな問題に苦しんできました。それは、どのようにすれば、リアルな感情を込めて微笑むデジタルな顔を作りつつ、同時に、完璧な正確さで手を振ったり指を差したりできるか、という問題です。顔に集中しすぎると、手は硬いブロックのようになってしまいます。逆に全身に集中すると、顔は滑らかで表情のないマスクのように見えてしまうことがあります。この論文は、コンピュータに動く画像を作成する方法を教えることに捧げられた科学の一分野である、コンピュータアニメーションの領域から来ています。この研究は、2つの主要なアイデアに基づいています。1つは「パラメトリックモデル」で、これは人の形に合わせて引き伸ばしたりねじったりできる、柔軟なデジタルの骨格のようなものです。もう1つは「3D Gaussian Splatting(3Dガウス・スプラッティング)」で、これは従来の平らな三角形の代わりに、何百万もの小さく、かすんだ3Dの点を使ってシーンを描画する現代的な手法です。目標は、写真ではリアルに見えるだけでなく、動いたときに生命を感じさせるアバターを作成することであり、それによって、何かが人間らしくありながらも、どこか「違和感」があるときに感じる不気вかな感覚、「不気味の谷」を回避することです。
研究者たちは、Alireza Javanmardi氏とそのチームであり、彼らはMVFGA(Multi-View Face and Gesture Animation with Dynamic Gaussians:ダイナミック・ガウスを用いた多視点顔およびジェスチャー・アニメーション)と呼ぶ新しいシステムを構築することで、この問題に取り組むことにしました。彼らのアプローチは、まるでマスターシェフが、大きな鍋で一度に全ての料理を作ろうとするのではなく、材料を別々に準備してから完璧に組み合わせる方法のようです。全身を一つの巨大で乱雑な塊としてモデリングする代わりに、彼らは特別な「上半身」のパペットを作りました。彼らは標準的なデジタルボディモデルを取り、脚を外科的に取り除き、胴体、頭、腕だけを残しました。そして、彼らは巧妙なことを行いました。このパペットに2つの特化した「コントロールパネル」を取り付けたのです。一つのパネルは(FLAMEと呼ばれるシステムを使用して)顔だけに専念しており、もう一つのパネルは(MANOと呼ばれるシステムを使用して)手だけに専念しています。これにより、コンピュータは顔の表情と指の動きを独立して調整できるため、笑顔が誤って指の形を歪ませたり、手の振りが目の形を崩したりすることがなくなります。
この柔軟な骨格の準備ができたら、彼らは単にワイヤーフレームを作っただけではありません。彼らはパペットを「3D Gaussians(3Dガウス分布)」の層で覆いました。イメージとしては、一掴みの小さく、光り輝く、かすんだ雲を手に取り、パペットの表面にすべて貼り付けるようなものです。これらの雲は単なる装飾ではありません。これらは、その人の肌、髪、衣服の色と質感を持っています。パペットが動くと、これらの雲はそれに合わせて伸び縮みし、カートゥーンではなく、写真のような超リアルで高精細な画像を作り出します。コンピュータにこれを教えるために、チームは単一のカメラは使用しませんでした。彼らは被験者の周りに円状に配置された17台のカメラを備えたスタジオを設置しました。彼らは、おかしな顔をしたり、複雑な手のジェスチャーを行ったり、自由な会話をしたりする15人の異なる人々を撮影しました。これにより、MVFGA-MoCupと名付けられた膨大なデータセットが作成され、コンピュータがあらゆる角度から動く人間の光と影がどのように振る舞うかを学習するための訓練場となりました。
彼らの実験結果は非常に印象的なものでした。彼らの新しいシステムを他のトップレベルの手法と比較した際、MVFGAは一貫してより鮮明でリアルな画像を生成しました。例えば、コンピュータ生成の画像が実際の写真にどれだけ近いかを測定した際、彼らの手法の誤差率(L1)はわずか4.06であり、次に優れた手法の誤差である9.59よりも大幅に低い数値でした。視覚的な類似性(SSIM)においては、0.938を記録し、競合を打ち破りました。しかし、本当の魔法は細部にありました。他の手法はしばしば手をぼやけた塊に変えてしまったり、指が交差したときの特定の形状を見失ったりしますが、MVFGAは指を明確かつ正確に保ちました。また、彼らのアバターは、人が話している単純なビデオによって駆動でき、システムは、カメラが実際に捉えていないカメラ角度からでも、デジタルツインに対して顔の表情と手のジェスチャーを忠実に再現できることも分かりました。
しかし、著者たちは、これがすべてを解決する魔法の杖ではないことも注意深く指摘しています。彼らのシステムは依然として基礎となる「骨格」モデルに依存しているため、例えば、風でシャツが激しくはためいたり、帽子が脱げ落ちたりするような「二次的な動き」を簡単に扱うことはできません。なぜなら、それらはモデルが明示的に追跡していない動きだからです。また、システムは主に正面からのビューでトレーニングされているため、アバターを後ろから見ようとすると、データセットが背後からの情報を十分に捉えていないため、少し苦戦します。これらの限界はあるものの、本論文は、顔と手を分離し、それらを3Dの点の雲で包み込むことで、デジタルヒューマンをより真実に近いものにする方法を見出したことを示唆しており、より没入感のあるVR体験や、より優れたデジタルコミュニケーションツールのための道を切り開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。