From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation
本論文は、3D顔アニメーションのための4つの離散音声表現のファミリーを評価し、音素クラスをエンコードすることが正確な予測をもたらすことを実証するとともに、音声と3D顔運動を同時にデコードするために共有された離散表現を利用する、オーディオ・ビジュアル・テキスト・トゥ・スピーチ(AVTTS)パイプラインの導入を可能にするものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに、話しながら同時に顔を動かす方法を教えようとしていると想像してみてください。ロボットの声は手元にありますが、その顔に何をさせるべきかをどうやって伝えるのでしょうか? すべての筋肉の動きを記した詳細な台本を与えるのでしょうか? 生の音声ファイルを与えるのでしょうか? それとも、単純にコード化された指示を与えるのでしょうか?
「From Tokens to Faces」と題されたこの論文は、本質的に「味見」のようなものです。研究者たちは、3Dアニメーションの顔が自然に話すために、どのような種類の「指示コード」が最適であるかを調べようとしました。
4種類の「指示コード」
研究者たちは、人間の音声をコンピュータが理解できるデータ(表現)に変換する、4つの異なる方法をテストしました。
- 「意味的」コード (HuBERT): これは、文章の意味を理解する翻訳者のようなものです。どのような言葉が話されているか、そしてその文脈を理解しています。言葉の「概念」を理解することに長けています。
- 「音響的」コード (WavTokenizer): これは、高速なオーディオ圧縮機のようなものです。意味や特定の文字には関心を持たず、純粋に音波とその質感に焦点を当てます。音を再現することには非常に効率的ですが、言葉についての知識は持っていません。
- 「ハイブリッド」コード (SpeechTokenizer): これは、上の2つを混ぜ合わせたものです。言葉の意味と、音のテクスチャの両方を同時に理解しようと試みます。
- 「ラベルベース」コード (CosyVoice2): これは、チェックリストを使う厳格な教師のようなものです。音声を特定の離散的なラベル(特定の文字や音など)に分解し、流動的な音よりも言語の構造に焦点を当てます。
実験:フェース・デコーダー
研究者たちは、これら4つの異なるコードを2種類の異なる「フェース・ドライバー(顔の制御装置)」(デコーダー)に入力しました。
- GRU: 顔のフレームを一つずつ、ステップバイステップで見ていくドライバーです。
- Transformer: 段落を読んで流れを理解するように、文章全体を一度に把握するドライバーです。
そして、生成されたアニメーションの顔が、実際の人間とどれだけ一致しているかを、3つの方法で測定しました。
- 数学的測定: ロボットの唇と人間の唇の距離を測定します。
- 滑らかさ: 顔がガタついていないか、あるいはスムーズに動いているかをチェックします。
- 「人間の目」テスト: 本物の人間がビデオを視聴し、ブラインドテストのように、どれほどリアルに見えるかを評価しました。
研究結果
驚くべき結果を分かりやすく説明します。
- 「意味」が重要: 「意味的」コード(翻訳者)と「ラベルベース」コード(チェックリスト)が勝者でした。これらは最もリアルな顔を作り出しました。顔を自然に動かすためには、単に音波がどのように振動しているかではなく、何が話されているのか(音素クラス)を知る必要があることが判明しました。
- 音が多すぎると逆効果: 「音響的」コード(純粋な音)と「ハイブリッド」コード(音+意味)は、パフォーマンスが低かった。コンピュータが生の音の詳細に集中しすぎると、唇の動かし方について混乱してしまうようです。音の「ノイズ」が、顔のアニメーションの邪魔になってしまったのです。
- 最高のドライバー: 離散的なコードに対しては、ステップバイステップのドライバーよりも、「Transformer」ドライバー(文章全体を見るもの)の方がはるかに優れた結果を示しました。
- 「ラベルベース」の驚き: もともとテキスト読み上げ(TTS)用に設計された「ラベルベース」のコードが、「意味的」コードに匹敵するほどの結果を出しました。これは、よりシンプルで構造化されているため、非常に大きな発見です。
大きなアイデア:「オールインワン」のマシン
この論文の最もエキサイティングな部分は、AVTTS (Audio Visual Text-to-Speech) と呼ぶ新しいアイデアです。
通常、喋るキャラクターを作るには、2つのステップを踏む必要があります。
- テキストを音声に変換する。
- その音声を動く顔に変換する。
研究者たちは、「ラベルベース」のコードが音声を表現するのに非常に優れているため、これを共有言語として使えることを示しました。システムにテキストを入力すれば、中間ステップを必要とせず、音声と動く顔の両方を完全に同期させて、同時に出力できるのです。それはまるで、指揮者が一枚の楽譜から、オーケストラ(声)とダンサー(顔)の両方を同時に指揮しているようなものです。
まとめ
ロボットの顔をリアルに見せるために、音波のあらゆる微細なディテールを教え込む必要はありません。代わりに、話されている音や文字についての、明確で構造化された理解を与える必要があります。コンピュータに、音声の明確な「地図」(例えば、音のチェックリスト)を与えれば、たとえ生の音声ファイルがなくても、唇を完璧に動かす方法を見つけ出すことができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。