Native Audio-Visual Alignment for Generation
NAVA は、63 億パラメータのみを使用しながら、優れた同期性、動画品質、制御可能な音声の音色を実現するために、Align-then-Fuse 型の MMDiT アーキテクチャ内でネイティブな音声・視覚アライメント戦略を採用する、音声と動画の同時生成のための新しいフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あるキャラクターが自転車を乗りながら会話する映画のシーンを作りたいと想像してください。そのためには、自転車が動く映像と、風音や人物の音声という二つの要素が完璧に同期して発生する必要があります。
長らく、コンピュータはこれら二つの要素を別々に生成し、最後にそれらを貼り合わせるアプローチを試みてきました。これは、あるアーティストが自転車を描き、全く別のアーティストが音声を録音し、後でそれらを一致させようとするようなものです。往々にして、音声は口の動きとわずかにずれたり、その特定のシーンにふさわしくない響きになったりしました。
より新しい手法では、アーティスト、声優、監督をすべて同じ狭い部屋に集めて、すべてを同時に作業させる試みがありました。これは互いに会話できる点では役立ちますが、混乱を招きます。「監督」(テキスト指示)が「音響エンジニア」(ノイズのタイミング)と混同され、誰が話しているか、あるいはその声はどのような響きかといった具体的な詳細を制御することが難しくなります。
NAVA の登場:「リハーサル室」アプローチ
この論文は、ワークフローを変える NAVA(Native Audio-Visual Alignment:ネイティブな音声・映像の整合)を紹介しています。別々に作業するか、あるいはすべてを一つの大きな鍋で混ぜてしまうのではなく、NAVA は「Align-then-Fuse(整合させてから融合させる)」と呼ばれる巧妙な二段階のプロセスを採用します。
これを劇場のリハーサルに例えてみましょう。
- リハーサル(整合): まず、俳優(音声)と舞台スタッフ(映像)が専用の「リハーサル室」で出会います。ここで彼らは、監督が新しい台詞を与えることなく、一緒に練習します。足音が地面を踏む映像とどのように一致するか、あるいはギターのストロークが手の動きとどのように一致するかを、正確に把握します。こうして、音と視覚の間に自然で本来的なつながりを築きます。
- 本番(融合): 彼らが一緒に動き、話す方法を理解したら、監督(テキストプロンプト)が登場します。監督はもはや彼らを同期させる方法を教える必要はありません。単に何をするかを指示するだけです。「今、キャラクターは不機嫌な声でこの台詞を言うべきだ」と。俳優とスタッフがすでに同期して動く方法を理解しているため、タイミングを崩すことなく新しい指示に即座に適応できます。
秘密の武器:「Timbre-in-Context(文脈内の音色)
NAVA は、複数の話者を扱う際にも特別な工夫を凝らしています。母親と子供が会話する脚本を想像してください。母親の声が子供の声のように聞こえてはいけません。
従来の手法では、シーン全体の音声を変えるための個別の「音声切り替え」ボタンがあるかもしれません。しかし、NAVA はより賢明です。声の質感(音色)を脚本そのものの一部として扱います。母親の台詞には特定の「音声タグ」を、子供の台詞には別の「音声タグ」を付与します。コンピュータがシーンを生成する際、監督が誰が話しているかのメモ付きで脚本を読むように、どの声がどの文に属するかを正確に把握します。
論文が明らかにした結果
研究者たちは、音声と映像の一致度を測るベンチマークである Verse-Bench と、音声制御をテストする Seed-TTS を用いて、NAVA を他のトップモデルと比較評価しました。
- 優れた同期性: NAVA は、ドアが閉まる音や唇の動きといった視覚的な出来事が発生した瞬間に、音が正確に発生することにおいて最高でした。
- 高品質: 映像は美しく、音声は明瞭でリアルでした。
- 効率性: 多くの競合モデルよりも小型(63 億の「脳細胞」またはパラメータのみを使用)であるにもかかわらず、はるかに大規模なモデルを上回る性能を発揮しました。
- 制御性: 同じシーン内で異なる話者間をシームレスに切り替え、声を明確かつ正確に区別して維持できました。
まとめ
NAVA は、複雑な指示に従う前に、音と映像が一緒に動く方法を学ぶための専用スペースを与えることで、音と映像を生成する問題を解決します。これは、振付師がどの曲で踊るかを伝える前に、ダンスのデュオにステップを完璧にマスターさせるようなものです。その結果、音と映像が単に貼り合わされたのではなく、最初から共に生まれてきたように感じられる映画シーンが実現します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。