技術要約: Vorch-Streamer
問題提起
学習済みの双方向拡散モデルをストリーミング設定に適応させる際、リアルタイムかつ長時間のオーディオ・ビデオ・アバター生成には、主に2つのジレンマが存在する:
- 露出バイアスと視覚的ドリフト(Exposure Bias and Visual-Drift): 長時間のストリーミングには、モデル自身の予測が後続ブロックのコンテキストとして機能する自己回帰的な生成が必要となる。外見、動き、または同期における小さな誤差が時間の経過とともに蓄積され、クリーンな学習データと自己生成された推論履歴との間に訓練時とテスト時のミスマッチを生じさせる。これにより、複合的なアーティファクトや時間的なドリフトが発生し、長期間の生成を不安定にする。
- グローバルな音声と因果的コンテキストのミスマッチ(Global Speech vs. Causal Context Mismatch): テキスト・トゥ・オーディオ・ビデオ(T2AV)タスクにおいて、入力プロンプトは完全な発話内容を記述している。しかし、ストリーミングウィンドウ内で動作する因果的生成器は、限定的なローカル履歴にしか注意を向けることができない。明示的なプランニングがなければ、モデルはグローバルなトランスクリプトのどの部分を次に話すべきかを判断することが困難になり、その結果、音声が文章の途中で始まったり、時間的な整合性が失われたり、あるいは誤った音声内容を生成したりすることが頻発する。
既存のモデルは通常、双方向のアテンションを持つ短時間のオフラインクリップ用に設計されており、将来のコンテンツを観測することなく次のセグメントを生成しなければならないストリーミングシステムとは互換性がない。さらに、既存のストリーミング・アバターの多くは、外部から供給される駆動音声や参照フレームに依存しており、真に因果的な方法で音声とビデオを共同で合成することはできない。
手法
Vorch-Streamerは、学習済みの双方向LTX2.3オーディオ・ビデオ基盤モデルを、因果的かつリアルタイムな長時間のストリーミング生成器へと拡張するために設計されたポストトレーニング・フレームワークである。このアプローチは、以下の3つの主要なステージで構成される:
1. 合成コーパスの構築
著者らは、学習済みの双方向LTX2.3モデルを用いて、高品質なアバターのオーディオ・ビデオクリップ(持続時間12〜21秒)からなる8万件の合成コーパスを構築した。これにより、学習データがモデルの初期化と一致することを保証し、後続の因果的学習に対してモデルと一貫した監督を提供できる。
2. 因果的オーディオ・ビデオ・ストリーミング(ステージ2)
双方向モデルをブロック自己回帰的なストリーミング生成器に変換するために、著者らは混合トレーニング戦略を採用している:
- 混合ティーチャー・フォーシングとディフュージョン・フォーシング(Mixed Teacher Forcing and Diffusion Forcing): サンプルレベルの混合を用いてモデルを訓練する。10%のサンプルはクリーンな正解の履歴(ティーチャー・フォーシング)を使用し、90%は破損した履歴(ディフュージョン・フォーシング)を使用する。これにより、訓練中に不完全な自己生成コンテキストにモデルをさらすことで、訓練時とテスト時の乖離を軽減する。
- 因果的アテンション・マスキング(Causal Attention Masking): モデルは、微細な相互作用をモデル化するために、同期された各オーディオ・ビデオブロック(約1秒)内では双方向アテンションを維持するが、ブロック間では因果的アテンションを強制する。
- 限定されたコンテキスト(Bounded Context): メモリ使用量を一定に保つため、モデルは最初の3つのブロック(永続的なプレフィックス)と直前の最新ブロックからなる限定されたウィンドウに注意を向ける。
3. 長期的なセルフ・フォーシング(ステージ3)
長いシーケンスにおける誤差の蓄積に対処するため、本フレームワークは**分布マッチング蒸留(DMD)を用いたセルフ・フォーシング(Self Forcing)**を適用する:
- 因果的な学生モデルは、自身の予測に基づき、12〜21秒のフルシーケンスをブロックごとに生成する。
- フリーズされた双方向LTX2.3モデルが、「リアルスコア(real-score)」の教師として機能し、ターゲットとなる分布を表現する。
- 学習可能な「フェイクスコア(fake-score)」モデルが、学生モデルの進化する分布を推定する。
- 学生モデルは、自身の分布と教師の分布との差を最小化するように最適化される。これにより、学習済みの双方向モデルの品質を、長期の因果的軌道へと効果的に転移させつつ、モデル自身による推論時のロールアウト分布にモデルを適応させる。
4. LLMベースの音声プランニング
グローバルなテキストプロンプトとローカルな因果的生成の間のミスマッチを解決するため、Vorch-Streamerは明示的な音声プランニング・パスウェイを導入している:
- 外部の大規模言語モデル(Fun-CosлоsyVoice)が、25 Hz(40 ms単位)で離散的な音声プランニング・トークンを予測する。
- これらのトークンは連続的な特徴量に変換され、専用のクロスアテンション・モジュールを介してオーディオ拡散ブランチに注入される。
- ゲート付き融合演算子が、これらのプランニング特徴量と元のテキスト条件付きオーディオ特徴量を適応的に結合する。
- これにより、音声の「プランニング(何をいつ言うか)」と音声の「生成(どのように合成するか)」を分離し、中断、切り替え、およびインタラクティブなリスニングのための学習可能なサイレンス・トークンの導入を可能にする。
主な貢献
- フレームワーク: 学習済みの双方向オーディオ・ビデオ拡散モデルを、因果的かつリアルタイムな長時間のストリーミング用に適応させるポストトレーニング・フレームワークであるVorch-Streamerの導入。
- 学習戦略: 8万件の合成コーパスの構築、および、因果的学習をストリーミング推論に適合させるための、混合ティーチャー/ディフュージョン・フォーシングと長期セルフ・フォーシングおよび教師蒸留を組み合わせた新しいトレーニング・パイプライン。
- 音声プランニング: 音声の進行、中断、およびサイレント・リスニングを明示的に制御することを可能にする、連続的なプランニング特徴量をオーディオ・ブランチに供給するLLMベースの音声プランニング・パスウェイの提案。これは、ストリームの開始時に将来の発話をすべて固定することなく実現される。
- パフォーマンス: 27.12 FPS(リアルタイムの閾値である24 FPSを超える)でのリアルタイムな長時間T2AVストリーミングを実現し、競争力のある同期性と音声精度を維持していることを実証。
実験結果
著者らは、ネイティブT2AVベースライン(LTX2.3, JoyAI-Echo, OmniForcing, Hallo-Live)および条件付きTIA2Vリファレンス(LiveAvatar, SoulX-FlashTalk)に対し、連続的な長時間ロールアウト(約2分間)を用いてVorch-Streamerを評価した。
- 速度: Vorch-Streamerは単一のNVIDIA H200 GPU上で27.12 FPSを達成しており、評価されたネイティブT2AV手法の中で唯一、リアルタイム再生を超えている。これは双方向LTX2.3(1.83 FPS)や他のストリーミング・ベースラインよりも大幅に高速である。
- 音声精度: 本モデルは**7.92%**の単語誤り率(WER)を達成しており、これはオフラインの双方向LTX2.3(7.59%)に匹敵する。対照的に、明示的な音声プランニングを持たないベースライン(OmniForcing, Hallo-Live)は、長時間への外挿において壊滅的なWER(>90%)に陥る。
- 同期性: 本モデルは、はるかに低速な双方向LTX2.3に匹敵する強力なオーディオ・リップ同期(Sync-C: 6.62, Sync-D: 8.95)を維持している。
- 長期的な安定性: 2分間のロールアウトにおいて、Vorch-Streamerはアイデンティティ保持(ArcFace類似度が0.73–0.77で安定)およびシーンの一貫性(CLIP類似度が0.92–0.94付近)の劣化が極めて少ない。他のネイティブT2AV手法は、同様の期間において顕著なドリフトとアイデンティティの喪失を示す。
- アブレーション研究:
- LLM音声プランナーを削除するとWERが184%となり、因果的T2AVにおける明示的なプランニングの必要性が確認された。
- ステージ2(因果的初期化)を削除すると、モーション崩壊が発生する(Dynamic Degreeが0.2706から0.0824に低下)。
- ステージ3(長期セルフ・フォーシング)を削除すると、WERが高くなり(9.17%)、ドリフトが増大する。
- コンテキスト窓の3+1(3つの永続的プレフィックス・ブロック + 1つの直前ブロック)が、アイデンティティ保持と誤差蓄積のバランスを取る上で最適であることが示された。
意義
本論文は、強力な双方向基盤モデルをリアルタイムかつインタラクティブなアバター生成に適応させるための実用的な経路を、Vorch-Streamerが確立したと主張している。長期セルフ・フォーシングを通じて露出バイアス問題を解決し、明示的なLLMベースのプランニングを通じて音声進行の問題を解決することで、本フレームワークは、因果的かつ長時間のネイティブなテキスト・トゥ・オーディオ・ビデオ生成を可能にする。外部の音声や参照フレームに依存する条件付きパイプラインとは異なり、Vorch-Streamerは両方のモダリティをゼロから生成し、シーケンス長に比例してメモリが増大することなく、長期間にわたって安定性と同期性を維持する。