✨ 要約🔬 技術概要
あなたが映画を観ている場面を想像してみてください。そこでは、あなたがどれほど画面に向かって叫んでも、登場人物にはあなたの声が届きません。彼らに手を振らせたり、驚いた表情を見せたり、シーンを変更させたりすることもできません。あなたはただ、監督が編集をすべて終えるのを座って待つしかないのです。これが、今日のほとんどの動画生成AIの仕組みです。リクエストを入力し、長い時間待ち、そして完成したクリップを受け取るのです。しかし、もしキャラクターが生成されている「最中」に、あなたと対話できるとしたらどうでしょう? もし、「ねえ、グッドポーズをして!」と言ったとき、彼らが会話の真っ最中に即座にそれを行ってくれたらどうでしょうか? これは、リアルタイム対話型ビデオ生成の夢です。これは、静的な、あらかじめ作られた映画と、ライブの会話のような流動的で即時的な性質との間の溝を埋めようとする分野です。これを実現するために、科学者たちは、動画全体を一気に「描く」のではなく、あなたの声にリアルタイムで反応しながら、フレームごとに動画を「ストリーミング」するモデルを構築しています。まるで、人間の俳優が監督の即座の指示に基づいて即興劇を行うかのようにです。
ここで、Vidu S1 が登場します。これは、決してリズムを外さない、超高速で超レスポンシブなデジタル俳優のように機能する新しいモデルです。このプロジェクトの背後にある研究者たちは、結果が出るまで数分、あるいは数時間も待たなければならない「オフライン」の動画生成という問題を解決したいと考えました。代わりに、彼らはあなたの声でデジタルキャラクターをリアルタイムでコントロールできるシステムを構築しました。それは、あらかじめ書かれた脚本に従うだけでなく、あなたの音声コマンドを聞いて、手を振ったり、座ったり、手でハートを作ったりといった動作に即座に反応するビデオゲームのキャラクターのようなものです。面白い点は、これが数秒間だけ機能するのではないということです。論文によれば、Vitu S1は、キャラクターの顔がぼやけたり、動きが変に跳ねたりすることなく、「無限」の時間にわたってこれを維持できることが示唆されています。これは、AIが長い動画を作ろうとする際に通常発生する問題です。
Vidu S1の開発チームは、単に「脳」を作っただけでなく、それを高速に動作させるための超効率的なエンジンも構築しました。彼らは、動画生成をゲーマーが使っているような一般的なグラフィックスカードに押し込むために、特別なテクニック(彼らはこれを「TurboDiffusion」および「TurboServe」と呼んでいます)を使用しました。その結果、モデルは540p の解像度で42 FPS (フレーム毎秒)の速度で動画を吐き出すことができます。これを比較するために言えば、標準的な動画は30 FPSで再生されますが、これは実際にはリアルタイムよりも速いことを意味しており、AIがラグなしにライブの会話についていくことができるのです。研究者たちは、ユーザーが自分自身の写真やアニメキャラクター、さらにはペットの写真をアップロードし、その後、音声による指示を与えるというテストを行いました。モデルは、足を上げる、あるいは親指を立てるといった指示に従いながら、アップロードされた写真と全く同じ顔を維持したまま、動画を生成することに成功しました。
論文が取り組んでいる大きな障壁の一つは、「ドリフト」問題です。人間を描こうとしている場面を想像してください。新しい詳細を加えるたびに、絵全体が徐々に歪んだりねじれたりして、最終的にその人がモンスターのように見えてしまうような状況です。多くのAI動画モデルは、長い動画を作ろうとすると、この問題に直面します。動画が進むにつれて、キャラクターの顔や背景が歪んでしまうのです。Vitu S1は、「TwinCache」と呼ばれる巧妙なメモリシステムを使用して、これを防ぎます。これは、動きをスムーズにするために過去数秒間の「ラフスケッチ」を保持しつつ、キャラクターの顔をシャープで認識可能な状態に保つための「最終的な磨き上げられたバージョン」も保持する、司書のようなものです。これにより、キャラクターが崩れることなく、動画を永遠に流し続けることができます。
論文ではまた、他のモデルも存在しているものの、その多くはインタラクティブにするには遅すぎたり、音声コマンドを直接理解できなかったり、あるいは短時間で崩壊してしまうことも指摘しています。Vidu S1は、まさにその逆となるように設計されています。つまり、あなたの声を直接のコマンドとして受け取り、即座に動画を生成し、あなたが話し続けている間、ずっと安定性を維持するように設計されているのです。テストにおいて、モデルは他のトップシステムと比較されましたが、指示への追従性と動きの自然さにおいて、最高の結果を出しました。研究者たちは、この技術によって、コンピューター上でオンザフライ(即時)で生成され、実在の人物のように見え、動き、ライブでパーソナライズされた会話ができるデジタルキャラクターとの未来に近づいていると述べています。
テクニカル・サマリー:Vidu S1 – リアルタイム対話型ビデオ生成モデル
1. 問題提起
現在のビデオ生成モデル(Sora、Veo、Wanなど)は、主にオフラインの一括生成(one-shot)パラダイム の下で動作しています。ユーザーはプロンプトを入力した後、完全なビデオが生成されるまで数分間待機する必要があり、生成プロセス中に介入したり対話したりすることはできません。この制限は、ディフュージョン(拡散)パラダイムがビデオ全体を同期的にデノイジングし、最後にクリーンな出力を生成するという性質に起因しています。
インタラクティブな視覚体験(ライブストリーミング、対面コミュニケーションなど)への需要は高まっていますが、既存のソリューションには以下の4つの主要な制限があります:
リアルタイムな相互作用の欠如: 多くの自己回帰モデルは逐次的に生成を行いますが、プロセス中の能動的なユーザー介入をサポートしていません。
音声制御の不在: ほとんどの手法は、音声を生の、明示的な制御信号として将来のビデオコンテンツに使用しないため、自然な対話が制限されます。
長期間生成における不安定性: ストリーミング生成では、時間の経過とともに小さな誤差が蓄積し、視覚的なドリフト(逸脱)、不安定化、そして最終的な崩壊を招きます。
インフラストラクチャのボトルネック: リアルタイム生成には、モデルの改善だけでなく、消費者向けハードウェア上で効率的に動作するための専用の推論カーネル、サービングシステム、およびスケジューリング戦略が必要です。
2. 手法
2.1 データ準備
著者らは、異種混合の生のビデオを高品質で時間的整合性のあるトレーニング用クリップに変換するための、漸進的なデータ処理パイプラインを構築しました。
収集: 微細な表情やリップシンクのためのライブストリーム/トーキングヘッド、および角度やスタイルの汎用性のための映画/テレビからソースを取得。
フィルタリング: 解像度、FPSによる事前フィルタリング、シングルショットのクリッピング、被写体フィルタリングを含む多段階のパイプライン。
品質と安全性: 視覚的品質、コンテンツの安全性、ショットの安定性、およびインタラクティビティをフィルタリングするために、エキスパートモデルとグローバルな意味理解のためのOmniモデル を組み合わせて使用。
ダイアリゼーション(話者分離): 音声成分を抽出し、タイムスタンプを注釈付け。セグメントを「オンスクリーン(画面内)」、「オフスクリーン(画面外)」、または「オーバーラップ(重複)」に分類。オーバーラップするセグメントは破棄。歌唱やバックグラウンドミュージック中の誤割り当てを防ぐため、音声エネルギーが低いセグメントを排除するヒューリスティックなルールを適用。
キャプション生成: 2つのレベルで構造化されたキャプションを生成:フルクリップ (グローバルな意味的アンカー)および音声認識によるチャンクレベル (微細な時間的コンディショニング)。視覚と音声の推論を分離してハルシネーションを抑制するデュアルパス戦略を採用。
2.2 トレーニング・フレームワーク
トレーニング・パイプラインは、安定かつ効率的なストリーミング・ビデオ・オーディオ生成を実現するために、3つのステージで構成されています。
ステージ1:双方向ティーチャー・トレーニング: 完全なコンテキスト(c 1 : N c_{1:N} c 1 : N )を条件として、完全なビデオ・オーディオシーケンス(x 1 : N x_{1:N} x 1 : N )に対して双方向モデルを訓練。これにより、高品質な生成プライア(事前分布)を確立。
ステージ2:因果的ティーチャー・トレーニング: モデルをストリーミング自己回帰設定に適応。
因果的マスキング: 各ターゲット状態は、履歴コンテキストと現在の条件のみにアクセス。
ハイブリッド・トレーニング: 自己回帰的なロールアウト中の不完全なプレフィックスに対する堅牢性を向上させるため、ティーチャー・フォーシング (クリーンな正解履歴を使用)とディフュージョン・フォーシング (ノイズを含む履歴状態を使用)を組み合わせる。
ステージ3:正則化を伴う蒸留: 多段階のデノイジングによる計算コストを削減するため、**分布マッチング蒸留(DMD)**を用いてモデルを数ステップのジェネレーターへと蒸留。
PCM正則化: 純粋なDMDで一般的なモード崩壊(ドリフト、退化)を防ぐため、時間的一貫性を維持するために知覚的特徴距離を用いる**フェーズド・コンシステンシー・モデル(PCM)**正則化を追加。
2.3 推論アーキテクチャ
ストリーミング推論: メモリ管理のためにスライディングウィンドウ・デコーディング を採用。
永続的リファレンス・コンテキスト: 「シンク・トークン」として機能し、最初のフレームから安定したグローバル・コンディショニングを提供する。
RoPE再配置: 履歴のキー・バリュー特徴をキャッシュし、更新された相対位置に基づいて回転位置埋め込み(Rotary Position Embedding)を再適用することで、冗長な計算を回避。
TwinCache: 履歴状態を保持するステージ認識型のキャッシュ戦略。ノイズを含むキャッシュ (中間ステップ用、時間的ダイナミクスのローパス・プライアとして機能)と、クリーンなキャッシュ (最終ステップ用、微細な詳細を復元)の2つを保持。
推論インフラストラクチャ: 消費者向けGPUでの低コスト・リアルタイム・サービングを実現するため、TurboDiffusion およびTurboServe 上に構築。
アテンション加速: SageAttention、SpargeAttention、およびSparse-Linear Attentionを使用。
量子化: アウトライヤー(外れ値)を処理しメモリフットプリントを削減するため、CUDAにおけるカスタムのブロック単位W8A8量子化GEMMオペレータを使用。
カーネル融合 & CUDA Graph: オペレータを統合し、固定構造のサブグラフをキャプチャすることで、ホスト起動オーバーヘッドを最小限に抑え、GPU利用率を最大化。
並列性: 計算を複数のGPUに分散するためにUlyssesスタイルのコンテキスト並列を使用。
3. 主な貢献
Vidu S1モデル: 継続的なユーザー操作と、将来のビデオコンテンツに対する明示的な音声制御を可能にする、リアルタイム対話型ビデオ生成モデル。
安定した無限長生成: ストリーミング生成における誤差の蓄積を軽減し、ドリフトや視覚的崩壊のない無制限のビデオストリームを可能にする。
リアルタイムの効率性: 効率的な推論およびサービングスタックにより、消費者向けGPU(RTX 5090)上で540p解像度・42 FPS を達成。
パフォーマンス・ベンチマーク: アイデンティティ保持、オーディオ・ビジュアル同期、および知覚的品質において優れた性能を示しつつ、音声ガイドによる制御をサポート。
4. 実験結果
ベンチマーク: Vidu-StreamBench (アクション指示を含む独自の500サンプル)およびHDTF (標準的な公開ベンチマーク)で評価。
定量的指標: Vidu S1はすべての指標において最高のスコアを記録:
CSIM (Identity): 0.9192
Sync-D (Lip Sync): 7.847
DOVER (Perceptual Quality): 0.5660
人間による嗜好性テスト: HeyGen、LemonSlice、Kling Avatar 2.0とのペア比較A/Bテストにおいて、Vidu S1は一貫して好まれた。特に被写体の制御可能性 (アクション指示への追従においてHeyGen/LemonSliceに対し100%の選好)とモーション・ダイナミクスにおいて顕著であった。
定性的性能: 視覚的比較により、Vidu S1は複雑な指示(例:「手を挙げる」、「サムズアップ」)に成功し、背景の安定性を維持していることが示された。一方で、競合モデルは誤ったジェスチャーや背景のアーティファクトなどの失敗事例が見られた。
スループット: RTX 5090で42 FPSを達成し、リアルタイム再生の閾値である30 FPSを超過。
5. 意義
本論文は、Vidu S1を実用的で制御可能、かつパーソナライズされたリアルタイム生成ビデオシステム への重要な一歩として位置付けています。オフライン生成の限界と、長期間のストリーミングにおける不安定性の問題に対処することで、Vidu S1は高品質なビデオ生成とインタラクティブな視覚エンターテインメントの間の溝を埋めています。効率的な推論インフラストラクチャ(TurboDiffusion/TurboServe)の統合は、高品質なリアルタイム・アバター生成が汎用ハードウェアで実現可能であることを示しており、ライブ会話、バーチャルホスト、教育エージェントなどのアプリケーションを可能にします。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×