✨ 要約🔬 技術概要
あなたは映画を観ているところだと想像してみてください。しかし、ただ座って物語が展開されるのを待つのではなく、あなた自身が監督であり、脚本家であり、そして主演俳優でもあるのです。あなたは「カット!」と叫び、シーンの途中でプロットを変更することができます。すると、映画はあなたの新しいアイデアに基づいて即座に次のシーンを更新 します。これがリアルタイム・インタラクティブ・ビデオ生成 の夢です。長い間、コンピュータでビデオを作ることは、ケーキを焼くことによく似ていました。材料(プロンプト)を混ぜ合わせ、(生成という)オーブンで焼くのを待ち、オーブンから出されたときには、それはもう完成していました。もしチョコチップをもっと追加したければ、最初からやり直さなければなりませんでした。しかし、もしオーブンの中で焼いている最中にレシピを変えることができ、その結果、ケーキが即座に調整されたとしたらどうでしょう? それが「ライブ・モデル」の世界です。これらは、質問に答えて止まるだけのプログラムではなく、ビデオゲームの登場人物のように、あなたのコマンドを与えた瞬間に反応できるよう、絶えず動き続けているコンピュータ・プログラムです。大きな課題は、常に物語の一貫性を保つことでした。もし途中で物語を変えたら、キャラクターは自分が誰だったかを忘れてしまうのでしょうか? 背景はぼやけた塊になってしまうのでしょうか? ビデオはループに陥ってしまうのでしょうか? 科学者たちは、正気を失ったりスタイルを損なったりすることなく、こうした長く変化する物語を扱えるシステムを構築しようと試みてきました。
ここで、Visko Orbis 1.0 が登場します。これは、決して眠ることのない、超スマートで疲れを知らないビデオ監督のようなシステムです。これは、1時間ずっとビデオの物語を紡ぎ続けることができる魔法のストーリーテラーだと考えてください。もしあなたが突然、「実は、空を紫色にして、犬を飛ばせて」と決めたとしても、ビデオはクラッシュしたり再起動したりしません。代わりに、あなたの新しいアイデアを進行中の物語の中にシームレスに織り込み、1秒足らずでその変化を見せます。開発チームは、単に5秒間の短いクリップを作るのではなく、数時間続く「ライブストリーム」としてのビデオを構築しました。彼らがこれを「ライブ・モデル」と呼ぶのは、それが生き続け、活動し続け、直前の1分間や直前の1時間の記憶を保持しているため、プロットが紆余曲折してもキャラクターや景色が一貫性を保てるからです。
では、この魔法のようなトリックはどのように機能するのでしょうか? ビデオが一度に作られるのではなく、「チャンク」と呼ばれる、小さくて目に見えないレゴブロックのようなもので作られていると想像してください。システムは一つのチャンクを作り、次に、また次のチャンクを作ります。秘訣は、重要な詳細(主人公のシャツの色や森のスタイルなど)を保持しながら、決して詰まることのない特別な「メモリ・バンク」です。ビデオが長くなるにつれ、システムは「30分前に何が起きたか」といった古い、遠い記憶を要約へと圧縮 し、一方で直近の過去(最後の数秒間)については高解像度のまま保持します。これにより、コンピュータが混乱したり、色が奇妙な緑色に漂ったりすることなく、ビデオを数時間実行できるのです。
この論文は、このシステムが4Kビデオ (非常に鮮明でクリアな映像)を毎秒24フレーム (滑らかな映画の標準速度)でリアルタイムに生成できることを示しています。つまり、ビデオが作られているのと同時に、画面上にビデオが現れるのを観ることができ、あなたがカートゥーン、ライブストリーム、あるいはバーチャル・コンパニオンを作っている場合でも、いつでも新しいプロンプトを入力でき、ビデオは即座に更新されます。研究者たちはこれを他のトップシステムと比較検証し、Visko Orbis 1.0が、ビデオの見た目を維持し、指示に従い、長期間にわたって安定性を保つ上で最高であることを明らかにしました。実際、人間が複数の選択肢の中から最高の長いビデオを選ぶゲームを行った際、人々は他のどのシステムよりもVisko Orbis 1.0を選び、特にその安定性と信頼性の高さについて賞賛しました。
チームは単にエンジンを構築しただけではありません。彼らは、膨大なビデオ・ライブラリから学習する方法も教え込み、AIが意味の通じる物語を語れるように、悪いものを排除し、良いものを整理しました。彼らはさらに、ボールを投げたときに、それが浮いている風船ではなく、本物のボールのように落下するように、特別な「物理チェック」も加えました。その結果、このツールはビデオ生成を、静的な一度限りのタスクから、人間と機械の間の、生き生きとした対話へと変貌させました。それは単にビデオを作ることではありません。物語を生き続けさせ、あなたが望むときはいつでも方向を変えられるようにし、一度も糸を見失わないようにすることなのです。
技術サマリー: Visko Orbis 1.0
問題提起
現在の動画生成システム(Sora、Veo、Klingなど)は、主にオフラインのパラダイムで動作しています。これは、ユーザーがプロンプトを送信し、処理を待機した後、変更不可能な固定のクリップを受け取るというものです。これらのシステムは視覚的な忠実度や短尺の生成には優れていますが、ビデオが生成されながら消費される(例:ライブストリーミング、インタラクティブなストーリーテリング、バーチャルコンパニオン)ようなライブでインタラクティブな体験 をサポートするには至っていません。既存のストリーミングやインタラクティブな動画への試みは、因果的ストリーミング、限定的なインタラクション、あるいは長期間の安定性といった孤立した側面のみに対処していることが多く、リアルタイムのユーザー制御、品質の低下を伴わない持続的な長尺生成、および漸進的なデリバリーを同時にサポートするエンドツーエンドのシステムは欠如しています。さらに、このようなモデルをリアルタイムでサービングするには、状態の再利用、並列実行、および漸進的なアップスケーリングに関連する推論のボトルネックを解決する必要があります。
メソドロジー
Visko Orbis 1.0は、**ライブモデル(Live Model)として定式化されています。これは、継続的なクロックの下でリアルタイムに動画を生成し、再初期化なしに更新を受け入れる持続的なプロセスです。本システムは、先行するロールアウトの限定的なマルチスケールメモリを維持しながら、連続的な時間チャンクを生成する チャンク単位の潜在ビデオモデル(chunk-wise latent-video model)**に基づいています。
1. データキュレーションとトレーニングパイプライン
トレーニングパイプラインは、大規模な生動画コレクションをフィルタリング、アノテーション、およびリバランスするためのマルチステージ・データエンジンを利用しています。
データ処理: 生の動画は、ショット認識型のクリッピング(3〜240秒)、レイヤー化された安全性フィルタリング、およびカスケード型の品質フィルタリング(構造的完全性、時間的コヒーレンス、および動きを評価)を受けます。分布のリバランスにより、特定の視覚スタイルへのモデル崩壊を防ぐため、多様なドメイン(自然、都市、工業、ゲーミング)にわたるカバー範囲を確保します。
キャプション生成: マルチステージのキャプションシステムは、全体的な監督のためのシングルイベント・キャプション と、アクションを特定の区間に拘束するイベント整合的な時間軸キャプション を生成し、これによりモデルが単一のビデオ内でのプロンプト切り替えを扱えるようにします。
漸進的トレーニング:
双方向事前学習: 強固な視覚的事前知識を確立するために、1〜5秒の動画で学習を行います。
ストリーミング適応: 線形整流フロー(linear rectified-flow)目的関数を用い、3〜10秒の動画を用いた因果的かつチャンク単位の生成へと適応させます。
中間学習: 動きの自然さと時間的コヒーレンスを向上させるため、シングルイベントおよびマルチイベントのデータに特化して学習を行います。
ファインチューニング: 高品質で人間がキュレーションしたサブセットを使用して、視覚的忠実度とイベント遷移を洗練させます。
ポストトレーニング: ガイダンス蒸留(無条件ブランチの除去)による数ステップ・フロー・ポストトレーニング 、および視覚的品質、動き、テキスト・ビデオ整合性を最適化するための**グループ相対強化学習(GRPO)**を含みます。物理的な妥当性をスコアリングするために、潜在世界モデル(latent world model)が候補となる未来を評価します。
2. モデルアーキテクチャとメモリ
定式化: モデルは、テキスト指示 c k c_k c k 、視覚的リファレンス r k r_k r k 、および限定的な履歴 H k H_k H k に条件付けられたチャンク z k z_k z k を生成します。指示は外部制御として扱われます。更新は未確定のチャンクにのみ影響を与えます。
限定的マルチスケールメモリ: 時間単位のロールアウトを維持するため、システムは直近の履歴をネイティブな潜在解像度で保持し、古いスパンを固定容量の学習済み状態へと段階的に圧縮します。これにより、エラーの蓄積や色のドリフトを防ぎつつ、チャンクごとの計算量を一定に保ちます。
超解像: 専用のシングルリファインメント・ビデオ超解像モデル が、ネイティブな832 × 480のチャンクを4K出力へと変換します。これは、チャンク間の自己回帰的な依存関係を導入することなく、動きの一貫性を保持するために、時間的に蒸留されたオートエンコーダと空間ウィンドウ・アテンションを採用しています。
3. 推論とサービング
推論スタックは、漸進的なデリバリー とリアルタイムのインタラクション のために設計されています。
ライブ制御: プロンプトは非同期にエンコードされ、チャンクの境界で適用されます。ローリング・プロンプト要約が、インタラクションを通じたコンテキストを維持します。
最適化された実行: システムは、コンパイルされたTransformer実行、融合カーネル、およびフルシーケンスのマルチGPU実行(Ulyssesスタイルのシーケンスシャーディングを使用)を利用して、レイテンシを最小限に抑えます。
ドリフト安定化: 蓄積されたエラーに対するロールアウトを安定させるため、コンテンツ適応型コントロール(例:加法的摂動、時間的RoPEスケーリング、および動き認識型のネガティブプロンプトルーティング)が適用されます。
出力: パイプラインは、プロンプト更新に対する平均可視応答時間を1秒未満に抑えつつ、24 FPSで4Kビデオを配信します。
主な貢献
統一されたライブビデオ定式化: 視覚的状態がチャンク間で引き継がれる、持続的なチャンク単位の潜在フロー・プロセス。これにより、ロールアウトを再起動することなく、時間インデックス付きの指示による制御が可能です。これは、単一のインターフェース下でのT2V、I2V、およびV2Vの継続をサポートします。
イベント整合的なデータとトレーニング: 時間的に局所化されたキャプションを生成するマルチステージ・データエンジンと、短尺ビデオの事前知識から履歴条件付きストリーミングへと移行するカリキュラムを提供します。これには、プロンプト切り替えと長期間の安定性に特化したトレーニングが含まれます。
長期間生成のための限定的メモリ: 直近の履歴を高解像度で保持し、古いデータを固定の状態に圧縮するメカニックにより、明らかな品質低下や色のドリフトを伴わずに、1時間規模のロールアウトを可能にします。
数ステップ・フロー・ポストトレーニング: ガイダンス蒸留、自己強制(self-forcing)分布マッチング、およびGRPOベースの強化学習を組み合わせたパイプラインにより、ビデオ品質の報酬および物理的妥当性にモデルを適合させます。
ストリーミング高解像度システムの共同設計: 状態の再利用、バッチワンのシーケンス並列性、およびリファレンス認識型超解像モデルを統合した最適化されたサービングパイプラインにより、リアルタイムの4Kデリバリーを実現します。
結果
論文では、複数のイベント切り替えを含む1〜3分の動画を含む74のケースを用いて、Helios、Self-Forcing、LongLive、Causal-Forcingなどの最先端システムと比較し、Visko Orbis 1.0を評価しています。
定量的指標:
DOVER: 最高のアエステティック(審美性)スコア(0.8101)およびテクニカル(技術的)スコア(0.5572)を達成。
VideoAlign: 最良の視覚的品質(1.5777)および動きの品質(1.8646)スコア、ならびに最高のテキスト整合性ロジット(0.1043)を獲得。
人間による嗜好性 (HPSv3): フレーム平均8.1018、最小値6.9719を記録。
人間による嗜好性アリーナ: 9つのシステムを用いたサイドバイサイド調査において、Visko Orbis 1.0は最高の**総合Elo(1838)および最高の 時間的安定性Elo(1940)**を達成しました。他のシステム(例:HappyOyster)が競争力のある視覚的忠実度を示した一方で、Orbisは、一貫した長時間の視聴体験を維持し、指示の切り替えを処理する上で明確な優位性を示しました。
長期間の整合性: 図1は、3600秒(1時間)のロールアウトにおいて、ベースラインシステムがドリフトを示すのに対し、本システムが安定した審美性、プロンプト整合性、および色の彩度(HSV軌跡)を維持していることを示しています。
重要性と主張
本論文は、Visko Orbis 1.0を、ビデオ生成におけるライブモデル(Live Model)パラダイムの最初の実現例として位置付けています。これは、ビデオ生成の境界を、限定された静的なクリップの生成から、制御可能な 視覚的ストリーム の維持へとシフトさせるものであると主張しています。状態を持つ生成、イベント整合的なトレーニング、および効率的なリアルタイムサービングを統合することで、本システムは、ユーザーが展開されるビデオを継続的に操縦することを可能にします。著者らは、この研究が、高い視覚的忠実度と時間的安定性を維持しながら、ライブストリーミングやインタラクティブなストーリーテリングから、ロボティクスやバーチャルコンパニオンに至るまでのアプリケーションをサポートし、ビデオ生成をレスポンシブなクリエイティブ媒体へと進化させるものであると断言しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×