← 最新の論文
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1は、ユーザーが音声コマンドを通じてデジタルキャラクターを制御することを可能にし、コンシューマー向けGPU上で視覚的な劣化なしに、最大42 FPSの高品質な540pの無限に続くビデオを生成できるリアルタイム対話型ビデオ生成モデルです。

原著者: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zh
公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが映画を観ている場面を想像してみてください。そこでは、あなたがどれほど画面に向かって叫んでも、登場人物にはあなたの声が届きません。彼らに手を振らせたり、驚いた表情を見せたり、シーンを変更させたりすることもできません。あなたはただ、監督が編集をすべて終えるのを座って待つしかないのです。これが、今日のほとんどの動画生成AIの仕組みです。リクエストを入力し、長い時間待ち、そして完成したクリップを受け取るのです。しかし、もしキャラクターが生成されている「最中」に、あなたと対話できるとしたらどうでしょう? もし、「ねえ、グッドポーズをして!」と言ったとき、彼らが会話の真っ最中に即座にそれを行ってくれたらどうでしょうか? これは、リアルタイム対話型ビデオ生成の夢です。これは、静的な、あらかじめ作られた映画と、ライブの会話のような流動的で即時的な性質との間の溝を埋めようとする分野です。これを実現するために、科学者たちは、動画全体を一気に「描く」のではなく、あなたの声にリアルタイムで反応しながら、フレームごとに動画を「ストリーミング」するモデルを構築しています。まるで、人間の俳優が監督の即座の指示に基づいて即興劇を行うかのようにです。

ここで、Vidu S1が登場します。これは、決してリズムを外さない、超高速で超レスポンシブなデジタル俳優のように機能する新しいモデルです。このプロジェクトの背後にある研究者たちは、結果が出るまで数分、あるいは数時間も待たなければならない「オフライン」の動画生成という問題を解決したいと考えました。代わりに、彼らはあなたの声でデジタルキャラクターをリアルタイムでコントロールできるシステムを構築しました。それは、あらかじめ書かれた脚本に従うだけでなく、あなたの音声コマンドを聞いて、手を振ったり、座ったり、手でハートを作ったりといった動作に即座に反応するビデオゲームのキャラクターのようなものです。面白い点は、これが数秒間だけ機能するのではないということです。論文によれば、Vitu S1は、キャラクターの顔がぼやけたり、動きが変に跳ねたりすることなく、「無限」の時間にわたってこれを維持できることが示唆されています。これは、AIが長い動画を作ろうとする際に通常発生する問題です。

Vidu S1の開発チームは、単に「脳」を作っただけでなく、それを高速に動作させるための超効率的なエンジンも構築しました。彼らは、動画生成をゲーマーが使っているような一般的なグラフィックスカードに押し込むために、特別なテクニック(彼らはこれを「TurboDiffusion」および「TurboServe」と呼んでいます)を使用しました。その結果、モデルは540pの解像度で42 FPS(フレーム毎秒)の速度で動画を吐き出すことができます。これを比較するために言えば、標準的な動画は30 FPSで再生されますが、これは実際にはリアルタイムよりも速いことを意味しており、AIがラグなしにライブの会話についていくことができるのです。研究者たちは、ユーザーが自分自身の写真やアニメキャラクター、さらにはペットの写真をアップロードし、その後、音声による指示を与えるというテストを行いました。モデルは、足を上げる、あるいは親指を立てるといった指示に従いながら、アップロードされた写真と全く同じ顔を維持したまま、動画を生成することに成功しました。

論文が取り組んでいる大きな障壁の一つは、「ドリフト」問題です。人間を描こうとしている場面を想像してください。新しい詳細を加えるたびに、絵全体が徐々に歪んだりねじれたりして、最終的にその人がモンスターのように見えてしまうような状況です。多くのAI動画モデルは、長い動画を作ろうとすると、この問題に直面します。動画が進むにつれて、キャラクターの顔や背景が歪んでしまうのです。Vitu S1は、「TwinCache」と呼ばれる巧妙なメモリシステムを使用して、これを防ぎます。これは、動きをスムーズにするために過去数秒間の「ラフスケッチ」を保持しつつ、キャラクターの顔をシャープで認識可能な状態に保つための「最終的な磨き上げられたバージョン」も保持する、司書のようなものです。これにより、キャラクターが崩れることなく、動画を永遠に流し続けることができます。

論文ではまた、他のモデルも存在しているものの、その多くはインタラクティブにするには遅すぎたり、音声コマンドを直接理解できなかったり、あるいは短時間で崩壊してしまうことも指摘しています。Vidu S1は、まさにその逆となるように設計されています。つまり、あなたの声を直接のコマンドとして受け取り、即座に動画を生成し、あなたが話し続けている間、ずっと安定性を維持するように設計されているのです。テストにおいて、モデルは他のトップシステムと比較されましたが、指示への追従性と動きの自然さにおいて、最高の結果を出しました。研究者たちは、この技術によって、コンピューター上でオンザフライ(即時)で生成され、実在の人物のように見え、動き、ライブでパーソナライズされた会話ができるデジタルキャラクターとの未来に近づいていると述べています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →