Video = World + Event Stream
本論文は、ビデオを永続的な「世界」と動的な「イベントストリーム」の組み合わせとして捉えることで、環境の変化やエージェントの振る舞いの低遅延かつ汎用的な予測を可能にする、リアルタイムの音響・視覚相互作用モデルであるWan-Streamer v0.3を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
映画を観ている場面を想像してみてください。ただ座って眺めているのではなく、あなたはシーンの中にいて、登場人物と会話をし、彼らも即座にあなたに返答してくるのです。これが**リアルタイム人工知能(リアルタイムAI)**の刺激的な世界です。コンピュータは、人間同士の友人のように、私たちを理解し、即座に反応しようとしています。これを行うために、AIは「目に見えるもの(ビデオ)」、「耳に聞こえるもの(オーディオ)」、「言葉や行動(テキストとアクション)」という3つの要素を同時に操る必要があります。長い間、ラグなしでこれらすべてをAIに行わせることは、重いバックパックを背負ってマラソンを走るようなもので、動作は遅く、ぎこちないものでした。研究者たちが問い続けてきた大きな疑問は、「どうすればAIに、自分がいる『舞台』とその上で起きている『アクション』を理解させ、自然かつ即座に反応させることができるのか?」ということでした。
そこで登場するのが、Alibaba GroupのWanチームによる新しい創造物、Wan-Streamer v0.3です。この論文を、超高速で超スマートなデジタル俳優のための巧妙なレシピだと考えてください。著者たちは、ビデオを変化し続ける一つの巨大で混乱したピクセルの塊として扱うのではなく、それを「ワールド(世界)」と「イベント・ストリーム(出来事の流れ)」という2つのシンプルな要素に分解できることに気づきました。「ワールド」とは、あなたが今いる部屋、家具、人物の顔、そして背景音といった、安定した要素のことです。これらは大きく変化しません。「イベント・ストリーム」は、人が歩いたり、話したり、手を振ったり、車が通り過ぎたりといった、変化するすべての要素です。ビデオを「ワールド」と「イベント・ストリーム」の組み合わせとして理解させることで、AIは次に何が起こるかを予測する能力が格段に賢く、速くなったのです。
大きなアイデア:舞台と劇
この論文は、ビデオに対する新しい視点を提案しています。劇場を想像してください。「ワールド」は舞台装置です。描かれた背景、照明、小道具、そして役者の衣装です。劇が始まれば、これらのものはほとんど変わりません。「イベント・ストリーム」は劇そのものです。役者が舞台を横切る、叫ぶ、小道具を落とす、あるいは振り向くといった動きです。
過去のAIモデルは、劇全体と舞台装置の両方を一度に学習しようとして苦戦していました。Wan-Streamer v0.3は、よりシンプルなトリックを提案しています。それは、**「AIに舞台装置を一度だけ教え、その後は劇だけに集中させる」**という方法です。
研究者たちは、膨大な量の現実世界のビデオを用いてモデルを訓練しました。単にAIに次のフレームを推測させるのではなく、「ワールド」(例えば、日当たりの良い郊外の通りや鶏小屋)を見せ、その後に続く「イベント・ストリーム」(例えば、通りを走るロボットや、鶏に餌をやる女性)を予測するように教えたのです。モデルは、もしロボットが歩道にいれば、車に向かって走り、ドアを開け、車を運転して去る可能性があるといったパターンを学習しました。もし女性が鶏小屋にいれば、バケツに歩み寄り、餌をすくい上げるかもしれない、といった具合です。こうしたパターンを学習することで、AIは物事がどのように自然に動き、変化するかという「世界の知識」を構築します。
マジック・トリック:会話と行動の同時進行
では、これは実際にどのようなことを可能にするのでしょうか?チームはこのアイデアを、リアルタイムのフルデュプレックス(全二重)音声・映像インタラクションでテストしました。「フルデュプレックス」とは、あなたが話し終えるのを待つことなく、AIが会話のように同時に話し、聞くことができるという、少し専門的な言い方です。
この新しいバージョン(v0.3)では、AIエージェントは単なる「喋るだけの頭」ではありません。今や**自由な振る舞い(フリーフォーム・ビヘイビア)**が可能になりました。
- 従来の方法: AIは話している間、ただ頷いたり、あなたを見つめたりするだけかもしれません。
- 新しい方法: AIは、「(コーヒーマグを手に取り、一口飲む)思い出させてくれてありがとう」や、「(少し眉をひそめる)どういう意味ですか?」と言うことができます。
論文によると、AIは特別な「ロールプレイ」形式で応答を記述します。話し言葉と、括弧書きによるアクションを混ぜ合わせるのです。AIは「ワールド」(設定とキャラクター)を学習しているため、もし「(マグカップを手に取る)」と言えば、ビデオ生成器がそのシーンにふさわしいマグカップを実際に手に取る様子を描写することを知っています。これはリアルタイムで行われ、音声、アクション、そしてビデオのすべてが完璧に同期しています。
スピード:現実と感じられる速さ
この論文の最も印象的な部分の一つは、この新しい賢さを手に入れながら、スピードを犠らげなかったことです。著者たちは、Wan-Streamer v0.3が以前のバージョン(v0.2)と同じ驚異的なパフォーマンスを維持していることを示しています。
- ビデオ品質: 引き続き640×368の解像度でビデオを出力します。
- 滑らかさ: 25 FPS(秒間フレーム数)で動作し、自然に見えるほど滑らかです。
- 速度: AIは自ら考え、応答を生成するのに約200ミリ秒かかります。インターネットを通じてデータを送受信する時間(350ミリ秒の予算)を加えると、返答を待つ合計時間は約550ミリ秒になります。
これを換算すると、550ミリ秒は1秒未満です。これは、ロードバーを待っているロボットとの会話ではなく、友人とチャットしているような、実際の会話のように感じられる速さです。
これが意味すること(そして意味しないこと)
この論文は、「ワールド」と「イベント」を分離することで、より柔軟なAIを作成できることを示唆しています。あらゆる種類のビデオで訓練でき、部屋をナビゲートするロボットや、ビデオゲームのキャラクターなど、異なる用途に合わせて特化させることができます。著者たちは、このアプローチが特定のテストケース、つまりリアルタイムで話し、行動するデジタルキャラクターに対して有効であることを示しています。
しかし、論文ではこれが特定のデモンストレーションであることも注意深く述べています。彼らは、モデルがこれを行う「ことができる」ことを示し、その速度と品質を測定しました。彼らはAIのあらゆる問題を解決したと主張しているわけでも、あらゆる可能性のある将来の用途を列挙しているわけでもありません。彼らは単に、AIが世界の仕組みについてより賢くなりつつ、現在進行形でチャットできるほど高速に保つための、ビデオ生成に関する新しい考え方を提示しているのです。
要するに、Wan-Streamer v0.3は、デジタル俳優に次のような台本を与えているようなものです。「これが舞台で、これがあなたの衣装で、これがストーリーです。さあ、演じて、話して、動いてください。しかも、私が瞬きする前にやってのけてください」。そして、この新しい「ワールド+イベント」のトリックのおかげで、彼らはまさにそれを実行しているようです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。