Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Wan-Streamerは、言語、音声、ビデオ処理を単一のTransformer内で統合することで、従来のカスケード型システムに固有の誤差の蓄積と遅延を排除し、約200ミリ秒のモデル側レイテンシによるサブ秒単位の全二重マルチモーダル通信を実現する、ネイティブ・ストリーミング型のエンドツーエンド交互作用基盤モデルです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
友人と会話をしている場面を想像してみてください。相手が文章を最後まで言い終えるのを待ってから、一呼吸置いて考え、話し始めるのではありません。相手が話している間も耳を傾け、頷き、アイコンタクトを取り、「えっ、本当に?」と割り込んだり、笑ったりしながら、相手が話し終える前から返答の準備を始めています。これが**フルデュプレックス(全二重)**なインタラクションです。すべてが同時に起こり、重なり合い、自然に流れていくのです。
長い間、コンピュータはこのことが非常に苦手でした。通常、コンピュータは別々の走者がいるリレーレースのように動作します:
- 走者Aがあなたの声を聴き取り、それをテキストに変換します(音声認識)。
- 走者Bがそのテキストを読み、答えを考えます(脳)。
- 走者Cがその答えを再び音声へと変換します(音声合成)。
- 走者Dがその音声に合わせて顔の動きを生成します(ビデオ生成)。
答えがあなたの耳に届く頃には、かなりのタイムラグが生じており、コンピュータはあなたの表情を見逃したり、不自然に会話を遮ったりしてしまいます。これは、「走者」同士が互いに素早く連携できないためです。
Wan-Streamerは、リレーチームではなく、単一の超高速な「人間」になろうとする新しい種類のAIです。その仕組みを、簡単な比喩を使って説明します。
1. 「一人芝居のバンド」対「オーケストラ」
現在のほとんどのシステムは、バイオリニスト、ドラマー、歌手がそれぞれ別の部屋にいるオーケストラのようです。彼らは自分のパートを始めるための合図を待たなければなりません。もしドラマーが遅れれば、曲全体のテンポが停滞してしまいます。
Wan-Streamerは、ギターを弾き、歌い、リズムを刻むことを同時にこなす一人芝居のバンドのようなものです。リスニング、思考、発話、あるいは顔の動きといった個別のモジュールを持っているわけではありません。それは単一の「脳」(Transformerモデル)であり、あなたのビデオを見、あなたの声を聞き、あなたのテキストを同時に読み取り、そして即座に何を話し、どのように音を出し、どのように顔を動かすかを同時並行で決定します。
2. 「考える者」と「演じる者」
この驚異的なスピードを実現するために、開発者は指揮者と演奏者のように、完璧に同期して動く2つの役割に仕事を分割しました。
- 考える者(The Thinker): この部分はあなたの話を聞き、内容を理解し、返答を計画します。これは、次の音符を決める指揮者のようなものです。
- 演じる者(The Performer): この部分は、その計画を受け取り、実際に音と映像を作り出します。これは、楽器を演奏するミュージシャンのようなものです。
ここにある魔法のトリックは、演じる者が現在の返答のためのビデオと音声を作成している間に、考える者はすでにあなたの次の文章を聴き取り、次の返答を計画しているということです。彼らはバトンを極めて素早く受け渡し続けるため、待ち時間が存在しません。これにより、システムはフリーズすることなく、リアルタイムの会話についていくことができます。
3. 「ライブ配信」対「編集された映画」
古いAIビデオシステムは、映画の編集作業のようなものです。シーン全体が撮影されるのを待ち、それからまとめて編集します。もしセリフを変更したければ、全体を再編集しなければなりません。
Wan-Streamerは、ライブニュース放送のようなものです。発生している事象に合わせて、フレームごとにビデオを生成します。
- あなたが話をやめても、AIはフリーズしません。まるで本物の人間が続きを待っているかのように、「呼吸」をし、瞬きをし、あなたを見つめ続けます。
- もしあなたがAIの言葉を遮ったとしても、AIは「決め打ち」で最後まで喋り続けるのではなく、即座に停止してあなたの話を聞きます。
- AIはあなたの表情に即座に反応します。あなたが困惑した表情を見せれば、AIは一瞬のうちに、話すスピードを落としたり、説明を加えたりします。
4. どれくらい速いのか?
論文によれば、このシステムは驚異的な速さを誇ります:
- AIの「脳」の処理時間: AIがあなたの声を聞き、考え、返答の生成を開始するまでに、わずか200ミリ秒(0.2秒)しかかかりません。これは人間のまばたきよりも速い時間です。
- 会話全体の時間: インターネットを通じて信号をやり取りする時間(約350ミリ秒)を加えると、合計の遅延は約550ミリ秒(0.55秒)になります。
これを比較してみましょう。もしあなたが、0.5秒の遅延があるビデオ通話で友人と話しているとしたら、その遅延はほとんど気にならないはずです。相手を遮ることもできますし、相手も自然に反応してくれるでしょう。
何が特別なのか?
この論文では、Wan-Streamerが単に異なるツールを「貼り合わせた」ものではないことを強調しています。それは、最初から**「聴く、話す、顔を動かす」ことを同時に学習した**のです。
- 「テキストの中継役」が存在しない: 音声をテキストに変換してから再び音声に戻すというプロセスを経ません。音とビデオを直接理解します。
- 自然なリズム: 人が互いに言葉を重ねながら会話する実態から学習しているため、いつ沈黙し、いつ頷き、いつ言葉を挟むべきかを理解しています。そのため、ロボットのような硬さはなく、機械的な印象を与えません。
結論
Wan-Streamerは、あなたとリアルタイムで対面会話ができるデジタル・ヒューマンのプロトタイプです。それは単に質問に答えるだけではありません。あなたの姿を見、声を聞き、まるで生きているかのような顔と声であなたに反応します。そして、会話の流れを止めることなく、スムーズな対話を維持します。これは、AIが単なるコンピュータプログラムではなく、テーブルの向かい側に座っている「人間」のように感じられるようになるための一歩なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。