← 最新の論文
🤖 AI

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

本論文は、共有された時間グリッド上での完全な整合性を備えた全二重の入出力インタラクションを実現し、効率的なKVキャッシュ再利用と200ミリ秒未満の処理遅延によるプロアクティブな生成を可能にする、4BストリーミングマルチモーダルモデルであるAero Realtimeを導入するものである。

原著者: Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、友人と一緒に映画を観ている最中に会話をしている場面を想像してみてください。普通のチャットでは、相手が文章を話し終えるのを待ってから自分が話します。しかし、本当に自然な会話では、相手がまだ話している最中に「わあ!」と素早く割り込んだり、複雑なプロットの説明をしている間は黙って聞き入り、新しいことが理解できた瞬間に即座に言葉を挟んだりすることもあります。これこそが、「リアルタイム」なインタラクションの聖杯です。つまり、一拍も置かずに、聞きながら同時に話す能力のことです。

長い間、コンピュータはこの分野において非常に苦手としてきました。ほとんどのAIモデルは、非常に礼儀正しいものの、少し動作の遅い「熱いジャガイモ(早い者勝ちのゲーム)」のような仕組みで動いています。彼らは、あなたが物語全体を話し終える(入力)のを待ち、それを一度にすべて処理してから、話し始めます(出力)。彼らは、話している最中に「聞く」ことができません。もし彼らが文章の途中にいる時に新しい情報を流し込もうとすると、彼らは混乱するか、停止して最初からやり直さなければなりません。この論文は、AIが真に「デュプレックス(全二重)」、つまり人間と同じように、速い動きを見せるビデオストリームに合わせて、新しいことを聞きながら同時に新しいことを話すことができるようにするための課題に取り組んでいます。

香港大学などの研究者たちは、Aero Realtimeと呼ばれる新しいAIモデルを構築しました。これは、単に文章単位で話すのではなく、時間の小さな「ビート(鼓動)」単位で動くモデルだと考えてください。ビデオが終わるのを待つのではなく、Aero Realtimeは時間を80ミリ秒という極めて小さなチャンク(塊)に分割します。聞こえてくる音声のチャンクごとに、AIは「今、言葉を発すべきか、それとも沈黙すべきか」という瞬時の決断を下さなければなりません。

これは、他のモデルの仕組みからの大きな転換です。通常、AIは「思考」フェーズを終えてから「発話」フェーズを開始しなければなりません。しかし、Aero Realtimeはその両方を同時に行います。ビデオ、オーディオ、そして自分自身の言葉を、一つの共有されたタイムライン上に整列させます。すべての80ミリ秒ごとに、新しいビデオとオーディオの断片が到着するコンベアベルトを想像してください。その全く同じ瞬間に、AIはベルトの上に言葉を落とすか、あるいは「沈黙トークン(静かにしているためのプレースホルダー)」を落とすかを決定します。これにより、AIは文章を生成している最中であっても、ビデオの新しい部分を聞き続けることができます。流れを止めて「追いつこう」とすることはありません。

この論文は、AIを「プロアクティブ(先読み的)」にしようとするこれまでの試みが、ぎこちなかったと主張しています。一部のシステムは「マイクロターン」という手法を用いており、AIが常に「今、話すべきか?」と自問自答するために一時停止していました。これは、あらゆる交差点で立ち止まって地図を確認するドライバーのようなものです。また、外部の「ゲート」やスイッチを使用して話すタイミングを決定するシステムもありましたが、これらはシステムを複雑にし、速度を低下させました。Aero Realtimeはこれらの手法を拒絶します。代わりに、モデルはタイミングを自然に学習します。モデルは「沈黙」を、「こんにちは」や「猫」と同じように有効な「言葉」として扱うように訓練されています。つまり、AIはいつ話すかを決めるための別個のスイッチを必要としません。「話すか、静かにするか」という決定は、言葉を選ぶプロセスの中に直接組み込まれているのです。

これを実現するために、チームはトリッキーなエンジニアリングのパズルを解決する必要がありました。彼らは、リアルタイムのビデオデータと標準的なビデオ質問を組み合わせた方法で、モデルを訓練する特別な手法を開発しました。また、メモリと速度を節約しながらコンピュータ上でモデルを実行するための、新しい実行方法も設計しました。新しいフレームが到着するたびにビデオ全体を読み直すのではなく、モデルはすでに処理した内容を記憶し、新しい「スライス」の情報だけを追加します。これは、ページをめくるたびに第1章を読み直すのではなく、どこまで読んだかを記憶し、そのまま読み進める本のようなものです。

結果は、そのサイズとしては驚くべきものです。研究者たちは、Aero Realtimeを連続する20分間のビデオストリームでテストしました。ビデオが再生され続けている間も、モデルは「ラグ(ビデオで起きていることと、AIが言っていることの間の遅延)」を中央値で84ミリ秒に抑えることができました。これはまばたきよりも短い時間です。95パーセンタイル(時間の95%において)で見ても、遅延はわずか173ミリミリ秒でした。これは、AIが「現実」のタイムラインから200ミリ秒以内に留まっていることを意味し、実質的にリアルタイムで聞き、話していることになります。

しかし、論文は、これがビデオ理解において世界最高のAIであると主張しているわけではないことにも注意を払っています。標準的なベンチマークであるOVOBenchでテストした際、この40億パラメータのモデル(比較的軽量なモデルです)は良好なスコアを記録しましたが、オフラインかつ非リアルタイムのタスク向けに設計された、より強力な70億パラメータの大型モデルには及びませんでした。著者らは、この差が生じた理由として、モデルが「デュプレックス」という全く新しい対話スタイルを学ばなければならなかったこと、そして従来のモデルが従来の質問形式に対して持っていたような、この特定のタイプのリアルタイム会話のための専用の訓練データが不足していたことを挙げています。

要約すると、Aero Realtimeは、順番を待つだけでなく、真にリアルタイムで会話ができ、息を切らすことなく同時に聞き、話すことができるAIを構築できることを証明しました。これは、AIが単なる指示待ちのロボットではなく、あなたと一緒に世界に注意を向けている「友人」のように感じられることへの一歩です。まだビデオの専門家として最も賢いわけではありませんが、時間の流れに合わせるという技術を真にマスターした最初のモデルなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →