StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
StreamOV は、オフライン手法の限界を、効率的なコンテキスト管理のための証拠誘導型メモリと、能動的な応答生成のための隠れ状態駆動型トリガーを採用することで克服し、新たに導入された SOVBench によって検証された、ストリーミング・オムニ動画理解のための新規フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
24 時間止まることのないライブニュースフィードを視聴していると想像してください。あなたは現在起きている出来事について、賢い AI とチャットしたいと考えていますが、動画を一時停止することも、1 時間前にさかのぼって何があったかを確認することもできません。AI はリアルタイムで視聴し、聞き取り、記憶し、そして応答しなければなりません。
これがStreamOVが解決する問題です。
問題:「圧倒された司書」
現在のほとんどの AI 動画モデルは、図書館が閉まっているときしか働かない司書のようです。彼らは映画が完全に終わるまで待ち、脚本全体を読み終えてから、はじめてあなたの質問に答えます。これはライブストリームには機能しません。
もしこれらの「オフライン」の司書にライブで働かせようとすれば、彼らは 2 つの大きな頭痛に直面することになります。
- メモリの溢れ: 2 時間のストリームのすべてのフレームと音を記憶しようとすれば、彼らの脳は爆発してしまいます。退屈な部分を忘れ、重要な部分のみを保持する方法が必要です。
- 「沈黙」の問題: ライブチャットでは、最良の答えが「何の答えもないこと」である場合があります。「シェフは何を調理していますか?」と尋ねたとき、シェフがまだ調理を始めていないなら、AI は推測したり、答えを幻覚させたりしてはいけません。シェフが実際に包丁を手に取るまで、静かに待っていなければなりません。既存の AI はこの点で苦労することが多く、沈黙を無意味な言葉で埋めすぎて話しかけすぎたり、いつ話すべきかを指示する別個の鈍重な「マネージャー」を必要としたりします。
解決策:StreamOV
著者たちは、このライブの「オムニモーダル(視覚と聴覚)」の世界に特化して設計されたStreamOVというシステムを作成しました。いくつかの簡単な比喩を用いて、その仕組みを説明します。
1. 「賢い篩」証拠に基づくメモリ
ストリームを視聴しているが、メモを取るための小さなメモ帳しか持っていないと想像してください。すべてを書き留めることはできません。
- 従来の方法: すべてを書き留め、後でそれをすべて詰め込もうとする。
- StreamOV の方法: 賢い篩を持っています。動画が再生されるにつれ、常に「この瞬間は重要か?」と問いかけます。
- 視覚的なシーンが劇的に変化しましたか?(シェフがフライパンを落とした!)→ 保持。
- 音が大きく、突然になりましたか?(衝突音!)→ 保持。
- ユーザーが直前に尋ねた内容と一致しますか?(ユーザーは卵について尋ねた;シェフが卵を割った。)→ 保持。
- 単なる背景ノイズや静止画ですか?→ 捨てる。
これにより、「長期・短期メモリ」が構築されます。短期メモリは、直近の数秒間の出来事という高密度なバッファです。長期メモリは、過去 1 時間の中で最も「証拠に富んだ」瞬間の希薄なコレクションです。これにより、AI のメモリは限定(小規模)に保たれつつ、驚くほど情報豊富になります。
2. 「内なる直感チェック」応答トリガー
これが論文の最も巧妙なトリックです。
- 従来の方法: AI が沈黙を命じる特別な「沈黙トークン」(「…」や「待って」と入力するようなもの)を生成して自ら黙らせたり、話すべきかどうかを決定する別個の小さな AI ロボットをボーダーとして使ったりします。
- StreamOV の方法: AI は自らの内なる直感チェックを使用します。
AI の脳を、実際に話す前の「予備思考」段階を持つものとして考えてください。StreamOV は、AI の脳内の最初の思考の火花(隠れ状態)を覗き込みます。- 脳は自信を持っていますか? → 話す。
- 脳は情報が不足していると感じていますか? → 沈黙する。
「待って」と入力したり、別個のロボットに尋ねたりする必要はありません。内部で「今は十分な証拠がある」と判断し、話し始めます。そうでない場合は、そのターンでの処理を単に停止し、エネルギーを節約し、無意味な言葉を避けます。
3. 新しいテスト:SOVBench
これが機能することを証明するために、著者たちは既存のテストを使うことができませんでした。なぜなら、既存のテストは完成した映画に対する「小テスト」のようなものだったからです。彼らはSOVBenchという、新しい実戦テストを構築しました。
- リアルタイムの理解(今起きていることについて答える)をテストします。
- 想起(10 分前に何があったかを覚えている)をテストします。
- 能動性(いつ話し、いつ沈黙すべきかを知っている)をテストします。
- 動画と音声の両方を含み、AI が単に「視聴」しているだけでなく「聴取」もしていることを保証します。
結果
テストを実行したところ、StreamOV は単にゲームに参加しただけでなく、勝利しました。
- ストリーミングモードで動作を強いられた巨大で強力なオフラインモデル(Qwen3-Omni など)を上回りました。
- 他のストリーミングモデルと比較して、いつ話し、いつ沈黙すべきかを知ることにおいて優れていました。
- メモリに「賢い篩」を使用し、タイミングに「内なる直感チェック」を使用することで、AI が無限のメモリや外部のマネージャーを必要とせずに、ライブ動画ストリームを効率的に理解できることを証明しました。
要約すると: StreamOV は、ライブの無限の動画を視聴し、重要な部分のみを記憶し、会話に飛び込むべき時と沈黙すべき時を正確に知り、圧倒されることなくそれらをすべて実行できる最初の AI です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。