← 最新の論文
💬 NLP

Harnessing Streaming Video in the Wild

本論文は、特化した学習データセット(Streaming-Train-248K)、能動的なインタラクション、長期記憶、およびリアルタイム処理を可能にするプラグアンドプレイ型のデプロイメントシステム(Streaming Harness)、そしてオフラインのビデオ理解からデプロイ可能なストリーミング・インテリジェンスへの転換を推進するための新しいベンチマーク(Streaming-Eval)からなる包括的なフレームワークを導入することにより、無制限のビデオストリームを扱う既存の視覚言語モデルの限界に対処するものである。

原著者: Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ライブスポーツ中継を見ているところだと想像してください。あなたの隣にはスマートアシスタントが座っています。

旧来のやり方(オフラインビデオ):
現在のほとんどのAIアシスタントは、試合が終わった後に録画されたゲームを見ているようなものです。彼らは一時停止したり、巻き戻したり、ゲーム全体を見渡してから、「わあ、素晴らしいゴールでしたね!」と言うことができます。彼らは過去を分析することには長けていますが、ゲームが行われている「最中」にあなたと話すことはできません。もし試合中に質問をすれば、彼らはフリーズしたり、次に何が起こるかを推測し始めたり(これはハルシネーション/幻覚です)、あるいは面白いことが何も起きていない時でも延々と喋り続けたりするかもしれません。

新しいやり方(この論文の解決策):
この論文の著者たちは、「Harnessing Streaming Video in the Wild」において、AIを、疲れを知らず、物忘れもせず、数時間のビデオを扱うことができる「リアルタイムのライブ実況解説者」へと変貌させるシステムを構築しました。彼らはこれを、脳、メモリ、そしてテスト環境という3つの大きな問題を一度に解決したため、「統合スタック」と呼んでいます。

これらがどのように実現されたのか、簡単な比喩を用いて説明します。

1. 脳:「黙る」ことを学ぶ (Streaming-Train-248K)

問題点: AIにビデオの記述を教えると、しばしば一秒一秒すべてを記述しようとしてしまいます。それはまるで、「ボールは赤いです。ボールは動いています。ボールはまだ動いています。ボールは動いています……」と喋り続けるナレーターのようなもので、非常に煩わしく、時間を無駄にします。
解決策: チームは24万8千個のビデオクリップからなる膨大なデータセットを作成しました。そして、AIに新しいテクニックを教えました。それは**「沈黙」**です。

  • 彼らはAIに、2つの特別な「ボタン」を与えました。一つは**「話す」ためのボタン、もう一つは「沈黙する」**ためのボタンです。
  • AIが、何か重要なことが起きた時(ゴールや面白い瞬間など)にだけ「話す」ボタンを押し、新しいことが何も起きていない時には「沈黙」ボタンを押すように訓練しました。
  • 結果: AIは、いつ話し、いつ観客の歓声のために沈黙を守るべきかを知っている、プロのスポーツ実況解説者のように振る舞うことを学んだのです。

2. システム: 「賢い司書」 (Streaming Harness)

問題点: 賢い脳であっても、優れたメモリが必要です。もし2時間の映画を見ている場合、AIは通常10分ほどでメモリ不足になります。それは、何もメモを取らずに2時間の会話を頭の中に保持しようとしているようなもので、最後まで辿り着く頃には最初の方の内容を忘れてしまいます。また、リアルタイムビデオにはスピードが必要です。もしAIが考えるのに5秒かかれば、ビデオはすでに先に進んでしまっています。
解決策: 彼らはStreaming Harnessと呼ばれる「プラグアンドプレイ」のシステムを構築しました。これは、3つの棚を持つ**「賢い司書」**と考えてください。

  • 短期的な棚(即時): 直近数分間のビデオを高精細な状態(生の画像として)で保持します。
  • 中期的な棚(要約): 短期的な棚がいっぱいになると、司書は起きた出来事の素早い要約を書き、生の画像を片付けます。
  • 長期的な棚(アーカイブ): 中期的な棚がいっぱいになると、司書はそれらの要約を組み合わせて、巨大で整理されたタイムラインを作成します。
  • 魔法のトリック: このシステムは「vLLM」(超高速エンジン)と連携するように設計されています。これは、質問を受けるたびに本を最初から読み直すのではなく、司書が古いメモを再利用するようなものです。これにより、12時間のビデオの後でも、AIは高速(応答まで1秒未満)に動作し続けます。

3. テスト: 「ライブ・ストレス・テスト」 (Streaming-Eval)

問題点: これまでは、短いクリップを与えて一つの質問をするという方法でビデオAIをテストしていました。それは、マラソンランナーを100メートル走らせてテストするようなものです。それでは、彼らが26マイル(フルマラソン)を走れるかどうかは分かりません。
解決策: 彼らはStreaming-Evalという新しいベンチマークを作成しました。

  • 短いクリップの代わりに、料理番組、DIYプロジェクト、ライブスポーツといった、現実世界の長く乱雑なビデオを使用しました。
  • 彼らは、AIに対して6つの異なるスキルをテストしました。
    • 先見性 (Proactive): 適切なタイミングで話したか?
    • 適時性 (Punctual): 適切な瞬間を待てたか?
    • 文脈把握 (Contextual): 10分前に言ったことを覚えていたか?
    • 過去・未来・現在 (Backward/Forward/Present): 過去、未来、または「今」についての質問に答えられるか?
  • また、単に事実が間違っているかどうかだけでなく、AIが早すぎたり遅すぎたりした場合にペナルティを与える新しいスコアリングルール(SW-F1)も考案しました。

結果

彼らの「ストリーミング・ネイティブ」なAI(沈黙を学ぶように訓練されたもの)を「Streaming Harness」(メモリシステム)に入れたところ、驚くべき結果が得られました。

  • メモリ: 12時間前の詳細を記憶することができました。
  • スピード: 2時間のビデオ経過後でも、高速(1秒未満)を維持しました。
  • パフォーマンス: ライブビデオの記述およびそれに関する質問への回答において、トップクラスの非常に高価なクローズドソースAI(Claude Opus、GPT-5、Geminiなど)を打ち負かしました。

まとめ:
この論文は、AIを「試合後のアナリスト」から「ライブ放送のパートナー」へと変えるための完全なパッケージを構築したと述べています。彼らは、いつ話すべきかを知る方法を教え、数時間経っても速度が落ちないメモリを与え、そして終わりのないビデオストリームを実際に扱えるかどうかをテストするための新しい方法を作り上げたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →