← 最新の論文
💻 computer science

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

本論文は、現在のモデルにおける長期間のメモリ保持およびリアルタイム知覚の限界を明らかにする、時間規模のインタラクティブなビデオ理解のための包括的なベンチマークであるStreamArenaと、既存のベースラインを凌駕するために、継続的なインタラクションと永続的なマルチモーダルメモリを効果的に両立させる2層構造のアーキテクチャであるStreamMindを紹介する。

原著者: Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに「親友」であり、「ツアーガイド」であり、同時に「パーソナルアシスタント」でもあるよう教えようとしていると想像してください。あなたは、ロボットと一緒に映画を観て、1時間前のあらゆるプロットの急展開を記憶し、キャラクターがリアルタイムでくしゃみをした瞬間に気づき、さらにはあなたが頼めば、インターネットで検索して俳優の誕生日を調べてくれることを望んでいます。これが、マルチモーダルAIエージェント(目、耳、そして言葉を持つコンピュータプログラム)の世界です。しかし、ここには落とし穴があります。ほとんどのこれらのロボットは、「長期戦」が非常に苦手なのです。彼らは、3秒間の記憶しかない金魚のようなものです。もし2時間のビデオを見せても、彼らは通常、最後の数秒間しか覚えていません。また、彼らは受動的で、何かが起きた時に自ら気づいて話しかけるのではなく、あなたが質問するのを待つ傾向があります。科学者たちは、最初から最後まで忘れることなく、長く連続したビデオや音声の流れを処理できるロボットを構築しようとしてきましたが、それは非常に困難な作業でした。なぜなら、彼らが本当にそれを実行しているのか、それとも単に推測しているだけなのかをテストすることが極めて難しかったからです。

この論文は、これらのロボットをテストするための新しい方法と、実際にそのテストに合格する新しいロボットのデザインを紹介しています。研究者たちは、243本のフルレングスのビデオ(平均約88.8分)で構成された巨大な遊び場である「StreamArena」を作り上げました。そこには数千のトリッキーな質問が詰まっています。従来のテストは短いクリップと選択肢形式の質問を使用していましたが(これではロボットが選択肢に基づいて推測できてしまうため)、StreamArenaは、ロボットにビデオ全体を視聴させ、1時間前の詳細を記憶させ、ヒントなしでオープンエンドな質問に答えさせることを強制します。彼らは、既存のほとんどのロボットが惨敗することを発見しました。過去を思い出そうとすると視覚的な詳細を失い、視覚情報を維持しようとすると歴史を忘れてしまうのです。これを解決するために、著者らは特別な二部構成の脳を持つロボット「StreamMind」を構築しました。一方の部分は即座の会話を扱い、リアルタイムで特定のイベントを監視し、もう一方の忙しい部分はバックグラウンドで動作し、起きたことすべての検索可能な永久ライブラリを構築します。この新しい設計により、ロボットは混乱したり遅くなったりすることなく、遠い過去の出来事を記憶し、検索エンジンなどのツールを使用し、さらには面白いことが起きた時にあなたに通知することさえ可能になります。

問題点:AIの金魚の記憶

非常に長い、エキサイティングな映画を、金魚の記憶を持つ友人と一緒に観ているところを想像してみてください。新しいシーンが始まるたびに、あなたの友人はそれまでの全プロットを忘れてしまいます。もしあなたが「最初のシーンの悪役は誰だった?」と尋ねても、彼らは直前の5秒間しか覚えていないため、答えることができません。これは、現在のほとんどのAIビデオモデルで起きていることです。彼らは「今」起きていることについての質問には答えるのが得意ですが、1時間前に何が起きたかを思い出すことは苦手です。

さらに悪いことに、これらのAIモデルの多くは受動的です。彼らはあなたが質問するまで、ただ静かに座っています。しかし現実世界では、例えば「あ、あのキャラクターが鍵を落としたよ!」とか「曲が変わって、雰囲気が悲しくなったね」といった、重要なことに自ら気づいてほしいと思うこともあるでしょう。現在のAIモデルは、単にあなたが先に話すのを待っているだけなので、こうした瞬間を見逃してしまうのが常です。

研究者たちは、これらのAIモデルに対する従来のテストが簡単すぎると気づきました。それらは短いビデオクリップと選択肢形式の質問を使用していました。それは、写真を一枚見せて「これは猫ですか、それとも犬ですか?」と学生にテストするようなものです。学生は内容を何も知らなくても、単に「猫」と推測して正解できてしまいます。研究者たちは、AIのビデオ理解能力を真にテストするためには、より困難なテスト、つまりフルレングスの映画、オープンエンドな質問(AI自身が答えを導き出さなければならないもの)、そしてビデオのずっと昔の出来事を思い出す必要があるタスクが必要であると理解しました。

解決策:StreamArenaとStreamMind

これらの問題を解決するために、チームは「StreamArena」を作成しました。これは、ビデオ理解AIにとっての「オリンピック」だと考えてください。短いクリップの代わりに、彼らは平均88.8分の243本のフルレングスビデオを集めました。単に単純な質問をするのではなく、4つの特定のスキルをテストする3,646の複雑なタスクを作成しました。

  1. リアルタイム知覚(Real-Time Perception): AIは「今」起きていることを説明できるか?(例:「女優はどの部屋番号にいますか?」)
  2. 歴史的回顧(Historical Retrospection): AIは1時間前に起きたことを覚えているか?(例:「過去5分間にいくつのユニークなシーンが登場しましたか?」)
  3. 先行的相互作用(Proactive Interaction): AIは頼まれなくても自ら話しかけることができるか?(例:「『Les Mouchoirs Blancs』という曲が始まったら教えてください」)
  4. ツール活用(Tool Utilization): AIはビデオ内にない情報を探すために、検索エンジンのような外部ツールを使用できるか?(例:「俳優の両親の国籍は何ですか?」)

既存のAIモデルをStreamArenaでテストしたところ、結果は期待外れでした。ビデオをテキストに変換してすべてを記憶しようとするモデルは、視覚的な詳細を失いました。最後の数秒間だけを記憶するモデルは、過去に関する質問に答えることができませんでした。まるで、ロボットは優れた会話相手であることと、優れた歴史家であることの両方を同時にこなすことはできないかのようでした。

そこで、チームは、この緊張関係に対処するために設計された新しいAIアーキテクチャ「StreamMind」を構築しました。StreamMindを、二つの異なるチームが協力して働く、忙しいオフィスとして想像してみてください。

  • フロントデスク(Frontend): このチームはあなたと会話をします。彼らは素早く反応的で、あなたの即座の質問を処理します。また、彼らには特別な「監視員(Monitor Workers)」のチームがおり、あなたが追跡するように頼んだ特定のイベントを監視しています。もしあなたが「犬が吠えたら教えて」と言えば、監視員はビデオを注視し続け、許可を求められることなく、その瞬間が来た瞬間に「吠えた!」と叫ぶ準備をします。
  • ライブラリ(Backend): フロントデスクがあなたと話している間、ライブラリのチームはバックグラウンドで作業しています。彼らは絶えずビデオを観察し、整理し、検索可能な膨大なメモリバンクを構築しています。彼らは単に要約を書くのではなく、キーフレーム(写真)を保存し、イベントをストーリーとしてグループ化し、人物やオブジェクトを関連付けます。フロントデスクが1時間前の出来事に関する質問に答えたいとき、彼らは自分自身で思い出そうとはしません。代わりにライブラリに「45分前の犬についての情報はありますか?」と尋ねます。ライブラリは即座に正確なシーンと詳細を呼び出します。

この分離こそが秘訣です。「考えること」と「覚えること」を「話すこと」から切り離すことで、StreamMindは、ビデオ全体に対する完璧な記憶を持ちながら、迅速かつ応答性を維持することができるのです。

結果:新たなチャンピオン

研究者がStreamMindをStreamArenaのテストに投入したところ、他のあらゆるシステムを凌駕しました。単に少し上回ったのではなく、大きな飛躍を遂げました。

  • 既存の最高のストリーミングモデルと比較して、リアルタイム知覚が58.4%向上しました。
  • 歴史的記憶が53.7%向上し、1時間前のことを実際に記憶できることを証明しました。
  • ツール活用において228.1%という驚異的な向上が見られ、検索エンジンとの連携能力が極めて優れていることを示しました。
  • 先行的相互作用が54.7%向上し、自らイベントに気づいて発表する能力が大幅に改善されました。

最も印象的なのは、StreamMindがこれらすべてをより速く行ったことです。ビデオが再生されている間にすでにメモリライブラリを構築していたため、質問に答えるためにビデオ全体を再処理する必要がありませんでした。これにより、ビデオを毎回再処理しなければならない他のモデルと比較して、質問への回答時間を66.2%短縮しました。

なぜこれが重要なのか

この論文は、AIアシスタントの未来は、単に彼らをより賢くしたり、より大きな脳を与えたりすることではないことを示唆しています。それは、彼らの「仕組み」を変えることです。一つの巨大な脳にすべてを一度に行わせようとするのではなく、連携して動く専門化されたパーツを持つシステムを構築する必要があります。StreamMindは、「今」と「その時」を切り離し、検索可能な永久的な記憶を与えることで、AIがビデオ全体をあなたと一緒に観て、あらゆる詳細を記憶し、場所を見失うことなく、必要な答えを見つける手助けができるようになることを示しています。

研究者たちは、StreamMindは大きな進歩ではあるものの、まだやるべきことは残っていると慎重に述べています。質問と回答の間の時間差が極端に長い(30分以上)場合、システムは依然として少し苦戦しており、将来の改善には、どの詳細がメモリバンクに保存するのに十分に重要かをどのように判断するかという点に焦点を当てる必要があると考えています。しかし、現時点では、StreamArenaとStreamMindは新たな基準を打ち立て、適切なアーキテクチャがあれば、AIがついに現実世界の長く連続した流れに追いつけることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →