← 最新の論文
💻 computer science

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

ObjectStreamは、凍結されたVideo-LLMの表現を永続的な潜在的オブジェクトアンカーへと整理することで、オブジェクトの履歴や相互作用に関する効率的かつ高性能な推論を可能にし、メモリ使用量とトークン数を大幅に削減しながらストリーミングビデオ理解を強化する、トレーニングフリーのフレームワークである。

原著者: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、賑やかな街の様子を映し出すライブストリームを見ていると想像してください。車が猛スピードで走り抜け、人々が道を横切り、鳥が街灯に止まります。次に、あなたは、その街の様子について質問に答えようとしているロボットだと想像してください。ただし、あなたは一度に目に映るごくわずかな断片的な情報しか記憶することができません。もし誰かが、「10分前に通り過ぎた車は何色でしたか?」とか、「あの人は鍵を落としましたか?」と尋ねたら、あなたの記憶は空白の壁になってしまうかもしれません。これが、**ストリーミングビデオ理解(streaming video understanding)**の課題です。これは、動画を一時停止したり巻き戻したりできる映画としてではなく、ライブフィードのようなリアルタイムで届くビデオを、コンピュータがいかに理解するかという人工知能の一分野です。大きな問題は、ビデオのデータ量が膨大であることです。ビデオは視覚データの洪水なのです。もしコンピュータがすべてのフレームを保存しようとすれば、メモリ(脳の容量)が底をつき、回答のスピードも落ちてしまいます。そのため、科学者たちは、物語を損なうことなく、退屈な部分(空のようなもの)を捨て、重要な部分(動いている犬など)をどのように残すべきかを考えなければなりません。

ここで、ロボットの記憶のための超整理された司書のように機能する新しい手法、ObjectStreamが登場します。ObjectStreamは、ビデオストリームのすべてのピクセルを記憶しようとする代わりに、「オブジェクト(物体)」を物語の主要な登場人物として記憶することに決めました。こう考えてみてください。もしあなたが、混沌としたパーティーの様子を友人に説明するとしたら、ドアを通ったすべての人をリストアップしたりはしないでしょう。代わりに、あなたは「キープレイヤー」――DJ、テーブルの上で踊っている人、赤い帽子をかぶった男――を追跡するはずです。ObjectStreamは、ロボットに対してもこれと同じことを行います。それは静止したビデオデータを見て、「おい、あのピクセルの塊はコップのように見えるぞ」と判断し、そのコップの経過日記を記録し続けるのです。コップがどこへ移動したのか、倒されたのか、あるいは消えてしまったのかを追跡します。これらは、外部の物体検出器(separate object detectors)のような専門家チームを別途雇う必要はなく、ロボット自身の既存の脳を使って自律的に理解していくのです。

この論文では、記憶を管理するための巧妙な3部構成のシステムを紹介しています。第一に、**「潜在的オブジェクト・アンカー(Latent Object Anchors)」を作成します。これらは、ビデオ内の重要なものに貼り付ける付箋のようなものです。ビデオが進むにつれて、ロボットはこれらの付箋を更新していきます。「オレンジ色のマグカップは今、テーブルの上にある」とか、「青いカップが手に持たれている」といった具合です。たとえそれらが移動したり、少し形が変わったりしても、ロボットはこれらのオブジェクトの履歴を保持し続けます。第二に、「一時的な変化(Transient Changes)」のための特別なセクションがあります。時には、ナイフがキュウリを切ったり、ボールが跳ねたりするように、物事が素早く起こることがあります。これらは、長期的な履歴だけを見ていると見過ごされてしまう可能性のある、急速な瞬間です。ObjectStreamは、こうした急速な変化の「スナップショット」を保持することで、ロボットがアクションを見逃さないようにします。第三に、「直近の視覚的グラウンディング・ウィンドウ(Recent Visual Visual Grounding Window)」**を保持します。これは、まさに最後の数秒間のクリアで高品質な映像です。これにより、もし誰かが「今、何が起きていますか?」と尋ねた場合、ロボットはぼやけていない新鮮な視界で確認することができます。

研究者たちは、既存のビデオ理解には優れているものの、ライブストリームには苦戦していた既存のAIモデルを用いて、このアイデアをテストしました。その結果、この「オブジェクト・アンカー」システムを追加することで、モデルはビデオで起きていることに関する質問への回答能力が大幅に向上したことがわかりました。例えば、ロボットがリアルタイムで物事を認識できるかをチェックするOVO-Benchというテストにおいて、モデルのスコアは10.0ポイント上昇しました(63.3から73.3へ)。さらに驚くべきことに、これを実現しながら、メモリ使用量を約50%削減し、以前よりも2倍速く質問に回答できました。実際、このシステムは非常に効率的であり、生のビデオデータ(トークン)の**82.5%**を破棄しても、すべてを保持しようとするモデルよりも優れたパフォーマンスを発揮しました。

この論文は、モデル全体をゼロから再学習させることなく、このアプローチがメモリ問題を解決するための実用的な方法であることを示唆しています。記憶を「瞬間(フレーム)」ではなく「もの(オブジェクト)」を中心に整理することが、ロボットが物語を追跡するのに役立つことを示しています。著者らは、この手法がライブストリームと長時間録画されたビデオの両方に対して有効であることを発見し、オブジェクトのダイアリー(日記)をつけることが、膨大な視覚情報の洪水を扱うための賢明な方法であることを証明しました。これは、世界中のあらゆる問題を解決する魔法の杖ではありませんが、もし私たちがロボットに、私たちの忙しく動き続ける世界をリアルタイムで理解させたいのであれば、単なる「風景」ではなく「登場人物」を記憶させる必要があるということを教えてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →