← 最新の論文
💻 computer science

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

本論文は、双基準目的関数と直交性に基づく多様性基準を通じてキー・バリューキャッシュからコンパクトで多様かつ代表的な部分集合を選択することにより、トークン単位のヒューリスティックなプルーニングを改善し、固定メモリ制約下で複数の視覚言語モデルおよびベンチマークにおける性能を向上させるストリーミング動画理解のためのコアセットベース手法である CoRDS を提案する。

原著者: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に長い映画を見ていると想像してください。しかし、後でそれについて質問に答えるために、最も重要な部分を書き留めることができるのは、小さな付箋紙だけです。これが、リアルタイムで長い動画を理解しようとする現代の AI モデル(ビジョン・ランゲージモデル)が直面している課題です。これらはすべてを記憶できないため、動画をより小さなメモリに「圧縮」する必要があります。

本論文は、この問題を解決するための新しい手法「CoRDS(Coreset-based Representative and Diverse Selection:コアセットに基づく代表性と多様性の選択)」を紹介しています。その仕組みを、簡単な比喩を用いて説明します。

課題:「直近性」の罠

現在、ほとんどの AI モデルは、単純なルールに依存する「付箋紙」戦略を採用しています。例えば:

  • 「最新のものだけ保持する」: 最後の数秒間のみを記憶する。
  • 「最も目立つものだけ保持する」: 最も明白または鮮明に見える部分のみを記憶する。

著者らは、これは映画全体を最後のシーン、あるいは最も大きな爆発があったシーンだけを覚えて要約しようとするようなものだと主張しています。これでは、後の謎を解くために必要な、20 分前に起きた静かで決定的な手がかりを見逃してしまう可能性があります。

解決策:「キュレーター」アプローチ

CoRDS はゲームのルールを変えます。トークン(動画データの微小な断片)を、どれほど新しいか、あるいは目立つかに基づいて一つずつ選ぶのではなく、まるで美術館のキュレーターが、コレクション全体を代表する小さな展示会を作ろうとしているように振る舞います。

CoRDS が用いる 3 つの主要な戦略は以下の通りです。

1. 「両手」視点(結合 KV 表現)
動画データの各断片には 2 つの側面があると考えます。

  • 「キー(ラベル)」: AI が過去をどこに見るべきかを教えてくれます。(例:「これは赤い車のシーンです」)
  • 「バリュー(内容)」: これが実際の情報です。(例:「赤い車が木に衝突しました」)

従来の手法は、ラベルだけ、あるいは内容だけを見ていました。CoRDS は両方を同時に見ます。これにより、AI が正しい記憶を見つけられること、かつその記憶が実際に正しい詳細を含んでいることを保証します。これは、場所の地図(キー)と写真(バリュー)の両方を持っていることを確認し、片方だけでは不十分であることを防ぐようなものです。

2. 「部屋を覆う」戦略(コアセット選択)
CoRDS は「最高の」単一のアイテムを選ぶのではなく、「どの小さなアイテムのグループが部屋を最も広くカバーしているか?」と問いかけます。
部屋が家具でいっぱいの場合、最も高価な椅子だけを選ぶのではありません。椅子、テーブル、ランプ、そして敷物を組み合わせて、部屋全体のスタイルを代表させるのです。CoRDS は数学的に、動画の履歴全体の幾何学的構造を「覆う」動画フレームの小さなグループを選択し、主要な視覚スタイルやシーンタイプが抜け落ちないことを保証します。

3. 「新しい角度」のルール(直交多様性)
時には、非常に似た 2 つのアイテム(例えば、2 つの全く同じ赤い椅子)を選んでしまうことがあります。これはスペースの無駄です。CoRDS はこれを防ぐルールを持っています。「すでに持っているものと似すぎたものは選ばない」というものです。
それは「新しい角度」や新しい方向性を提供するアイテムを探します。AI がすでに赤い車の記憶を持っている場合、その動画の部分をカバーする唯一の方法でない限り、別の赤い車は選びません。それは積極的に、記憶を多様化させるために、ユニークで異なる瞬間を見つけ出します。

結果:より多くのメモリではなく、より賢いメモリ

本論文では、4 つの異なる AI モデルと 5 つの異なる動画ベンチマーク(長編映画やライブストリームを含む)でこれをテストしました。

  • 競合他社より優れている: CoRDS は、「直近性」や「目立ち度」のルールを使用する既存の手法(InfiniPot-V や StreamMem など)を一貫して凌駕しました。
  • 小ささは美徳: AI が非常に小さなメモリしか使用できない場合(動画データの 1/16 しか保持しない場合)でも、CoRDS はより大きなメモリを利用する従来の手法を持つモデルよりも優れたパフォーマンスを発揮しました。
  • 「完全な」モデルを凌駕: 場合によっては、CoRDS は、圧縮されていない動画全体を記憶しようとする AI モデルよりも良いパフォーマンスを発揮しました。これは、動画の「冗長」または「ノイズ」部分を除去することで、AI が実際には重要な手がかりにより集中できる(「干し草の山の中の針」問題を解決する)ことを示唆しています。

まとめ

CoRDS を動画のための賢い編集者と考えてください。単に退屈な部分を切り取ったり、最新のクリップだけを残したりするのではなく、物語全体を捉える、多様で代表的な瞬間の handful( handful: handful 分)を慎重に選び抜きます。これにより、AI は 1 時間の動画について、全体を見ているのと同じくらいよく質問に答えられるようになりますが、コンピュータメモリはごく一部しか使用しません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →