← 最新の論文
🤖 AI

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

本論文は、非一様なトークン質量と局所性を考慮したコストを用いた最適輸送を活用し、フレーム対の圧縮可能性に基づいて動的に圧縮予算を割り当てる、トレーニング不要な時系列トークン圧縮フレームワーク「OTT-Vid」を Video Large Language Models 向けに導入するものであり、視覚トークンの 10%のみを保持しながら最先端の性能を達成する。

原著者: Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、OTT-Vid 論文の解説を、シンプルな概念と日常の比喩に分解したものです。

大きな問題:動画は多すぎるのに、脳の処理能力は不足している

10 分間の映画を見ようとしているが、あなたの脳(AI モデル)は一度にごく少量の情報しか保持できないと想像してください。映画を理解するために、AI はすべてのフレームを「トークン」と呼ばれる数千もの小さなパズル片に分解します。

長い動画の場合、これらのパズル片の数は爆発的に増加します。それは、一輪車に山ほどのレンガを運ぼうとするようなもので、AI は圧倒され、動作が遅くなり、実行コストも莫大になります。

従来の解決策:「同じに見えるなら捨ててしまえ」

これを解決するために、研究者たちは余分なレンガを捨てようと試みました。彼らの古いルールは単純でした。「フレーム 5 のレンガがフレーム 6 のレンガと完全に同じに見えるなら、フレーム 6 の方を削除する」。

欠点: これは、動かない人物の動画を見て、「動いていないから削除しよう」と言うようなものです。しかし、その人物は主人公なのです!削除すれば、AI はその存在を忘れてしまいます。

  • 結果: AI は、静止した物体や待っている人物など、変わらないものの追跡を失います。なぜなら、それらを退屈な重複だと考えてしまうからです。また、何かの持続時間発生時刻についての質問にも対応できなくなります。

新しい解決策:OTT-Vid(賢い図書館司書)

この論文の著者たちは、単に物が似ているかどうかを見るのではなく、「この部分は重要か?」と問う、新しい動画圧縮手法OTT-Vidを提案しています。

彼らは、何を保持し何を捨てるかを決定するために、最適輸送(超賢い物流プランナーと想像してください)と呼ばれる数学的概念を使用します。その仕組みは以下の 3 段階です。

1. 「ハイライトペン」(空間的剪定)

まず、AI は単一のフレームを見て、最も興味深い部分をハイライトします。

  • 比喩: 教師がテストを採点する様子を想像してください。教師はすべての単語を同じ注意深く読むわけではありません。重要な文をハイライトします。OTT-Vid はすべての動画フレームでこれを行い、ハイライトされたトークンのみを保持し、退屈な背景ノイズは無視します。

2. 「重要度スコア」(質量割り当て)

これが秘密の武器です。AI は残ったすべてのトークンに「質量(重み)」を割り当てます。

  • ひねり: このシステムでは、重要=軽い重み重要でない=重い重みとなります。
  • 理由: 配送トラックを想像してください。壊れやすく価値のある品物(重要なトークン)は守りたいものです。潰したくありません。そのため、それらに「軽い」ステータスを割り当て、システムがそれらを捨てないよう伝えます。退屈な背景の部分は「重い」ステータスとなり、捨てたり結合したりしやすいことを意味します。
  • 結果: 人物が 10 秒間じっとしていても、AI は彼らが重要(軽い重み)だと認識し、前のフレームと全く同じに見えても削除を拒否します。

3. 「物流計画」(最適輸送)

次に、AI はフレーム 1 とフレーム 2 の間、フレーム 2 とフレーム 3 の間など、動画をどのように圧縮するかを決定しなければなりません。

  • 比喩: 引っ越しをしていると想像してください。あなたは限られた数の段ボール箱(予算)を持っています。
    • 従来の方法: 重複しているものを単に捨てます。
    • OTT-Vid の方法: AI は「輸送の難易度」を計算します。
      • 2 つのフレームが非常に似ていて退屈なもので満たされている場合、「難易度」は低くなります。AI は「素晴らしい、これらを 1 つの箱に詰めてスペースを節約できる!」と言います。
      • 2 つのフレームに重要な変化がある場合(車が動き出し始めたなど)、「難易度」は高くなります。AI は「触るな!このために箱を確保しておく必要がある!」と言います。
  • 動的予算配分: AI はすべてのフレームのペアに同じ数の箱を割り当てません。動画のエキサイティングな部分には多くの箱を、退屈な部分には少ない箱を割り当てます。

なぜ優れているのか(結果)

研究者たちは、以下の 6 つの異なる動画課題でこれをテストしました。

  1. 動画質問応答: 「動画で何が起こったか?」
  2. 時間的グラウンディング: 「その人がケーキを切ったのは正確にいつか?」

結果:

  • 彼らは動画データの**90%**を捨てました(トークンの 10% のみを保持)。
  • 動画質問: 完全な動画を見た場合と比較して、AI は**95.8%**の答えを正しく答えました。
  • タイミング質問: AI はタイミングタスクにおいて**73.9%**の精度を維持しました。

重要な教訓:
従来の手法は、イベントの持続時間を実際に証明する「退屈な」静止部分を削除してしまったため、タイミングタスクで失敗しました。OTT-Vid は、それらの部分を保持します。なぜなら、それは単なる類似性ではなく、それらの重要性を理解しているからです。

まとめ

OTT-Vidは、単に同じに見えるからといって繰り返されるシーンを切り取る賢い編集者のようなものです。代わりに、編集者は「このシーンは物語にとって重要か?」と問います。キャラクターがじっとしていてもプロットに不可欠であれば、編集者は彼らを保持します。背景が退屈で反復的であれば、編集者はそれを切り取ります。これにより、AI は重要な詳細を忘れることなく、長い動画を素早く視聴できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →