← 最新の論文
🤖 AI

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

本論文は、周波数に配慮したグローバルなコードブックを一度学習することで、コストのかかる圧縮プロセスをオフラインへと移行し、ビデオ理解のベンチマークにおいて競争力のある性能を維持しながら推論レイテンシを大幅に削減する、効率的でモデルに依存しないオンライン圧縮を可能にする、プラグイン型のビデオトークン圧縮フレームワークである**ONCE**を提案する。

原著者: Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超高性能なロボットに映画の理解方法を教えようとしていると想像してください。これを実現するために、あなたは映画の全フレームを、意味を持つ数千もの小さなデジタル「ピクセル」、すなわち「トークン」へと分解します。ロボットは、この膨大なトークンのリストを一つの文章のように読み解き、何が起きているのかを理解します。問題は、映画は長く、繰り返しが多いことです。もしキャラクターが部屋で10秒間じっと立っていたら、ロボットは何千回も全く同じ「部屋に立っている」というトークンを読み続けなければなりません。それは、スペースを埋めるためだけに「the」という単語が100万回繰り返されている本を読んでいるようなものです。これはロボットの脳力を無駄遣いさせ、回答を非常に遅くしてしまいます。科学者たちは、ロボットに動画を見ている間に退屈な部分をスキップしたり、似たものを統合したりすることを教えることで、この問題を解決しようとしてきましたが、通常、これはロボлоットが新しい動画を見るたびに余計な計算を行う必要があるため、依然として非常に低速でコストがかかります。

この論文は、ONCEと呼ばれる新しい手法を紹介しています。ロボットが新しい動画を見るたびに、整理したりスキップしたりという重労働をさせる代わりに、研究者たちはロボットが動画を見る「前」に、その重労働を済ませておくことにしました。彼らは「グローバル・コードブック(Global Codebook)」を作成しました。これは、本質的には、数千時間のビデオから見つかった最も一般的な視覚的パターンを集めた、巨大な既製のインデックスです。これは、すべての本が完璧な棚にすでに分類されている図書館のようなものです。新しい映画が届いたとき、ロボットはゼロから整理する必要はありません。単に既製のインデックスの中から関連するパターンを探し、該当する「棚」を掴み、それらを平均化するだけです。これにより、ロボットは複雑な計算を行う代わりに、素早いルックアップ(検索)を行うだけで済むため、動画をはるかに高速に処理できるようになります。研究者たちは、この方法が驚くほど効果的であることを発見しました。特に、非常に少ない数のトークンを使用しなければならない状況において、ONCEはロボットが観ている内容を忘れることなく、高速性を維持できました。

問題点:オーバーヒートするロボットの脳

ビデオ大規模言語モデル(Video-LLM)は、動画を見て質問に答えることができる、超強力な探偵のようなものです。これを行うために、彼らは動画を長い一連のデジタル・トークンへと変換します。しかし、ここに落とし穴があります。もし探偵に2時間の映画を食べさせたら、トークンの文字列があまりに長くなり、探偵のメモリを圧倒してしまうのです。

さらに悪いことに、映画には冗長性が満ち溢れています。もしシーンの中で猫がソファに座って5分間過ごしていたら、ビデオエンコーダーはすべてが「ソファに座る猫」と言っている何千ものトークンを生成します。探偵は、たとえそれらがすべて同じであっても、その一つひとつを読まなければなりません。既存の手法は、探偵が動画を見ている最中に、トークンを「プルーニング(削減)」したり「マージ(統合)」したりすることで、この問題を解決しようと試みています。しかし、これは探偵に対し、新しい映画を見るたびに、自分のメモを止めて整理し直すよう求めるようなものです。これでは、毎回余計な時間とエネルギーがかかり、また、どの探偵(モデル)を使うかによって整理のルールが変わってしまいます。

解決策:ONCEと「グローバル・コードブック」

この論文の著者であるJiayang He氏とそのチームは、異なるアプローチを提案しました。彼らはこう問いかけました。「もし、探偵に毎回整理させるのではなく、全員のために『一度だけ』整理を行っておけるとしたらどうだろうか?」

彼らはONCE(Offline-to-Online Video Token Compression)と呼ばれるシステムを構築しました。その仕組みを、簡単な比喩で説明します。

あなたが、何百万冊もの本を整理しなければならない司書だと想像してください。

  • 従来の方法(既存の手法): 新しい本の出荷があるたびに、あなたは作業を中断し、すべての本を読み、どれとどれが似ているかを判断し、それらを物理的にグループ化してから棚に並べなければなりません。これでは、出荷のたびに時間がかかりすぎます。
  • ONCEの方法: 新しい本が届く前に、あなたはすでに持っている膨大な本のコレクションを研究して時間を費やします。そして、「マスター・インデックス(グлоバル・コードブック)」を作成します。そこには、これまで見たすべての一般的な本のタイプ(例:「アクションヒーロー」、「料理番組」、「自然ドキュメンタリー」など)がリストされています。また、「もし本が『自然ドキュメンタリー』のように見えたら、箱Aに入れなさい」というルールも作成します。

さて、新しい本の出荷(新しい動画)が届いたとき、あなたはもう一冊ずつ注意深く読む必要はありません。各本を素早く眺め、マスター・インデックスをチェックして、それがどの箱に属するかを確認し、その箱に放り込むだけです。その後、箱Aにあるすべての本を、一つのメモに要約します。これは、新しい出荷のたびに整理ルールを再発明するのではなく、一度学んだルールを使用しているだけなので、非常に高速です。

詳細な仕組み

  1. オフライン学習(「一度だけ」の部分): 研究者たちは、巨大なビデオデータセット(LLaVA-Video-178K)を取り上げ、視覚的パターンを分析しました。彼らは単にランダムなパターンを選んだのではなく、ビデオ内の異なる時間帯のパターンを捉え(時間的層化)、出現頻度に応じて重み付けを行いました。そして、「最適輸送(optimal transport)」と呼ばれる数学的手法を用いて、8,192個の代表的な「プロトタイプ(またはコードワード)」を持つグローバル・コードブックに適合させました。このコードブックは、視覚的世界のマップとして機能します。
  2. オンライン圧縮(「あらゆる場面での」部分): 新しいビデオが入ってきたとき、システムは新しい学習を行いません。単にビデオの視覚的トークンを見て、「私の8,192個のプロトタイプのどれに似ているか?」と問いかけます。ビデオに最も頻繁に現れるプロトタイプを選択し、ビデオのすべてのトークンをこれらのプロトタイプに再割り当てし、それらを平均化します。これにより、核となる意味を失うことなく、数千のトークンをより小さく管理しやすい数(例えば256や512)へと変換します。

得られた知見

チームは、2つの異なるAIモデル(LLaVA-OneVision-7BおよびQwen3.5-9B)を用い、4つの異なるビデオ理解ベンチマーク(MVBench、EgoSchema、Video-MME、LongVideoBench)でONCEをテストしました。

  • 速度: 結果は驚くべきものでした。ONCEは、事前計算(プリフィルFLOPs)の観点から、言語モデルが行うべき作業量を約96%削減しました。現実世界の言葉で言えば、圧縮なしで実行する場合と比較して、平均で2.96倍高速に動作しました。
  • 精度: 通常、データを削ることでシステムを高速化すると、賢さが損なわれます。しかし、ONCEは驚くほど賢明でした。トークン予算が非常に厳しい場合(わずか32、64、または128トークンしか許されない場合)、ONCEは他の圧縮手法よりも高いスコアを叩き出しました。特に、イベントのカウントや状態の変化の認識といったタスクにおいて優れた性能を発揮しました。
  • 効率性: このシステムは、メインのAIモデルを再学習させることなく、これらのスピードアップを実現しました。コードブックは一度学習され、その後はあらゆる場面で再利用されます。

否定された考え

この論文は、圧縮は必ずしも(動画再生中の)「オンライン」で行われるべきであるという考えに対して、明確に反論しています。彼らは、推論中(視聴中)に重い処理を行うことは非効率的で冗長であることを示しました。また、単にランダムなトークンを選んだり、すべてのビデオに対して固定されたトークンセットを使用したりすることは、彼らの手法ほど上手くいかないことも実証しました。ONCEは、固定されたグループ化ルールを維持しながら、特定のビデオに対して適切なプロトタイプを動的に選択しています。

さらに、「グローバル・コードブック」は単にトレーニング例を保存しているのではなく、再利用可能な構造を学習していることも判明しました。未知のビデオ(公開ビデオによるストレス・テスト)でテストした場合でも、コードブックはランダムなグループ化よりも優れたパフォーマンスを示しており、これが視覚的パターンの根底にある「文法」を真に捉えていることを示唆しています。

結論

著者らは、ONCEがビデオAIに対する新しい考え方を提示していると述べています。つまり、新しいビデオごとにAIをより働かせるのではなく、視覚的パターンのユニバーサルな言語を一度だけ教え込み、必要に応じてその言語を流暢かつ迅速に話せるようにするのです。この手法は、依然として異なるAIモデルごとに個別のコードブックを必要としますが(モデルによって「見え方」が異なるため)、その結果は、「一度学び、あらゆる場所で圧縮する」というこのアプローチが、ビデオAIの理解力を損なうことなく、より高速で効率的にするための強力な手段であることを示しています。この論文は、長いビデオの理解を日常的な用途として実用的なものにするための、有望な一歩であると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →