Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
本論文は、冗長なフレームを排除した後にフレーム間の相関関係に基づいてトークン保持量を動的に調整する、事後的な学習不要の二段階適応型トークンプルーニング戦略を提案しており、これにより計算量を95%削減しつつ、トークン保持率10%においてビデオキャプショニングの精度を7%向上させる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、世界を理解しようとしている超スマートなロボットに教えているところです。あなたはロボットにカメラと脳を与え、ビデオを見て、何が起きているのかを説明するように頼みます。これが「ビジョン・ランゲージ・モデル(VLM)」の世界です。これらのモデルを一つのチームと考えてください。一方の部分は「目」(ビジョン・エンコーダー)であり、画像を見て、それらを「トークン」と呼ばれる小さなパズルのピースに分解します。もう一方の部分は「脳」(大規模言語モデル)であり、それらのトークンを読み取り、物語を書いたり質問に答えたりします。
問題は、ビデオは膨大であるということです。単一の画像でも数百のパズルのピースに分解されることがあり、ビデオはそれらの画像の積み重ねに過ぎません。ビデオ全体をロボットの脳に流し込もうとすると、ロボットは圧倒されてしまいます。それは、千ページの書物を一秒で読もうとするようなものです。ロボットは動作が遅くなり、疲れ果て、スマートフォンやセキュリティカメラのような小さなデバイスでは機能できなくなります。科学者たちは、いくつかのピースを捨て去ることでこれを解決しようとしてきましたが、彼らの手法の多くは「クッキーカッター」のようなものでした。つまり、壁を映した退屈で静止したショットであっても、アクション満載のカーチェイスであっても、常に同じ量のピースを切り取ってしまうのです。この論文は、より優れた問いを投げかけます。「もっと賢く捨てることはできないだろうか? 退屈なときはもっと多く切り捨て、エキサイティングなときは少なく切り捨てるという、具合に合わせた方法はないだろうか?」と。
スマート・ビデオ・カッターの物語
Amazonのチームであるこの論文の著者たちは、現在のビデオAIの高速化手法が少し不器用であることに気づきました。彼らは、ビデオで実際に何が起きているかにかかわらず、固定された数のパズルのピース(トークス)を切り落としてしまうのです。しかし、ビデオには特別な性質があります。それは「時間的冗長性(temporal redundancy)」です。これは、ビデオの中で猫が眠っている場合、フレーム10はフレーム11とほぼ同じであり、フレーム11はフレーム12とほぼ同じである、ということを意味する凝った言い回しです。これらすべての中身が同じフレームに対して、ロボットの脳のパワーを浪費するのは愚かなことです。
これを解決するために、チームは「2段階適応型ビジュアル・トークン・プルーニング(Two-Stage Adaptive Visual Token Pruning)」戦略を考案しました。これは、散らかった部屋を片付けるための、2段階の清掃員のようなものです。
ステージ1:フレーム・フィルター
まず、この手法はビデオ全体を見て、「どのフレームが本当に新しいのか?」と問いかけます。人が歩いているビデオの場合、最初の数フレームは同一である可能性があります。このアルゴリズムは、選択的なエディターのように振る舞い、退屈で繰り返されるフレームを丸ごと捨て去ります。最も興味深い瞬間だけを残すのです。これが「フレームレベル」のプルーニングです。
ステージ2:トークン・テイマー
今や、ロボットの手元には短くなったビデオがありますが、残された各フレームは依然として数千の小さなトークンで構成されています。ここで魔法が起こります。固定された数のトークンをカットする(例えば「常に50%を残す」といった方法)代わりに、この手法はビデオの「内容」を見て、どれだけカットするかを決定します。
フレーム内のトークンを、グループで話している人々の集まりだと想像してみてください。もし全員が全く同じことを言っているなら(冗長性が高い)、そのグループを理解するために一人の話を聞くだけで十分です。しかし、もし全員が全く異なることを言っているなら(多様性が高い)、全員の話を聞く必要があります。論文の手法はまさにこれを行っています。彼らはトークン間の「相関関係」を分析します。そして、「固有値分解(eigen-decomposition)」という数学的なトリックを使用して、トークンがどれほど互いに重複しているかを測定します。
ビデオが静止しており反復的な場合(例えば、坂道を転がるボールを映している場合)、数学は「急激な減衰(steep decay)」を示します。これは、トークンが非常に似通っていることを意味します。するとシステムは、「よし、これらはたくさん捨ててしまおう!」と判断し、ごくわずかな割合だけを残します。しかし、ビデオが混沌として動的な場合(例えば、カメラの動きが激しいカーチェイスなど)、数学は「緩やかな減衰(slow decay)」を示します。これは、トークンがすべてユニークであることを意味します。するとシステムは、「待て、これらはほとんどすべて残しておく必要がある!」と判断し、ほとんどカットしません。
結果:つまずきのない高速化
チームは、LLaVA-Video、InternVL3、Qwen2.5VLを含む、いくつかの人気のあるAIモデルを用いてテストを行いました。彼らは、自分たちのスマートで適応的な手法を、他の「トレーニングフリー(学習不要)」な手法と比較しました。
結果は素晴らしいものでした。この2段階のアプローチを使用することで、AIの賢さを維持したまま、コンピュータが行うべき計算量を最大で**95%も削減することができました。実際、ビデオキャプション作成のベンチマーク(AIが見ているものを説明するテスト)において、彼らの手法は、トークンをわずか10%しか残さなかったにもかかわらず、精度を7%**向上させました。
これを例えるなら、通常ならスーパーコンピューターで1時間かかるビデオ処理を、この手法を使えば数分で実行できるようになり、さらに、ノイズに惑わされず重要な部分に集中できるため、ロボットはビデオをより良く理解できる可能性があるということです。
なぜこれが重要なのか
この論文は、従来の「画一的な(one-size-fits-all)」アプローチに対して明確に異議を唱えています。彼らは、固定された比率(例えば、常にデータの30%を残すといった方法)を使用することは、異なるビデオには異なる量のデータが必要であるため、最適ではないことを示しています。彼らの手法は「ポストホック(事後的)」なものであり、AIを最初から再学習させる必要なく既存のモデルに適用できるため、現在のテクノロジーに対するプラグアンドプレイのアップグレードとなります。
著者らは、この適応的な戦略が、異なるモデルのサイズや異なる種類のビデオに対しても一貫して機能することを発見しました。彼らは情報の「減衰」を測定するためのさまざまな数学的手法をテストし、指数関数的な曲線がデータに最もよく適合することを発見しました。これにより、彼らの冗長性の測定方法が最も正確であることが裏付けられました。
要約すると、この論文は、ビデオを理解するために、より大きく、より遅い脳を作る必要はないと示唆しています。代わりに、私たちは「何を脳に食べさせるか」について、より賢くなる必要があるのです。退屈な部分をいつ切り捨て、エキサイティングな部分をいつ残すべきかを正確に知っている熟練のエディターのように振る舞うことで、ビデオAIを、世界を鮮明に見る能力を失うことなく、日常的なデバイスで実行できるほど高速にすることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。