← 最新の論文
💻 computer science

UniPrune: Unified Progressive Visual Token Pruning with Information-Aware Budget Allocation for Efficient LLaVA-Style Vision Language Models

UniPruneは、エンコーダー・ステージにおける意味的・多様性に基づく重要度プルーニングと、LLMステージにおけるピラミッド型のドロップを相乗的に組み合わせ、さらに情報認識型予算配分およびクロスステージ情報連続性メカニズムによって強化された、極端な圧縮率においてもLLaVAスタイルの視覚言語モデルにおいて優れた効率性と性能を実現する、統合的なプログレッシブ・ビジュアル・トークン・プルーニング・フレームワークである。

原著者: Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

公開日 2026-08-31
📖 1 分で読めます☕ さくっと読める

原著者: Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

画像を見たり話したりできる現代の人工知能システムは、驚くほど有能になりつつありますが、同時に重い計算負荷を伴います。これらの視覚言語モデルは、まず画像を「トークン」と呼ばれる小さなデジタルの断片の長いシーケンスに変換することによって機能します。これらは画像の異なる部分を表しています。標準的な写真は、数百ものこれらの断片に分解されることがあります。システムは、人間が図解を見ながら文章を読んでいるのと同様に、このシーケンス全体をテキストと共に処理します。問題は、これらの断片を関連付けるために必要な数学的演算が、断片の数が増えるにつれて指数関数的に増大することです。もし画像が576個のトークンを生成した場合、コンピュータはそれらが互いにどのように関連しているかを理解するために膨大な量の作業を行わなければなりません。たとえそれらのトークンの多くが、空白の壁や空の一片のような、重要ではない背景の詳細を表しているとしてもです。この非効率性により、これらの強力なシステムを標準的なハードウェアで実行したり、ビデオ解析のようなリアルタイムのタスクに使用したりすることが困難になっています。

研究者たちは、システムが作業を開始する前に不要な断片を取り除くことで、この問題を解決しようと長年試みてきました。ある手法は、画像の見た目だけに基づいてトークンを破棄する、非常に初期の段階でフィルターとして機能します。他の手法は、システムがテキストと画像を一緒に処理し始めた後に、質問に対して無関係と思われる断片を取り除きます。しかし、どちらのアプローチにも盲点があります。初期のフィルターは、ユーザーが何を質問しているのかを知らないため、重要な詳細を捨ててしまうことがよくあります。一方で、後のフィルターは、何かを削除する前に画像全体を処理するためにエネルギーを浪費してしまいます。新しい研究は、両方の手法の強みを組み合わせた統一的なアプローチを紹介しており、これらの知的なシステムにとってより効率的な経路を作り出しています。

Jianhua Cui氏とMeizhou Ding氏に率いられた研究者たちは、「UniPrune」と呼ばれるフレームワークを開発しました。これは、トークンの削減を単一のイベントではなく、二段階の旅として扱うものです。旅行の荷造りをする際、正確な天気がまだわからない状況を想像してみてください。あらゆるものを投げ込んで後でどうにかなることを期待したり、バッグをすべて詰め終わった後に何を残すか決めたりすることはないでしょう。代わりに、まず似たようなアイテムをグループ化して最も代表的なものを残し、目的地が決まった後に、より精密な最終選択を行うはずです。これは本質的にUniPruneが行っていることです。まず、視覚的なパターンを用いて画像データの広範なクリーンアップを行い、次に、システムが質問の文脈を理解し始めると、より鋭いクリーンアップを行います。

このプロセスの第一段階は、画像がスキャンされた直後、言語モデルが関与する前に行われます。システムは、視覚的なトークンを、その類似性に基づいてクラスター(集団)にグループ化します。これは、混ざり合った写真の山を、その一般的な主題ごとに仕分けすることによく似ています。各グループから、最も重要なトークンを1つ保持し、残りを破棄します。これにより、同じ青空の一片を表す複数のトークンのような、明らかな冗長性が取り除かれます。しかし、研究者たちは、この段階で単にトークンの数を半分に減らすことはリスクがあることに気づきました。もしシステムが初期段階で攻撃的に切りすぎると、後で特定の質問に答えるために不可欠なトークンを失ってしまう可能性があるからです。これを解決するために、彼らは動的な予算化戦略を導入しました。この第一段階において、固定されたルールで保持するトークンの数を用いるのではなく、システムは画像の複雑さを測定します。明確な主題を持つ単純な画像には厳格な予算が適用され、複雑で賑やかなシーンにはより多くのトークンを保持することが許可されます。これにより、単純な質問に対してエネルギーを浪費することなく、難しい質問に対処するために十分な詳細を保持できることが保証されます。

この初期選択が行われた後、残りのトークンは大規模言語モデルへと渡され、テキストと共に処理が始まります。ここでは、ピラミッドのように機能する第二のプルーニング(枝刈り)戦略を採用しています。データがモデルのより深い層へと移動するにつれ、システムは徐々に、より多くのトークンを削除していきます。その論理は、モデルが質問の文脈の中で画像をより深く理解するにつれて、どの情報がもはや必要でないかが明確になるということです。研究者たちは、これら二つのステージ間で作業を分割する最も効果的な方法は、トークンを均等に分けることではなく、特定の数学的なバランスに従うことであると発見しました。彼らは、第一段階の後に保持すべき理想的なトークン数は、開始時の数と最終的な目標数の積の平方根に近いというルールを発見しました。彼らが「情報認識型予算(information-aware budget)」と呼ぶこの経験則により、システムは精度を損なうことなく、十分な計算能力を節約できる最適なポイントを見つけることができます。

第一段階が、第二段階で有用となるはずのトークンを誤って削除しないように、研究者たちは第三の知性を加えました。彼らは、画像エンコーダー内部で視覚的トークンがどのように相互作用するかを分析しました。その結果、一部のトークンは、画像全体の情報を結びつける「グローバル・インテグレーター(全域統合者)」として機能し、他のトークンは単なる「ローカル・ディテクタ(局所検出器)」として機能していることがわかりました。第一段階のカットにおいて、これらのグローバル・インテグレーターに特別な重みを与えることで、システムは言語モデルに渡されるトークンが高品質な基礎を形成することを確実にしています。この「クロスステージの連続性(cross-stage continuity)」により、第二段階はより良い出発点を得ることができ、後で何を削除するかについてより賢明な判断を下すことが可能になります。

このフレームワークを二つの主要な視覚言語モデルのファミリーでテストした結果、その成果は驚くべきものでした。研究者がシステムを極限まで追い込み、元のトークンのごくわずかな割合(時には576個のうちわずか24個)だけを保持させた場合、この新手法は既存の技術を大幅に上回りました。一度にすべてのカットを行おうとするシングルステージの手法では、このような条件下で精度が急激に低下しました。対照的に、二段階のUniPruneアプローチは高いパフォーマンスを維持し、他の手法が見逃した物体やシーンに関する質問に正しく回答しました。例えば、視覚的理解に関する標準的なテストにおいて、この新手法は、フル圧縮されていないモデルのパフォーマンスの90%以上を維持しながら、ごく一部の計算能力のみを使用しました。

精度以外にも、この研究は標準的なハードウェアでこれらのモデルを実行するための実用的なメリットを測定しました。プロセスの早い段階でトークン数を減らすことにより、システムはモデルを実行するために必要なピークメモリを劇的に削減しました。これは、リソースの限られたデバイスにこれらのテクノロジーを導入する上で極めて重要な要素です。研究者たちは、新しい手法が、プルーニングなしでモデルを実行する場合と比較して、総計算量を半分以上削減し、トークンをカットするのを待つ手法と比較してもさらに削減できることを算出しました。スマートな予算化とスコアリングのメカニズムによって追加されるオーバーヘッドは無視できるほど小さく、総時間の1%未満であり、これは効率性の向上による利益がほぼ純粋であることを意味します。

この研究は、効率的な人工知能の鍵は、単に近道を探すことではなく、どこで、いつ、どのように削るかを理解することにあることを示唆しています。視覚的な冗長性には、画像自体に基づくものと、タスクに基づくものという二つの異なる形態があることを認めることで、研究者たちはその両方を扱うシステムを作り上げました。これらの知見は、統一されたマルチステージのアプローチが、問題を一段階で解決しようとする試みよりも優れていることを示しています。この研究は、強力な視覚言語モデルをより速く、より身近なものにするための明確な道筋を提供しており、適切な戦略があれば、システムの知性を構成する本質を失うことなく、余剰を削ぎ落とすことができることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →