← 最新の論文
💻 computer science

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISPは、指示に関連するトークンを特定し、意味的な多様性を高めるための2段階のパイプラインを利用する、事前LLMのテキスト駆動型ビジュアルトークンプルーニングフレームワークであり、大規模視覚言語モデルにおいて99.5%以上の精度保持を実現しながら、推論レイテンシを2倍以上削減します。

原著者: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはミステリーを解こうとしていると想像してみてください。しかし、わずかな手がかりではなく、何百万冊もの本が入った図書館を渡され、しかもそのすべてが同時に開かれている状態です。これは、現代の「大規模視覚言語モデル(LVLM)」がどのように機能しているかを本質的に表しています。これらは、画像を見てそれに関する質問に答えることができる、非常に賢いコンピュータプログラムであり、いわばデジタル探偵のようなものです。これを行うために、彼らは画像を「トークン」と呼ばれる数千の小さなデジタル断片に分解します。これらのトークンを、パズルの個々のピースだと考えてください。問題は、コンピュータがあなたの質問を見る前に、たとえそれがただの青い空や空っぽの床であっても、パズルの「すべてのピース」を読もうとしてしまうことです。これは、猫の首輪の色を知るためだけに百科事典を一冊丸ごと読もうとするようなもので、プロセスを非常に遅くし、コンピュータの電力を大量に消費させてしまいます。

長い間、科学者たちは、パズルのピースをランダムに捨てたり(これでは時として猫の首輪まで消してしまうことがあります)、あるいはコンピュータが本全体を読み始めてからスキップするものを決めるのを待ったり(それでは時間を節約するには遅すぎます)することで、このスピードアップを試みてきました。大きな疑問は、「コンピュータにまず質問を読み、それから必要な特定のパズルピースだけを選ぶように教えることはできるのか? ただし、システム全体の速度を落とすことなく、というのはですが」ということでした。

ここで、CRISPと呼ばれる新しい手法が登場します。CRISPを、探偵が読み始める「前」に働く、超効率的な司書だと考えてみてください。CRISPは、図書館全体をテーブルの上にぶちまける代わりに、まずあなたの質問に耳を傾けます。もしあなたが「ハンドバッグの色は何色ですか?」と尋ねたら、CRISPは即座に画像をスキャンし、ハンドバッグとその周辺の領域を示すパズルのピースだけをつかみ取ります。しかし、それだけで終わりではありません。背景のコンテキスト(通りや、それを手に持っている人物など)が失われないように、いくつかの追加のピースも確保します。

CRISPの開発者たちは、この「先に聞き、それから見る」というアプローチが、従来の「先に見て、それから聞く」方法よりもはるかに賢いことを発見しました。テストにおいて、彼らはCRISPが画像のパズルのピースを最大88.9%まで捨てることができ(画像を数百のトークンからわずか64または128個に削減)、それでいて、画像全体を見た場合とほぼ全く同じ精度を維持できることを示しました。実際、いくつかのテストでは、正しい手がかりを見つける能力があまりに高かったため、「ハルシネーション(幻覚)」、つまりAIが存在しないものを捏造してしまう瞬間さえも減少させました。

論文では、現在行われている2つの一般的な手法に対して明確に反論しています。一つは、質問に関係なく、画像の最も「重要」に見えるピースを選ぶ方法(テキスト非依存型)ですが、著者らはこれを、何を探しているのかを知る前に絵画を凝視しているようなものだと述べています。もう一つは、コンピュータが思考プロセスに深く入り込むまでピースを削除するのを待つ方法ですが、著者らは、コンピュータがすでにすべてを読み終えるという大変な作業を終えてしまっているため、これはエネルギーの無駄であると述べています。CRISPはこれら両方を拒絶し、重い思考を開始する「前」にプルーニング(枝刈り)を行うことで、速さと賢さを両立できることを証明しています。

結果は測定されており、非常に具体的です。LLaVA-1.5という人気のあるモデルにおいて、CRISPは通常の576トークンの代わりにわずか128トークンを使用しながら、元のパフォーマンスの99.5%を維持しました。より新しいモデルであるLLaVA-NeXTでは、320トークンで96.9%のパフォーマンスを維持しました。おそらく最も印象的なのは、このスピードアップが単に精度を維持しただけでなく、回答を得るまでの時間を半分以上に短縮したことです。著者らは、この手法が、これらのスマートな画像読み取りコンピュータを、特に膨大な電力を持たないデバイス上で、より速く、より安価に動作させるための、実用的で即戦力となる解決策であると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →