← 最新の論文
💻 computer science

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

本論文は、デカップリングされた類似性を利用してきめ細かなクロスモーダルな関連性を捉えることで、高い性能を維持しつつ計算コストを大幅に削減するタスク適応型のプルーニングを可能にする、大規模視覚言語モデルのための新しいトークンプルーニング手法であるDeSAPを提案している。

原著者: Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに「見る」ことと「話す」ことを同時に教えようとしているところだと想像してください。あなたはロボットに写真を見せ、「猫は何をしていますか?」といった質問を投げかけます。画像を理解するために、ロボットはその画像を「トークン」と呼ばれる何千もの小さなパズルのピースに分解します。これらのトークンは、個々のピクセルのようなものだと考えてください。ただし、単なる色ではなく、それぞれが少しずつ「意味」を運んでいます。問題は、高解像度の写真の場合、単純な質問に答えるためだけに、ロボットが何千ものトークンを処理しなければならない可能性があることです。それは、外で雨が降っているかどうかを知るために、百科事典を一冊丸ごと読み通そうとするようなものです。ロボットは作業に追われ、動作は遅くなり、膨大なエネルギーを消費してしまいます。これが、大規模視覚言語モデル(LVLM)の世界です。ここでの目標は、ロボットの巨大な脳が物忘れを起こさないようにしながら、いかにしてより速く、より安価に動かすかということです。科学者たちが投げかけている大きな問いは、「ロボットが考え始める前に、退屈で無用なパズルのピースをどのようにして捨て去り、重要な部分だけに集中させるか?」ということです。

ここで、DeSAP(Decoupled Similarity-Aware Pruning:分離型類似度認識プルーニング)と呼ばれる新しい手法が登場します。これは、ロボットの脳にとっての非常に効率的なエディター(編集者)のように機能します。研究者たちは、どのパズルのピースを残すべきかを判断する従来の方法は、少し不器用であったことを見出しました。ある手法は画像そのものだけを見て、鮮やかな色や大きな形といった「目立つ」部分だけを残しますが、ユーザーが尋ねている特定の詳細を見落としがちでした。また、別の手法はロボットが話し始めてから何が重要かを判断しようとしますが、その時にはすでに、ロボットは退屈な情報の処理に時間を浪費してしまっています。

DeSAPは、これを解決するために、プロセスの開始直後に2つの賢いことを同時に行います。まず、画像を見て「顕著な(salient)」部分、つまり、緑の野原の中にある真っ赤なボールのように、自然に目立つものを見つけ出します。しかし、それだけでは終わりません。DeSAPは、ロボットが本格的な思考プロセスに入る前に、質問にも耳を傾けます。そして、「デカップルド・シミラリティ(分離された類似性)」という特別なトリックを使って、質問に含まれる特定の単語と、画像内の微細な詳細を一致させます。例えば、あなたが写真の中から「革のバッグ」を探している場面を想像してください。従来の手法では、バッグが通常存在する場所である画像の底半分全体を残したり、あるいは「重要」であるからという理由で背景全体を残したりするかもしれません。しかし、DeSAPは、探し物を正確に知っている探偵のように振る舞います。背景や人々は無視し、たとえバッグが小さかったり変な場所にあったとしても、革のバッグに特化してズームインするのです。

この論文は、これら2つの手がかり、すなわち視覚的な「派手さ」と、質問からの具体的な「タスクガイダンス」を組み合わせることで、ロボットはパズルのピースの最大88.9%を捨て去ることができ(約11%だけを残す)、それでもなお、画像全体を見た場合とほぼ同等の精度で質問に答えることができると示唆しています。LLaVA-1.5のようなモデルを用いたテストにおいて、この手法は単に時間を節約しただけでなく、ロボットを高速化させ(初期処理を2.3倍高速化)、計算能力を9分の1に抑えつつ、回答の正確性を維持しました。研究者たちは、従来の手法が単一の情報源に依存していたために、バイアスが生じたり詳細を見落としたりしたのだと主張しています。対照的に、DeSAPは、何が最も重要であるかにロボットの焦点を合わせ続ける「デュアルソース戦略」を用いることで、時には「少なく見ること」が「より明確に見ること」につながるのだということを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →