← 最新の論文
🤖 AI

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

本論文は、サンプル固有の最適なアテンション層を動的に特定し、それらを軽量な予測器へと蒸留することで、言語モデルによる処理の前に視覚トークンを削減する手法であるMiddle-layer Attention Prediction(MAP)を提案しており、LLaVA-NeXT-7Bにおいて性能の97.5%を維持しつつ、エンドツーエンドで3.09倍の高速化を実現している。

原著者: Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、ものを見ながら同時にそれについて話す方法を、超スマートなロボットに教えようとしています。これは、マルチモーダル大規模言語モデル(MLLM)の世界です。これらのモデルを、写真を見て「犬の首輪は何色ですか?」や「なぜその人は走っているのですか?」といった質問に答えることができる、優秀な探偵だと考えてください。これを行うために、ロボットは単に画像を「見る」だけではありません。画像をビジュアルトークンと呼ばれる、数千もの小さなデジタル・パズルの一片へと分解します。各トークンは、画像の一部に関する小さな情報の塊です。

問題は、これらのロボットが非常に食いしん坊だということです。画像を本当によく理解しようとすると、彼らは数千ものトークンを処理しなければならない場合があります。それは、猫の帽子の単純な質問の答えを見つけるために、百科事典を一冊丸ごと読むようなものです。これには多くの時間とエネルギー(計算能力)がかかり、ロボットの動作を遅くし、実行コストを高くしてしまいます。科学者たちは、ロボットが読み始める前に、役に立たないパズルのピースを捨てて、より高速化する方法を模索してきました。これが**ビジュアルトークン・プルーニング(視覚的トークンの削減)**です。コツは、どのピースを残し、どれを捨てるかを知ることです。もし間違ったピースを捨ててしまえば、ロボットは混乱します。逆に、残しすぎてしまえば、依然として動作は遅いままです。大きな疑問は、「特定の質問に対して、どのピースが最も重要であるかを、私たちはどのように正確に知ることができるのか?」という点でした。


問題点:一律の解決策では通用しない

Yuyao Sun氏とTao Deng氏率いる研究チームは、現在、これらのロボットに何を残すべきかを判断させる方法において、厄介な欠陥があることを発見しました。

以前、科学者たちは、ロボットの「アテンション(注意)」——つまり、ロボットが「何に注目しているか」を示す高度な仕組み——を、脳の特定の「中間層」から観察すれば、最も重要な画像のピースを見つけられると考えていました。それは、「おいロボット、思考プロセスの途中で何を考えていたかを見て、その画像ピースを残しておけ」と言うようなものでした。

しかし、著者たちは、この「一律の(one-size-fits-all)」アプローチが機能していないことを突き止めました。例えば、あなたがビーチの写真を見ていると想像してください。

  • もし誰かが「は何色ですか?」と尋ねたら、ロボットの脳は思考の中間段階で砂に反応します。
  • もし誰かが「は何色ですか?」と尋ねたら、ロボットの脳は空に反応しますが、おそらくそれは異なる思考の段階です。

研究者たちは、「最適な」層は質問の内容によって完全に依存することを明らかにしました。ある時はレイヤー10が最適であり、またある時はレイヤー20が最適です。固定されたレイヤーを使用することは、建物のすべてのドアに対してたった一つの鍵を使おうとするようなものです。一部のドアには機能しますが、他の多くのドアでは失敗します。

さらに、もう一つ大きな問題がありました。特定の質問に対してどのレイヤーが「最適」であるかを知るためには、ロボットはまず、全レイヤーを通じて画像全体を実際に処理しなければなりませんでした。これは、どのルートがベストかを知るために、まずは目的地まで実際に車を走らせてみてから、どの角が良かったかを振り返るようなものです。どのピースを残すべきか判断できた頃には、節約しようとしていた時間とエネルギーをすでに使い果たしてしまっています!

解決策: 「質問コントラスト」探偵

この問題を解決するために、チームはMAP(Middle-layer Attention Prediction:中間層アテンション予測)と呼ばれる新しい手法を提案しました。ロボットが実際の会話中に重労働を行う代わりに、彼らは、ロボットが「本来どこに注目していたはずか」を推測する、小さくて超高速なアシスタントを訓練しました。

このアシスタントの訓練方法は以下の通りです:

  1. 「コントラスト」のトリック (QCTS): 彼らは、各質問に対して適切な「教師」を選ぶための巧妙な方法を考案しました。画像を取り上げ、ロボットに2つのことを尋ねます。

    • 質問A: 本物の質問(例:「ボートは何色ですか?」)。
    • 質問B: 退屈で一般的な質問(例:「この画像には何がありますか?」)。

    そして、両方の質問に対するロボットのアテンションを比較しました。2つの質問の間でロボットの焦点が最も大きく変化したレイヤーこそが、ボートの特定の詳細を真に重視しているレイヤーなのです。この手法は**Question Contrastive Teacher Selection (QCTS)**と呼ばれ、特定の質問に対して、ロボットの脳のどの部分が最も興奮しているかを即座に特定するスポットライトのような役割を果たします。

  2. 軽量な予測器: どのレイヤーが特定の質問に対する「スター」であるかが分かったら、その重いレイヤーをそのまま使い続けることはしません。代わりに、彼らはそのスターレイヤーの挙動を模倣する、非常に小さく軽量な予測器を訓練しました。この予測器は非常に小さく高速であるため、大きなロボットが思考を開始する前に、画像と質問を見て、「この5%の画像ピースを残し、残りは捨てなさい」と即座に指示を出すことができます。

結果:速く、軽く、そして賢い

チームは、この新しいシステムをいくつかの異なるロボットの脳(MLLM)と、多種多様なトリッキーな質問を用いてテストしました。結果は目覚ましいものでした。

  • スピード: テストモデルの一つ(LLaVA-NeXT-7B)において、MAPは最初から最後までを通して、ロボットを3.09倍高速化させました。これは、10分の徒歩を3分のジョギングに変えるようなものです。
  • 効率性: 彼らは**94.4%のビジュアルトークンを捨て去ることに成功しましたが(わずか5.56%のみを保持)、ロボットはフル画像を使用した場合の正解数の97.5%**を維持できました。
  • スマートな選択: 単に推測したり固定のルールを使用したりする他の手法とは異なり、MAPの「多様性」ルールは、非常に少ないトークンしか保持しない場合でも、似たような見た目のピースばかりを選ばないようにしました。互いに異なる、かつ質問に関連性のあるピースを選ぶことで、ロボットが重要な詳細を見逃さないようにしたのです。

なぜこれが重要なのか

この論文は、単にクールなアイデアを提案しているだけではありません。実用的なボトルネックを解決する、機能するツールを提供しています。MAPは、「最適な」レイヤーは質問ごとに変化すること、そして重い作業を事前に行うことなくそれを予測できることを証明することで、強力なAIモデルを標準的なコンピュータ上でより高速に動作させることを可能にします。これは、図書館員に魔法のインデックスカードを与え、棚にあるすべての本をスキャンすることなく、どの本を引き出すべきかを教えるようなものです。

著者たちは、この手法を用いることで、「高い知能を維持しながら、大幅に高速化し、コストを抑える」という、両立可能な未来を示しています。これは、AIの未来が単に「より大きく、より重い脳」を作ることではなく、「何に注意を払うべきか」について、より賢くなるように教えることにあることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →