← 最新の論文
🤖 AI

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

本論文は、タスクへの関連性、情報の網羅性、および意味的な多様性に基づいて最適な保存集合を構築することで、MLLMの推論効率を大幅に向上させつつ、性能を維持または向上させる、学習不要かつモデルに依存しない視覚的トークンプルーニング手法であるTOPSを提案する。

原著者: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは巨大な図書室(視覚トークン)を持っていて、超スマートなロボット(マルチモーダル大規模言語モデル)が質問に答えるために、その本を読まなければならないとします。問題は、図書室があまりにも巨大すぎるため、ロボットは圧倒されてしまい、読むのに膨大な時間がかかり、ページをめくるだけでエネルギーを使い果たしてしまうことです。

長い間、人々はこのロボットを助けようとして、「退屈なページは飛ばしていいよ!」と教えてきました。しかし、従来の方法は少し不器用でした:

  • 「アテンション(注目)」法は、大きな太字で書かれたページだけを見るロボットのようなものでした。これでは、小さな文字で書かれた重要な詳細を見逃したり、似たような段落を何度も何度も読み直したりすることがありました。
  • 「ダイバーシティ(多様性)」法は、互いに異なる見た目のページを選ぼうとするロボットのようなものでした。例えば、猫のページと車のページを選ぶことはできても、ユーザーの特定の質問に実際に答えるページを誤って捨ててしまうことがありました。

TOPSの登場:スマートな司書

この論文は、TOPS(Token Optimal Preservation Sets)という新しい手法を紹介しています。TOPSは、単にどのページを残すかを推測するのではなく、棚に残すべきものを決める前に、第一原理に基づいた非常に整理された司書のように、3つの具体的な質問を投げかけます。

  1. 「このページは質問に関連しているか?」 (タスク関連性:Task Relevance)
    • 比喩: もしユーザーが「その車は何色ですか?」と尋せば、司書はすぐに、車が写っているページは残し、空が写っているページは捨てるべきだと判断します。
  2. 「このページは新しい情報をカバーしているか?」 (情報網羅性:Information Coverage)
    • 比喩: すでに車の赤い塗装について説明しているページがあるなら、全く同じことを言っている2枚目のページは必要ありません。必要なのは、「車のナンバープレート」のように、何か新しいことを教えてくれるページです。
  3. 「このページは、選んだ他のページと比べてユニークか?」 (意味的多様性:Semantic Diversity)
    • 比喩: 「車は赤い」と書いてあるページを5枚も積み上げる必要はありません。「赤い」「速い」「古い」といった、それぞれ異なる内容のページを1枚ずつ集めるべきです。これにより、重複を避けつつ、全体像を把握することができます。

実社会での仕組み

論文によれば、TOPSは学習を必要としません(「トレーニングフリー」)。LLaVA、Qwen、InternVLといった異なるロボットの脳に即座に組み込むことができ、すぐに機能します。

  • 「2段階」のクリーンアップ: ロボットが長いビデオを読んでいる場面を想像してください。
    • ステージ1: TOPSは、ロボットが深く思考し始める前に、明らかなゴミ(空白のフレームやぼやけたショットなど)を素早く一掃します。
    • ステージ2: ロボットが読み進めるにつれ、TOPSは会話を注意深く監視します。もしロボットが特定の詳細について話し始めたら、TOPSはその最も関連性の高い視覚的ページが確実に残るようにし、その質問に完璧に応えられるよう選択を洗練させます。

結果:少ないことは、より豊かなこと

論文は、このスマートな「3つの質問」によるアプローチを用いることで、TOPSは**最大90%の視覚的ページ(トークン)**を捨てることができるにもかかわらず、ロボットはすべてのページを読んだときと同じくらい正確に回答できると主張しています。

  • 驚きの統計: 特定のモデル(LLaVA-NeXT)において、TOPSは77.8%の視覚データを削除しましたが、実際にはロボットのパフォーマンスをわずかに向上させました(100.6%)。
  • なぜか?: 論文は、ロボットに「余計なもの」を無視させることで、ロボットが混乱したり、事実を捏造したり(ハルシネーション)することを防いでいるのだと示唆しています。それは、散らかった机を片付けるようなものです。時として、書類が少ないほうが、正しいものを見つけやすく、より明晰に考えることができるのです。

まとめ

TOPSは、より厳格でスマートなエディターになることで、AIモデルをより速く、より賢くするための新しい方法です。単に「声が大きい」ものや「最も異なる」視覚的な手がかりを選ぶのではなく、質問に関連し、必要な情報をすべて網羅し、かつ重複しない、完璧でコンパクトな手がかりのセットを構築します。その結果、ロボットはより速く考え、メモリを節約し、より良い回答を提供できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →