← 最新の論文
💻 computer science

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

本論文は、トークンの役割という観点から視覚言語モデルにおける視覚的トークン削減を分析し、既存の削減手法が性能と直接的には相関しない明確な役割バイアスを示すことを明らかにし、非生存トークンを保持することでダウンストリームの結果を維持または向上させられることを実証する。

原著者: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、画像を見せることでロボットに世界を理解させる方法を教えようとしている超スマートなロボットを想像してみてください。しかし、ロボットは人間のように画像を「見る」のではありません。画像は「トークン」と呼ばれる、数千もの小さなデジタル・パズルのピースに分解されます。これらのトークンは、巨大で混沌としたオーケストラにおける個々の音符のようなものです。ロボットは、曲を理解するために、そのすべての音を聞かなければなりません。しかし、問題は、高解像度の画像の場合、そのオーケストラがあまりにも巨大すぎて、ロボットの動作を遅らせ、コンピューターのメモリを大量に消費させてしまうことです。

科学者たちは、ロボットに「退屈な」音符――つまり、自分自身を繰り返しているように見えたり、あまり意味を持たないように見える音符――を無視することを教えることで、この問題を解決しようとしてきました。これは「トークン・プルーニング(トークン削減)」と呼ばれます。これは、指揮者がオーケストラに対し、音楽が完璧に聞こえることを期待しながら、同じように聞こえる音符を演奏するのをやめるよう命じるようなものです。最近、「EmbedLens」と呼ばれる新しいツールにより、研究者たちはこれらのトークンがすべて同じではないことに気づきました。中には「生きている(Alive)」もの(画像の真実の物語を運んでいる)、 「シンク(Sink)」(繰り返されるパターンであり、ただそこに存在しているだけ)、そして「死んでいる(Dead)」(完全に冗長なノイズ)ものがあります。大きな疑問は、「もしどのトークンが『死んでいる』か分かったら、スピードを上げるためにそれらをすべて捨ててしまってもいいのだろうか?」ということです。

「Not All Redundant Tokens Are Alike(すべての冗長なトークンが同じ性質を持つわけではない)」と題されたこの論文は、まさにその問いを掘り下げています。研究者たちは、さまざまなプルーニング手法がどのようにどのトークンをカットするかを詳しく調査しました。彼らは、驚くべき発見をしました。それは、 「死んでいる」トークンをカットしようとする手法が、必ずしもそうでない手法よりも優れているわけではないということです。実際、彼らの実験は、たとえ「死んでいる」トークンであっても、裏側で何か重要な役割を果たしている(例えば、オーケストラをまとめ上げている)可能性があることを示唆しています。これらの「死んでいる」トークンを削除から保護することで、ロボットは性能が下がるどころか、むしろ質問への回答能力が向上することさえありました。単独では役に立たないように見えても、それを捨てても安全だとは限らないのです。時には、音楽が正しく響くためには、グループ全体が留まっていなければならないのです。

デジタル・オーケストラの物語

これがなぜ重要なのかを理解するために、これらの視覚言語モデル(VLM)がどのように機能するかを見てみましょう。想像してみてください。あなたには、読み書きができるロボットがいます。そのロボットに猫の写真を提示すると、ロボットの「目」(ビジョン・エンコーダー)はその写真を長いデータ・チャンクのリストへと分解します。その後、これらのチャンクは、猫が何をしているのかを理解するために、ロボットの「脳」(大規模言語モデル)へと渡されます。

問題は、一枚の写真が数百ものこれらのチャンクを生成することです。ビデオや非常に詳細な画像の場合、リストが非常に長くなり、ロボットは圧倒されてしまいます。画像の最初の部分(「プリフィル・レイテンシ」と呼ばれます)の処理に時間がかかりすぎ、メモリを使い果たし、多くのエネルギーを消費してしまいます。これを解決するために、研究者は「トークン・プルーニング」を開発しました。これは、賢いエディターがリストを見て、「よし、同じ青空のコピーが500個もあるけれど、50個だけにしよう」と言うようなものです。

しばらくの間、誰もが単純なルールを想定していました。「面白いものを取り残し、退屈なものを捨てる」というルールです。最近、EmbedLens というツールがゲームを変えました。それはロボットの脳の内部を覗き込み、トークンが3つの異なるグループに分類されることを発見しました。

  1. Alive Tokens(生きているトークン): これらはスターです。彼らは「ふわふわした毛」や「緑の草」といった、画像の具体的な詳細を運びます。
  2. Sink Tokens(シンク・トークン): これらは背景のハミングのようなものです。これらは反復的であり、特定の画像について語ることはありませんが、安定しており、常にそこに存在します。
  3. Dead Tokens(死んでいるトークン): これらは究極のノイズです。彼らは画像や言葉との関連性が全くないように見えます。

論理的な推測はこうでした。「もし死んでいるトークンがあるなら、それらを削除すればいい! 彼らは役に立たないのだから!」

大規模なプルーニング実験

論文の著者たちは、その推測をテストすることに決めました。彼らは3つの有名なプルーニング手法(FastV、DART、DivPrune)を取り上げ、「トークンを削減するとき、実際にどのトークンをカットしているのか?」と問いかけました。

彼らは、単純な質問(「車の色は何色ですか?」)から複雑な科学的質問に至るまで、10種類のテストセットを用いてこれらの手法を実行しました。そして、さまざまな削減レベル(12.5%から87.5%の削減)において、どれだけの「Alive」、「Sink」、「Dead」トークンが除去されたかを正確に追跡しました。

彼らが発見したことは、少し混沌としたものでした。
異なるプルーニング手法の間で、何が「役に立たない」かについての意見が一致しなかったのです。

  • DivPrune は、「死んでいる」トークンの削減に対して非常に攻撃的でした。それは「ノイズを削除せよ」というルールに従っているようでした。
  • しかし、FastVDART は、不思議なことに「Sink」トークンを保護していました。彼らは、冗長に見えるにもかかわらず、繰り返される背景のハミングを保持していたのです。

ここにひねりがあります。ある手法がより多くの「死んでいる」トークンをカットしたからといって、それが必ずしもパフォーマンスが向上したことを意味するわけではありませんでした。 実際、DivPrune(最も多くの死んでいるトークンをカットしたもの)は、時には最高の結果を出しましたが、時には(死んでいるトークンを保持した)FastVの方が優れていました。「死んでいるものをカットすること」と「良いスコアを得ること」の間には、完璧な一致は存在しませんでした。

「死を守る」という驚き

なぜこのようなことが起きているのかを解明するため、研究者たちは巧妙な実験を行いました。プルーニング手法にすべてを任せるのではなく、特定の種類のトークンを保持させるようにロボットに強制したのです。彼らはこう言いました。「よし、FastV、君は好きなようにカットしていいが、すべての『死んでいる』トークンは必ず保持しなければならない。」

彼らは、パフォーマンスが低下することを予想していました。結局のところ、死んでいるトークンは役に立たないのだから、それらを保持することはスペースを無駄にし、ロボットを混乱させるだけだと考えていたからです。

結果は、低下しませんでした。多くの場合、向上しました。

  • Alive トークンを保護した場合、パフォーマンスは向上しました(これは理にかなっています)。
  • しかし、Dead トークンを保護したとき、DivPruneの手法において、ロボットのパフォーマンスは平均で約 0.93% 向上したのです。

これは衝撃的なことでした。これは、単独の「死んでいる」トークンはゴミのように見えても、それらをすべて削除することは、何か別のものを壊してしまう可能性があることを示唆していました。

隠れたオーケストラの指揮者

なぜ「役に立たない」トークンを保持することが助けになるのでしょうか? 著者たちは、トークンが「アテンション(注意)」と呼ばれるものを使ってどのように互いに影響し合っているかを調べました。トークンが互いに音符を渡し合うミュージシャンだと想像してください。

彼らは、単独の「死んでいる」トークンはあまり注意を引かない(主役ではない)ものの、それらが集まることで、膨大な量の「アテンション・予算」を占有していることを発見しました。彼らは巨大なバックコーラスのようです。もし彼らをすべて切り捨ててしまうと、残されたミュージシャン(Aliveトークン)は、自分たちのコンテキスト(文脈)を見失ってしまいます。「死んでいる」トークンはメロディを歌っていないかもしれませんが、リズムと構造を支えているのです。

研究者が死んでいるトークンを保護したとき、残されたトークンの間のアテンションのパターンは、よりバランスの取れた状態に保たれました。「死んでいる」トークンがまだそこに存在することで、「生きている」トークンが適切に相互作用できる環境が維持されたのです。

まとめ

この論文は、単にトークンを見て「お前は死んでいる、去れ」と言うことはできない、と示唆しています。それはそんなに単純なことではありません。「死んでいる」トークンは、単独では弱いかもしれませんが、グループとしては強いのです。

著者たちは、効果的なプルーニングとは、単に最も重要なトークンを見つけることではないと結論づけています。それは**構成(コンポジション)**の問題です。個々としては退屈であっても、グループが機能するために不可欠なカテゴリーのトークンを、誤って剥ぎ取ってしまわないようにする必要があります。これは、AIのような複雑なシステムにおいては、たとえ「冗長」に見える部分であっても、私たちがまだ完全には理解していない役割を果たしている可能性があるということを思い出させてくれます。

ですから、次に部屋の片付けをしているとき、覚えておいてください。あなたが単なる「散らかり」だと思っているものが、実は棚を支えているのかもしれないということを。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →