← 最新の論文
🤖 machine learning

A More Word-like Image Tokenization for MLLMs

本論文は、画像パッチ埋め込みを整合的な意味単位にクラスタリングし、画像の複雑さに応じてトークン予算を動的に調整する新規手法である解離型視覚トークナイズ(DiVT)を提案するもので、これによりマルチモーダル大規模言語モデルは、メモリ使用量と遅延コストを大幅に削減しつつ、視覚入力をより効率的かつ互換性高く処理できるようになる。

原著者: Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、非常に賢いけれど非常に文字通りの解釈しかできないロボット(大規模言語モデル)に、画像を「見る」方法を教えようとしています。現在、私たちがこれを行う方法は、少し不器用です。

問題点:「グリッド」対「物語」

標準的なデジタル写真を、小さな四角形(ピクセル)の巨大なグリッドだと考えてください。現在、私たちがロボットに写真を渡すとき、画像を固定サイズの四角形(チェス盤のようなもの)に切り分け、ロボットにこれらの四角形の長く退屈なリストを渡しています。

  • ロボットの視点: ロボットは言葉を読むことに慣れています。言葉は、「猫」や「走る」や「青」のように、明確で意味のある単位です。
  • 現在の手法: ロボットは、たとえそれらの四角形がすべて空っぽの空や、同じ壁の一部であったとしても、「四角形 1」「四角形 2」「四角形 3」という長く反復的なリストを読まなければなりません。
  • 結果: ロボットは、冗長で混乱を招くデータの洪水に圧倒されてしまいます。これは、美しい絵画を説明する際に、「赤いバラ」と言う代わりに、フレーム内のすべてのレンガの色のリストを挙げて説明しようとするようなものです。これはロボットのメモリを浪費し、動作を遅くします。

解決策:DiVT(分離型視覚トークン化)

この論文の著者たちは、DiVTと呼ばれる新しい手法を提案しています。画像を硬直したグリッドに切り分ける代わりに、DiVTはスマートな編集者のように働き、画像を見て「さて、ここにある本当の重要なものは何か?」と言います。

これがどのように機能するかを、簡単な比喩を使って説明します。

1. 「グループ化」ゲーム(クラスタリング)
散らばったおもちゃでいっぱいの散らかった部屋があると想像してください。

  • 古い方法: レゴ、人形、靴下かどうかに関係なく、すべてのおもちゃを一つずつ拾い上げて箱に入れます。その結果、500 個の小さな箱ができます。
  • DiVT の方法: おもちゃを見て、それらが「何であるか」によってグループ化します。すべてのレゴを一つの山に、すべての人形を別の山に、そして靴下を三番目の山にまとめます。あなたは、それぞれの明確なグループに対してのみ「トークン(箱)」を作成します。
    • 部屋が空であれば、箱は数個しか作りません。
    • 部屋が複雑なおもちゃで満たされていれば、より多くの箱を作ります。
    • 魔法: 箱の数は、部屋がどれだけ「忙しい」かに応じて自動的に調整されます。

2. 「スマートな要約」(トークン形成)
グループが作られた後、DiVT は単におもちゃを箱に放り込むだけではありません。各グループに対して、完璧な単一の要約を作成します。

  • 「猫の毛」の 500 個のパッチをロボットに送る代わりに、「猫」という一つのトークンを送ります。
  • 「青い空」の 100 個のパッチを送る代わりに、「空」という一つのトークンを送ります。
  • 重要なのは、小さな鳥のような細部でユニークな詳細は、それらが独自の個別のトークンとして保持されるため、重要なものは何も失われないことです。

3. 「音量ノブ」(粒度制御)
研究者たちは、要約をどの程度詳細にしたいかを決めることができる特別なノブ(閾値と呼ばれる)を追加しました。

  • 上げると: 非常に詳細な説明(多くの小さなグループ)が得られます。これは複雑な画像には優れていますが、より多くのメモリを使用します。
  • 下げると: 広範な要約(より少なく、より大きなグループ)が得られます。これは非常に高速で、メモリを節約します。
  • 最も素晴らしい点: このノブは、ロボットがすでに訓練された後でも調整できます。ロボットを再教育する必要はありません。ニーズに合わせて設定を変更するだけです。

なぜこれが重要なのか(結果)

この論文は、画像に関する質問への回答からシーンの記述まで、さまざまなタスクにおいてこの新しい手法をテストしました。

  • 速度と効率: DiVT は、はるかに少ないトークンを使用しながら、古い手法と同じ(あるいはそれ以上の)結果を達成しました。いくつかのテストでは、古い手法が必要としたデータの 1/10 未満しか使用していませんでした。
  • 混乱の減少: トークンがランダムなグリッドの四角形ではなく、「カップ」や「木」といった実際の概念を表しているため、ロボットは画像をはるかに良く理解します。
  • 再訓練不要: この手法は、システム全体を再構築することなく、異なる種類のカメラ(ビジョンエンコーダ)や異なるロボットの脳(LLM)と使用することができます。

結論

この論文は、画像をグリッドの四角形(硬直したグリッド)ではなく、物語(意味のある概念のグループ化)のように扱うことで、AI の視覚処理をより速く、より安価に、そしてより賢くできることを主張しています。これは、本を文字ごとに読むことから、単語ごとに読むことに切り替えるようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →