← 最新の論文
💻 computer science

WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

WinTok は、事前学習済み基盤モデルから抽出された学習可能な意味トークンとピクセルトークンを組み合わせることで、理解と生成を分離するハイブリッド可視化トークナイザーであり、既存の統合アプローチよりもはるかに少ない訓練データで両タスクにおいて優れた性能を達成します。

原著者: Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがロボットに、2 つの全く異なる仕事を同時に教えることを想像してみてください。1 つは画像を言葉で記述すること(理解)、もう 1 つはゼロからその画像を再描画すること(生成)です。

問題は、これらの仕事には異なる「言語」が必要だということです。

  • 画像を記述するには、ロボットは「悲しそうな犬」や「晴れたビーチ」のような、高レベルで抽象的な概念が必要です。すべてのピクセルの正確な色を知る必要はありません。
  • 画像を再描画するには、ロボットは空の青の正確な色合いや毛並みの質感のような、低レベルで精密な詳細が必要です。「犬の悲しみ」などには関心なく、ピクセルだけが重要です。

旧来の方法:「何でも屋だが、どれも得意ではない」アプローチ
これまでの試みでは、ロボットに 1 つの「トークン」(デジタルの構成要素)のセットを使って、両方の仕事をさせるよう強制しようとしていました。これは、料理人に野菜を切るのと同じ包丁で、繊細な手術も行うよう命じるようなものです。その結果は妥協点でした。ロボットは記述も描画もそこそこできましたが、どちらにおいても卓越することはできませんでした。

新しい解決策:WinTok(「専門チーム」アプローチ)
この論文は、WinTok という新しいシステムを紹介しています。これは、ロボットに互いに連携しつつも分離した 2 つの異なるツールセットを与えることでこの問題を解決します。これは、2 つの専門チームを持つ建設チームのようなものです。

  1. ピクセルチーム(芸術家たち): このチームは「ピクセルトークン」を扱います。彼らは細部、質感、色に完全に焦点を当てた画家のチームのようなものです。彼らの唯一の仕事は、最終的な画像が元の画像と正確に一致するようにすることです。彼らは生成において優れています。
  2. 意味チーム(哲学者たち): このチームは「学習可能なトークン」を扱います。彼らは「これは犬だ」「これは幸せだ」といった全体の主要なアイデアを要約して見る、芸術評論家のチームのようなものです。彼らは筆致を気にせず、意味だけを捉えます。彼らは理解において優れています。

彼らがどのように連携するか:「非対称蒸留」
ここが巧妙な点です。どうすれば「哲学者たち」(意味チーム)を、何年もゼロから訓練しなくても、これほど賢くできるのでしょうか?

著者たちは、「非対称トークン蒸留」という技術を使用します。有名で世界クラスの芸術評論家(事前訓練された「基盤モデル」)が画像を見て、ロボットの意味チームに画像の「本質」をささやくことを想像してください。ロボットのチームはそれを聞き、学び、その専門家の理解を模倣しようとします。

  • ひねり: その専門家は「芸術家たち」(ピクセルチーム)に何も新しいことを教えません。彼らは単に得意なこと(細部の描画)を続けるだけです。
  • 結果: 意味チームは専門家から学ぶことで意味の達人となり、ピクセルチームは詳細の達人のままです。彼らは互いの邪魔をすることなく、横に並んで働きます。

結果:ウィン・ウィン
2 つのチームが明確で分離された役割を持っているため、ロボットは妥協する必要がありません。

  • 理解において: 「この写真に誰がいるか?」や「雰囲気はどうだ?」といった質問に答えるために、意味チームの要約を使用します。以前の最良のシステムと比較して、分類において11.2% 向上しました。
  • 生成において: 画像を再描画するために、ピクセルチームの詳細を使用します。再構成の品質は最良のシステムと同等でしたが、はるかに少ない訓練データ(10 億枚ではなく 5000 万枚)で達成されました。

要約すると
WinTok は、1 人の料理人にすべてをさせようとしていたレストランが、そうするのをやめたようなものです。代わりに、刻みや盛り付けが素晴らしいシェフ補(生成)と、味や材料の描写が素晴らしい食通の評論家(理解)を雇いました。彼らに最も得意なことをさせることで、そのレストランはこれまで以上に良い料理(画像)を提供し、より良いレビュー(記述)を書くことができるようになり、そのすべてをより少ない材料(データ)で実現しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →