← 最新の論文
🤖 AI

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

本論文は、学習可能なグローバル・マージングを採用することで、データに依存しない、長さ横断的な表現の整列を可能にし、従来の切り捨てに基づく手法に内在する意味的な不整合の問題を克服することで、優れた品質と計算量のトレードオフを実現する、Diffusion Transformerのための新しい可変長トークナイザーを導入するものである。

原著者: Dong Hoon Lee, Seunghoon Hong

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Dong Hoon Lee, Seunghoon Hong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

高画質の映画を友人に送ろうとしている場面を想像してみてください。もし、圧縮せずにそのまま送ると、ダウンロードに膨大な時間がかかり、データ量も凄まじいことになります。逆に、圧縮しすぎると、映像はぼやけたり、ピクセルが荒れたりしてしまいます。

長い間、AI画像生成器(テキストから画像を生成するものなど)はこのまさに同じ問題に直面してきました。これらは「トークナイザー」と呼ばれる、画像を「トークン」という小さな塊に分解する翻訳機を使用します。

  • 高圧縮(トークンが少ない)= 高速で安価だが、画質が悪くなる。
  • 低圧縮(トークンが多い)= 高品質だが、低速で高コストになる。

以前は、速度と品質のバランスを変えたい場合、設定ごとに全く別のAIモデルを訓練する必要がありました。それはまるで、時速10マイルでゆっくり走りたいだけなのに、エンジンの載せ替えが必要な車のようなものでした。

「切り取り(Cutting)」の問題点

一部の研究者は、「可変長」トークナイザーを作ることでこの問題を解決しようとしました。彼らのアイデアはシンプルでした。「容量を節約したいなら、トークンリストの末尾をただ切り捨てればいい」というものです。

これは、ある本を想像してみてください。最も重要なプロットは1ページ目にあり、細かいディテールは100ページ目にあるようなものです。もし短いバージョンが欲しければ、最後の50ページを破り捨てるだけです。

  • 落とし穴: これでは「物語」が変わってしまいます。「短い」バージョンは全体像だけに焦点を当て、 「長い」バージョンには細かなディテールが含まれます。内容がこれほど異なると、AIは混乱します。それは、ある学生に短編小説と長編小説の両方を読ませようとする際、教科書の内容が全く異なるようなものです。AIは、それらを同時に学習することに苦労し、結果として画像がぼやけたり、不自然になったりします。

解決策:「切り取り」ではなく「結合(Merging)」

この論文の著者たちは、「切り取り」ではなく「結合」という、より賢い方法を提案しています。

100人の人々(トークン)が列を作って立っている場面を想像してください。

  • 従来の方法(切り取り): もし人数を減らしたいなら、後ろの50人を単に帰らせるだけです。残った50人は、依然として全く同じ場所に立っています。
  • 新しい方法(結合): もし人数を減らしたいなら、似た者同士の人たちに集まってもらい、一つの「スーパー・パーソン(超人)」になってもらいます。もし二人が同じ赤いシャツを着ていれば、彼らはそのグループを代表する一人へと合体します。

なぜこれが優れているのか?

  1. 一貫性: 100人の人がいても、10人の「スーパー・パーソン」がいても、その「グループ」は同じ根底にある構造を表しています。「赤いシャツのグループ」は、凝縮されてはいますが、依然としてそこに存在しています。これにより、使用するトークン数に関わらず、AIにとっての「物語」が一貫して保たれます。
  2. 整合性: グループが位置ではなく「類似性」に基づいて形成されるため、AIは、短縮版とロング版の両方に完璧に対応できる単一のモデルを学習することができます。

秘訣:「学習可能なグローバル結合(Learnable Global Merging)」

ここには大きな障壁がありました。通常、誰と誰を結合させるかを決めるには、特定の画像を見ます(例:「この2つのピクセルは猫の耳のように見えるので、結合する」)。しかし、AIがゼロから新しい画像を「生成」しているとき、まだ画像自体が存在していません! 画像を見て結合方法を決めることはできないのです。

著者たちは、これを**「学習可能なグローバル結合」**によって解決しました。
これは、あらかじめ設定されたルールブック、あるいは「マスタープラン」のようなものです。AIは、画像を見て結合を決めるのではなく、固定された学習済みのパターン(普遍的な指示書のようなもの)を使用します。「トークン1は常にトークン2と結合し、トークン3はトークン4と結合する」といった具合です。

このルールブックは固定されていますが(画像によって変わることはありません)、AIはトレーニング中にこれを非常に高度に学習させます。そのため、最終的な画像がどのようなものであれ、似たものを自然にグループ化するように学習します。これにより、AIは画像を生成する前であっても、結合されたトークンをどのように扱うべきかを正確に把握できるのです。

結果

研究者たちは、ImageNet(膨大な画像データベース)を用いてこの手法をテストしました。その結果、以下のことが分かりました。

  • 彼らの手法を用いれば、単一のAIモデルが、設定ごとに再学習することなく、異なる速度と品質で画像を生成できる。
  • 単にトークンを「切り取る」従来の手法よりも、生成される画像がより高品質であり、計算も効率的である。
  • さらに、わずかな「微調整」ステップ(LoRAと呼ばれる手法)を加えることで、追加コストをほとんどかけずに、特定のトークン数に対してAIをさらに進化させることができる。

要約すると: 彼らは、AI画像生成器を柔軟にする方法を見つけ出しました。AIに「高速モデル」か「高品質モデル」のどちらかを選ばせるのではなく、似た部分を賢くグループ化することで、画像のデータを縮小・拡大できる、スマートな翻訳機を作り上げたのです。これにより、高い品質を維持しながら、コストを低く抑えることが可能になりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →