← 最新の論文
💻 computer science

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

本論文は、既存の拡散モデルや固定解像度の自己回帰モデルと比較して、はるかに低い計算コストで優れた性能を実現する効率的かつ動的解像度の画像合成を可能にする解像度非依存の 1 次元画像トークナイザー「VibeToken」と、それに対応する自己回帰生成モデル「VibeToken-Gen」を紹介する。

原著者: Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが友人に都市のスカイラインの高解像度写真を送信しようとしていると想像してください。

従来の方法(従来の AI モデル):
現在のほとんどの AI 画像生成モデルは、非常に文字通りで硬直した翻訳者のように機能します。小さな葉書(256x256 ピクセル)を送りたい場合、その翻訳者は画像を 256 個の小さなパズル片に分解します。巨大なビルボード(1024x1024 ピクセル)を送りたい場合、同じ翻訳者はそれを4,096個のパズル片に分解します。

問題は何か?AI はすべてのパズル片を 1 つずつ読み取り、書き出す必要があります。

  • 小さな写真: 256 ステップ。高速で安価。
  • 大きな写真: 4,096 ステップ。遅く、高価で、コンピュータは疲れます(はるかに多くのエネルギーを消費します)。
  • 結果: 大きな写真を作るには、通常、小さな写真を拡大するための別々の重厚な「アップスケーラー」機械が必要となり、これによりコストと複雑さが追加されます。

新しい方法(VibeToken):
この論文の著者である Maitreya Patel と、ソニー AI およびアリゾナ州立大学の彼のチームは、VibeTokenと呼ばれる新しい翻訳者を発明しました。

VibeToken を、1 つずつ翻訳するのではなく、賢い要約者として考えてください。

1. 魔法の「Vibe」要約

AI に小さなサムネイルを与えようが、巨大な 4K ビルボードを与えようが、VibeToken はピクセル数には関心を持ちません。代わりに、画像を見て、「この画像全体をたった64 語(またはトークン)で記述できる」と言います。

  • 比喩: 映画全体を説明すると想像してください。従来の方法は、すべてのフレームを読み取るようなものです。VibeToken は、映画の本質を捉えた完璧な 64 語のあらすじを書くようなものです。映画が 10 分であれ 3 時間であれ、要約の長さは同じままです。

2. 「動的」デコーダー

AI がその 64 個の「Vibe 単語」を持ったら、それらを画像に戻す必要があります。

  • 従来の AI: より大きな画像を望む場合、AI はより多くの単語を推測する必要があり、時間がかかります。
  • VibeToken: それは、同じ 64 語を受け取り、望む任意の形状やサイズに合わせて伸ばすことができる特別なデコーダーを持っています。正方形、横長の長方形、または縦長のポスターを要求しても、何もしなくても「Vibe」を完璧にフィットさせるように伸ばすことができます。

3. これが大きな問題である理由(「効率性」の主張)

この論文は、この技術がゲームのルールを 2 つの主要な方法で変えると主張しています。

  • 一定のエネルギーコスト: 従来の方法では、1024x1024 の画像を作るには約11 兆回のコンピュータ計算(FLOPs)が必要でした。VibeToken では、小さな画像を作るのと同じだけの作業で済み、わずか1,790 億回の計算で済みます。これは63 倍の効率性です。
    • 比喩: これは、店まで歩くこと(従来の方法)と、テレポーテーション装置を使うこと(VibeToken)の違いのようなものです。距離(解像度)は関係ありません。エネルギーコストは同じです。
  • 速度: 非常に効率的であるため、VibeToken は高品質な 1024x1024 の画像を0.46 秒で生成できます。トップクラスの競合他社(拡散モデル)は、同じタスクに1.08 秒を要し、品質は実際にはわずかに劣ります。

4. 彼らがどのように行ったか(秘密のソース)

チームは、問題が画像生成器そのものではなく、「トークナイザー」(画像を破片に分解する部分)にあることに気づきました。彼らは以下の方法でそれを修正しました。

  • 動的ポジショニング: 「ピクセル 1 はここ、ピクセル 2 はあそこ」と言う代わりに、AI にサイズに関係なく画像の形状を理解させるように教えました。
  • 可変長さ: 32 から 256 までの「単語」の記述に柔軟に対応できるように AI を訓練し、ユーザーがどの程度の詳細を望むかを選べるようにしました。
  • ネイティブ超解像: AI が「Vibe」を非常に良く理解しているため、別々の「アップスケーラー」ツールを必要とせずに、低解像度の画像を自然に高解像度のものに変換できます。

結論

この論文は、VibeToken-Genを導入しました。これは、AI が同じ量のコンピュータパワーを使用して、任意のサイズや形状(小さなアイコンから巨大なポスターまで)の画像を生成することを可能にするシステムです。

彼らは ImageNet データセット(膨大な写真のコレクション)でこれをテストし、以下の結果を得ました。

  1. 高品質な画像を生成する(現在のトップモデルの一部よりも優れている)。
  2. 実行が非常に高速で安価である。
  3. 新しい解像度ごとに再訓練する必要がない。ただ機能する。

つまり、彼らは画像のサイズに関係なく、高品質な画像生成をテキストメッセージを送るのと同じくらい簡単で効率的にする「解像度非依存」のエンジンを作りました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →