KVAE: Family of Tokenizers for Multimodal Generative Models
本論文では、音声、画像、およびビデオのための高性能なトークナイザーのファミリーであるKVAEを紹介するが、これは、テキスト条件付きマルチモーダル生成モデルでの利用を促進するために包括的な学習詳細とコードを提供しつつ、最先端のオープンソースモデルに匹敵またはそれを上回る再構成および生成品質を実現するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに傑作を描かせたり、交響曲を作曲させたり、映画を監督させようとしている場面を想像してみてください。単に、生の、混沌としたピクセルの山や、何十億もの音波をロボットに手渡すことはできません。それは、レンガを壁に投げつけて、それがくっつくことを期待して家を建てるようなものです。ロボットには「設計図」が必要です。人工知能の世界では、この設計図は「トークナイザー(tokenizer)」と呼ばれます。トークナイザーとは、高精細で複雑なビデオやオーディオトラックを、AIが実際に理解し、操作できるような、整然とした小さな一連の指示――「潜在空間(latent space)」――へと圧縮する、超スマートな翻訳者だと考えてください。
長い間、科学者たちは、この翻訳者にとって最も重要なことは「完璧な写し手」であることだと考えてきました。つまり、画像を与えられたら、それを全く同じように描き戻せなければならないという考えです。しかし、新しいアイデアが浮上しています。最高の翻訳者は、完璧にコピーするものではなく、AIが「新しい」ものを思い描くのが容易になるような方法で情報を整理できるものなのではないか、というアイデアです。それは、地図の完璧なコピーを作るコピー機と、旅行者が新しい目的地を見つけやすくするために、明確で論理的な道路を描き直す地図製作者の違いのようなものです。本論文はこのまさにその問いを掘り下げ、AIがより優れた、より速く、よりクリエイティブなコンテンツを作成できるようにするために、画像、ビデオ、サウンドのためのこれらの翻訳者を構築する方法を探求しています。
KVAEファミリー:AIクリエイターのための究極の翻訳者
Kandinsky Labチームによって作られた新しいツールセット、KVAEファミリーを紹介します。これらは、生データ(ビデオクリップや楽曲など)と、それらを生成するAIモデルとの間の架け橋として機能するように設計された、特化した「トークナイザー」です。チームは、最終的なAIの生成物の品質は、この架け橋がいかに良く構築されているかに大きく依存することに気づきました。もし架け橋が不安定であれば、AIはつまずきます。もし滑らかで整理されていれば、AIは高速に動作し、素晴らしいものを創り出すことができます。
このファミリーには、異なる種類のメディアに合わせて調整された3つの主要なメンバーが導入されています。
- KVAE-Audio: 高品質な48 kHz(高品質オーディオの標準)で動作するサウンド用の翻訳者です。オーディオを64チャンネルのコンパクトな形式に圧縮することで、音楽や音声のニュらぎを失うことなく、フル帯域幅のサウンドをAIが聞き取り、生成することを可能にします。
- KVAE-3D: ビデオ用の翻訳者セットです。これらはビデオのトリッキーな「時間」次元を扱うように設計されており、AIが動きを理解できるようにフレームを圧縮します。これには、時間を4倍、空間を16倍圧縮するものと、さらに強力に圧縮するものの2つのサイズがあります。
- KVAE-2D: 静止画用の翻訳者で、画像を8分の1に圧縮し、AIが作業するためのクリーンで効率的な表現を作成します。
大きな発見:完璧なコピーが重要ではない
この論文における最もエキサイティングな発見は、少し直感に反するものです。長年、これらの翻訳者の目標は**「再構成(reconstruction)」**、つまり画像を入力すれば、出力が入力と全く同じに見えることでした。KVAEチームは、完璧な再構成を追い求めることは実は罠であることを見出しました。
彼らは、トークナイザーが画像のコピーには優れていても、AIが新しい画像を生成するのを助けることには失敗する場合があることを発見しました。それは、教科書の内容を逐語的に暗記できるが、新しいトピックについてのエッセイを書くことができない学生のようなものです。論文は、秘密のスパイスは彼らが**「拡散可能性(diffusability)」**と呼ぶものにあると示唆しています。これは、「この圧縮されたデータが、AIにとってどれほど扱いやすいか」ということを、専門的に表現したものです。
これを測定するために、チームは**「相関減衰勾配(Correlation Decay Slope: CDS)」**と呼ばれる巧妙なテストを開発しました。グリッド上の点のパターンを見ていると想像してください。もし点が隣の点と似すぎていると、そのパターンは「粘着性」があり、AIが動かすのが難しくなります。もし点がグリッドを移動するにつれて特定の予測可能な方法で変化していれば、そのパターンは「流動的」であり、AIが操作しやすくなります。KVAEモデルは、たとえ元の画像を完璧にコピーすることにおいて絶対的な最善ではなくなったとしても、この「流れるような」性質を持つように調整されました。
結果:より優れた映画、音楽、そしてアート
チームがこれらの新しい翻訳者の上でAIモデルを訓練してテストしたところ、結果は目覚ましいものでした。
- 画像に対して: KVAE-2Dを使用してテキストから画像を生成した際、AIは他の人気のあるオープンソースツールで作られた画像よりも、人間がより高品質でプロンプトに忠実であると評価する画像を生成しました。興味深いことに、画像のコピー(再構成)において最も優れていたモデルは、KVAEモデルよりも劣った新しい画像を生成しました。これは、再構成がすべてではないことを証明しています。
- ビデオに対して: KVAE-3Dモデルは、AIがより自然に動き、より鮮明に見えるビデオを生成するのを助けました。他の主要なビデオトークナイザーとの直接対決において、KVAEモデルはトレーニング時間の短縮と、特にテキストの説明への適合性において、より優れた最終ビデオを実現しました。
- オーディオに対して: KVAE-Audioトークナイザーは、サウンドにおけるゲームチェンジャーとなりました。音を低品質な塊に切り刻んだり、「位相(フェーズ)」、つまり音波のタイミングを失ったりする他のツールとは異なり、KVAE-Audioはフル48 kHzの品質を維持しました。音楽や音声の生成に使用した際、競合他社(128または256チャンネルを使用)よりも少ない「チャンネル数」(64)を使用していたにもかかわらず、人間が他の最先端モデルよりも好むサウンドを生成しました。
トレードオフ:なぜ「少ないこと」が「多いこと」に勝るのか
論文の重要な教訓の一つは、バランスについてです。チームは、翻訳者をより「広く(ワイドに)」すること(より多くのチャンネルを追加すること)を実験し、それが役立つかどうかを確認しました。ビデオについては、翻訳者を広くすることがコピーと生成の両方に役立つことがわかりました。しかし、オーディオについては、最適なポイント(スイートスポット)があることがわかりました。オーディオの翻訳者を広げすぎた(チャンネルを増やしすぎた)場合、コピーの精度はわずかに向上したものの、AIが新しい音を生成することを学習するのが難しくなることが判明しました。
結局のところ、オーディオにおいては、64チャンネルが「ゴルディロックス(ちょうど良い)」ゾーン、つまりAIが素早く学習し、高品質なサウンドを作成するのに最適であるということです。これは、これらの翻訳者に単一の「最適な」サイズは存在せず、ビデオ、画像、サウンドのどれを扱っているか、そしてAIがどの程度の情報を扱う必要があるかによって決まることを示唆しています。
まとめ
KVAEチームは、単に優れた翻訳者を作っただけではありません。なぜ一部の翻訳者が他のものよりも創造性に適しているのか、その理由を解明しました。データの整理方法(拡散可能性)に焦点を当てることで、単にどれだけ完璧にコピーされるかではなく、AIが高品質かつ人間の指示に沿ったメディアを生成できるようなツールを作り上げたのです。
最も素晴らしい点は、彼らがこれらの秘密を独り占めしなかったことです。コードとモデルはオープンソースであり、誰もがこれらのツールを使って独自のAIアート、音楽、ビデオ生成器を構築できます。これは、AIの世界において、最も重要なステップは単にロボットを賢くすることではなく、世界をナビゲートするためのより優れた地図を与えることである、ということを思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。