Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Mage-Flowは、軽量で高忠実度なVAE、ネイティブ解像度の拡散トランスフォーマー、およびシステムレベルの最適化の共同設計を通じて、効率的な高解像度テキストからの画像生成と指示ベースの編集を実現し、単一のGPU上で超低遅延かつ競争力のある性能を提供する、コンパクトな4Bスケールの基盤モデルファミリーです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットの芸術家を作ろうとしていると想像してみてください。長年、この芸術家に真に素晴らしい才能を持たせる唯一の方法は、倉庫いっぱいのスーパーコンピューターを動かさなければならないほど巨大な脳を作り上げることでした。これらの「巨大な脳」は、驚くほど美しい絵を描いたり、細部までこだわって写真を編集したりすることができましたが、あまりにも重くて高価だったため、ごく一部の大企業にしか手が届きませんでした。それらは、エンジンを始動させるためだけに一チームのメカニックを必要とするフェラーリのようなものでした。
「生成AI」という分野は、コンピュータにゼロから新しいもの(例えば画像)を作り出す方法を教えることを目的としています。これを行うには、コンピュータに2つの主要なツールが必要です。第一に、**トークナイザー(tokenizer)**です。これは、高精細で複雑な写真を、コンピュータが理解できるコンパクトな指示のリストへと変換する翻訳者のような役割を果たします。第二に、**バックボーン(backbone)**です。これは、その指示に基づいて実際に絵を描くメインエンジンです。大きな問題は、従来の翻訳者(トークナイザー)は、特に大きく詳細な画像に対して、しばしば遅くて不器用であったことです。研究者たちが問い続けてきたのは、「巨大なモデルと同じくらい才能がありながら、ノートパソコン1台に収まるほど小さく、かつ魔法のような素晴らしさを失わないロボット芸術家を作れるだろうか?」ということでした。
そこで、Microsoft Mage Teamによる新しいプロジェクトであるMage-Flowが登場し、「はい、できます」と答えました。彼らは、より大きな脳を作ろうとする代わりに、システム全体を極めて効率的にするためにゼロから再構築することに決めました。彼らは、現在この分野を支配している800億パラメータの巨人に比べれば極めて小さい、わずか40億パラメータ(サイズの尺度)を持つコンパクトな「芸術家」を生み出したのです。
彼らがどのように行ったのか、いくつかの巧妙なトリックを用いて説明します。
1. 超高速の翻訳者(Mage-VAE)
トークナイザーを、写真を秘密のコードに変換する翻訳者だと考えてください。古い翻訳者は、重くて遅いスーツケースのようでした。特に高解像度の画像に対しては、荷造りと荷解きに膨大な時間がかかりました。Mage-Flowは、Mage-VAEと呼ばれる新しい翻訳者を導入しました。重いスーツケースの代わりに、魔法の折り紙マシンを想像してみてください。それは、複雑な写真を小さく整然としたパッケージへと折り畳み、再び完璧な画像へと一度の、電光石火のステップで展開することができます。この新しい翻訳者は非常に効率的で、古い重いものと同じ仕事をこなしながら、画像の展開に使うエネルギーを約22分の1に抑えています。これにより、ロボット芸術家は翻訳者が作業を終えるのを待つ時間をほとんど消費しません。
2. 柔軟なキャンバス(Native-Resolution)
通常、コンピュータが絵を描くとき、長い長方形と高い正方形を同じ正方形の箱に押し込もうとするように、あらゆる画像を硬直したグリッドに強制的に当てはめます。これはスペースを無駄にし、創造性を制限します。Mage-Flowは、**ネイティブ解像度パッキング(Native-Resolution Packing)**と呼ばれる技術を使用しています。これは、映画のポスターのような横長のものから、スマートフォンの壁紙のような縦長のものまで、描きたい画像の正確な形に合わせて伸び縮みする、柔軟なキャンバスを想像してください。コンピュータは画像を箱の中に押し込めるために時間を無駄にすることなく、あるがままの形で描画します。これにより、学習プロセスが大幅に高速化され、芸術家は極端な形状を扱っても混乱することなく描き上げることができます。
3. ターボエンジン
高速な翻訳者と柔軟なキャンバスがあっても、一歩ずつ絵を描くことは時間がかかる場合があります。チームは、モデルの**ターボ(Turbo)**バージョンを作成するために、特別な「蒸留(distillation)」技術を使用しました。これは、芸術家に、小さな慎重なステップではなく、大きな飛躍をすることを教えるようなものです。標準的な芸術家が絵を完成させるのに30ステップを要するところ、ターボ版はわずか4ステップで完了できます。ステップ数は少ないものの、品質は驚くほど高いまま維持されます。
結果
チームは、この新しい40億パラメータの芸術家を、800億パラメータの巨大なモデルと比較テストを行いました。結果は驚くべきものでした。単一の強力なコンピュータチップ(NVIDIA A100)上で、Mage-Flowは1024x1024の解像度で高品質な画像をわずか0.59秒で生成できました。既存の写真を編集する場合、わずか1.02秒でした。
おそらく最も印象的なのは、ターボ版が、非常に少ないメモリ(約18 GB)を使用して、約1秒で写真を編集できたことです。これに対し、巨大なモデルはしばしばその2倍か3倍のメモリを必要とし、実行にもはるかに長い時間がかかりました。この論文は、高品質な芸術を生み出すために、必ずしも巨大で高価な脳は必要ないということを証明しています。必要なのは、スマートで効率的な設計なのです。
また、このシステムは編集作業においても優れた性能を発揮することが示されました。「背景をビーチに変えて」「人物を削除して」「テキストを追加して」とロボットに指示すれば、忠実に実行します。彼らはさらに、矢印やテキストを含む科学的な図解を描くという、非常に特定のタスクについてもテストを行いました。この小さな40億モデルは、追加のトレーニングを行うことで、はるかに大規模な特化型モデルとほぼ同等の精度で、これらの複雑な図解を描くことができました。
要するに、Mage-Flowは、AIアートの未来が、何かをより大きく、より重くすることではないことを示唆しています。それは、強力な画像生成や編集を、スーパーコンピューターを必要とせず、あなたのデスクトップや、あるいはポケットの中にあるデバイス上で直接行えるように、よりスマートに、より軽く、より速くすることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。