Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
本論文は視覚モデルにおける自己回帰的次ピクセル予測のスケーリング法則を調査し、分類タスクと生成タスクでは最適な戦略が分岐することを明らかにするとともに、計算リソースに駆動されたスケーリングが5年以内にピクセル単位の画像モデリングを可能にすると予測している。
原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに世界を「見る」ことを教えることを想像してみてください。これには主に二つの方法があります。
- 「賢い要約」方式:ロボットに画像を見せますが、まずそれをいくつかのキーワードや記号に圧縮します(猫の写真を「猫」という言葉に変えるようなものです)。これが現在、ほとんどの人工知能(AI)が採用している方法です。
- 「生ピクセル」方式:ロボットに画像をそのまま、ドットごとに、色ごとに提示し、前のドットに基づいて次のドットを推測させるようにします。これは、本の中のすべての文字を、一度も単語全体を見ることなく、一つずつ暗記して言語を学ぼうとするようなものです。
この論文は、シンプルながら困難な問いを投げかけています:「生ピクセル」方式を実際に機能させるには、どれほど遠い未来になるのでしょうか?
著者たちは、この検証を行うために、AI モデルを画像の次のピクセルを予測するよう訓練しました。最初は 32x32 ピクセルという、小さなブロック状のサムネイルのような低解像度の画像から始めました。彼らは、このシンプルで「愚直」な方法が、最終的に「賢い要約」方式と同等の強力さへと拡張可能かどうかを確認したかったのです。
以下に、彼らが発見した 4 つの主要な点について、日常の比喩を用いて説明します。
1. 「ピクセル対単語」の格差
発見:効果的に学習するためには、生ピクセルは単語よりも10 倍から 20 倍多くのデータが必要です。
比喩:子供に読み書きを教えることを想像してください。
- 単語(言語):子供に「猫」という単語を見せれば、彼らは即座に「鳴く毛むくじゃらの動物」を理解します。これは情報密度の高いパッケージです。
- ピクセル(画像):子供に赤いドット一つを見せれば、それが何なのか全くわかりません。鼻でしょうか?信号でしょうか?イチゴでしょうか?それは単なるドットに過ぎません。
単一のドットは非常に少ない意味しか持たないため、AI はパターンを理解するために、何百万倍ものドットを見る必要があります。この論文は、同等の知能レベルに達するためには、AI がテキストを読む必要量よりも、はるかに膨大な量のピクセルデータを「読む」必要があると発見しました。
2. 異なる目標には異なるレシピが必要
発見:AI を拡張する「最良」の方法は、何を実現したいかによって完全に異なります。
比喩:アスリートを鍛えることを考えてみてください。
- スプリンター(画像分類)になりたい場合:重い重量挙げ(より大きな筋肉=モデル)とランニング練習(データ)のバランスが必要です。
- マラソンランナー(画像生成)になりたい場合:ほぼ完全にランニング練習(より多くのデータ)に集中する必要があります。
この論文は、AI に画像内のものを「認識」させたい場合は、AI の「脳」を大きくするだけで済むことを発見しました。しかし、AI に画像を「作成」したり「完成」させたり(写真の下半分を埋めるなど)させたい場合は、脳を大きくするだけでなく、**はるかに大規模な事例ライブラリ(データ)**を与える必要があります。あるタスクにとっての「最良」のレシピは、実は別のタスクにとっては悪いレシピなのです。
3. 解像度の罠:高解像度の画像にはより大きな脳が必要
発見:画像の解像度が高くなる(鮮明で詳細になる)につれて、AI は見るデータの量よりもはるかに急速に巨大化する必要があります。
比喩:都市の地図を学ぼうとすることを想像してください。
- 低解像度(32x32):小さな町の地図を見るようなものです。たくさん歩き回る(より多くのデータ)ことで、全体を学ぶことができます。
- 高解像度(64x64 以上):高層ビルや細い路地がひしめく巨大な大都市の地図を見るようなものです。脳があまりに小さくて複雑な詳細を保持できない場合、単に歩き回るだけでは役に立ちません。
この論文は、画像が鮮明になるにつれて、タスクの「複雑さ」が爆発的に増大することを発見しました。これに対処するには、AI に画像をより多く与えるだけでは不十分です。複雑な詳細を処理するために、はるかに巨大な AI の脳を構築する必要があります。
4. ボトルネックは「本」ではなく「脳力」
発見:これを機能させるために待っているのは、より多くの画像ではなく、より高速なコンピューターです。
比喩:インターネット上の視覚データという、これまでに書かれたすべての本を持つ図書館を持っていると想像してください。あなたにはそれらすべてを読める学生がいます。問題なのは図書館が空っぽなことではなく、学生が年に 1 ページしか読んでいないことです。
著者たちは、コンピューターの性能が非常に急速に成長している(毎年程度で倍増している)ため、今後 5 年以内にこれらの「生ピクセル」モデルを実用的に訓練できるようになると予測しています。データはすでに存在しています。必要なのは、それを処理するための計算能力だけです。
結論
この論文は、生ピクセルから直接学習する AI の訓練は行き詰まりではないと結論付けています。これは機能し、予測可能なルールに従い、最終的に高い性能に達することができます。しかし、ピクセルは「愚直」なデータポイントであるため、現状では非常にコストが高く、時間がかかります。
将来これを機能させるためには、画像を圧縮する新しい方法を発明する必要はありません。私たちがすべきことは、より大きなコンピューターを構築し続け、AI が何かを「認識」するのか、それとも「作成」するのかに応じて、それに特化した膨大な量のデータを与えることです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。