Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
本論文は、複数の生成候補を探索して最良のものを選択するために学習ループを因数分解する新しいパラダイムである「探索的モデリング(Explorative Modeling)」を導入し、それによって、探索を効率性と性能をあらゆるドメインで向上させるスケーラブルな第3の事前学習軸として確立し、真のエンドツーエンドの生成モデリングを可能にするものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに絵を描くことを教えようとしている場面を想像してみてください。かつての機械学習では、エンジニアは工場のようなラインを構築していました。あるマシンが輪郭を描き、別のマシンが色を塗り、3番目のマシンが目を描き加えるという具合です。これは機能してはいましたが、煩雑で時間がかかるものでした。その後、ある革命(AlexNetと呼ばれる有名なモデルによって引き起こされたもの)が起こり、より優れた方法を教えてくれました。それは、ロボットに全体像を丸ごと与え、最初から最後まで一度にすべてを学習させるという方法です。この「エンドツーエンド(端から端まで)」のアプローチは、顔認識から言語翻訳に至るまで、ほぼすべての分野でゴールドスタンダード(標準)となりました。
しかし、一つの頑固な問題が、この新しいルールに従うことを拒み続けました。それは、画像、動画、あるいは物語を生成するタイプの技術である「生成AI」です。これらのモデルは驚くほど有能ですが、依然としてその古めかしい工場のラインに依存しています。彼らは創造的なプロセスを、非常に、非常に小さなステップに分解します。例えば、犬を描く場合、最初はぼやけた形を推測し、次にそれを洗練させ、次に毛を加え、次に目を加えるといった具合に、これを何百回も繰り返します。問題は、ステップを踏むたびに、小さなミスが発生する可能性があることです。100ステップ目を終える頃には、それらの小さなミスが積み重なり、犬が少し奇妙に見えたり、ぼやけてしまったりするのです。科学者たちは長年、「なぜ、ステップに分解せずに、一度に犬の全体を描くようにロボットを訓練できないのだろうか?」と問い続けてきました。
アレキシ・グラッドストーン、ヘン・ジ、イロン・ドゥによる新しい論文によれば、その答えは、「何を描くか」という世界が混沌としていることにあります。「犬を描いて」というリクエストには、ただ一つの正解があるわけではありません。何十億通りもの異なる犬が存在します。戦略なしに、これらすべてを一斉に描こうとすると、モデルは混乱し、ただのぼやけた平均的な犬を描いてしまい、現実には存在しない何かになってしまいます。既存のモデルは、描画をステップに分解することでこの問題を解決していますが、これは「エンドツーエンド」のルールを破っています。この論文は、**「探索的モデリング(Explorative Modeling)」**と呼ばれる巧妙な新しいトリックを紹介しており、これによりモデルはステップに分解することなく、この混沌とした状況に対処できるようになります。
新しい戦略:「試行、試行、そして試行」
著者らは、シンプルながら強力なアイデアを提案しています。モデルに最初の一回で正解を当てるよう強制するのではなく、何度も試させて、その中からベストなものを選ばせるという方法です。彼らはこれを**「探索的モデリング(Explorative Modeling)」**と呼んでいます。
あなたが、1から100の間にある秘密の数字を当てるゲームをしていると想像してください。
- 古いやり方(標準的なモデル): あなたは数字を一つ予想します。もし間違っていたら、ヒントをもらって再び挑戦します。これを何百回も繰り返し、徐々に正解に近づいていきます。しかし、予想するたびに、ヒントの解釈において小さなミスをする可能性があり、最後には少しズレてしまうかもしれません。
- 新しいやり方(探索的モデリング): あなたは一度に50個の異なる数字を叫ぶことが許されます。その後、秘密の数字を見て、「よし、私の50個の予想の中では、42番が一番近かった!」と言います。あなたは、その勝者からのみ学びます。他の49個の間違った予想は無視します。
論文の言葉では、これは**「K個の候補(K candidates)」を探索することと呼ばれます。モデルはK**個の異なる可能性(例えば、50種類の異なる犬)を生成し、最も実際のデータに近いものに対してのみ学習を行います。このようにすることで、モデルはすべてをぼやけた汎用的な塊に混ぜ合わせるのではなく、特定の鋭いディテール(特定の犬種など)にコミットすることを学ぶのです。
なぜこれがすべてを変えるのか
この論文は、この「何度も試して、ベストを選ぶ」というアプローチが、主に3つの方法でゲームチェンジャーになることを明らかにしています。
1. スケーリングのための新しいスーパーパワー
通常、AIをより良くするためには、脳を大きくするか(パラメータを増やす)、より多くのデータを入力します。しかし、著者らは第3の道を発見しました。それは、トレーニング中に予測の回数を増やすことで、モデルをより「一生懸命に試行させる」ことです。彼らはこれを**「探索(exploration)」**と呼んでいます。
- 画像、動画、言語モデルでテストしたところ、単に探索(予測の回数)を増やすだけで、モデルが大幅に向上することが分かりました。
- データとモデルのサイズをスケールアップさせるにつれて、このトリックの効果は高まりました。例えば、データを追加するにつれて、探索による性能向上は**7%から36%へと成長しました。モデルが大きくなるにつれ、その利得は13%から23%**へと跳ね上がりました。
- また、これによりモデルは非常に効率的になりました。探索を使用することで、コンピュータの計算量(FLOPs)は4.1倍、使用データの効率は6.2倍、モデルサイズの効率は**47%**向上することが分かりました。
2. モデルを再び「エンドツーエンド」にする
モデルは自身の予想の中からベストな一致するものを選ぶことで学習するため、タスクを小さなステップに分解する必要がなくなります。モデルはプロセス全体を一度に学習できます。
- この論文は、十分な探索があれば、モデルはトレーニングされた通りに、一回のステップで画像や動画全体を生成できることを示しています。
- ロボットのタスク(ロボットアームを動かすように教える作業)のテストにおいて、この新手法は既存の最高の方法と同等の性能を示しながら、計算ステップ数を16分の1から256分の1に削減しました。ロボットアームを動かすために100ステップ必要だった代わりに、新しいモデルはわずか1ステップで実行できました。
3. モデルの学習をより良くする
著者らは、この手法がモデルの汎化能力(単に学習データを暗記するのではなく、ルールを実際に学ぶこと)を高めると示唆しています。動画生成のテストにおいて、探索を行うモデルは過学習(暗記)が少なく、未知のデータに対しても優れた性能を発揮しました。選択肢として「ベストな一致を選ぶ」というオプションを持つことが、学習プロセスをよりスムーズにし、混乱を抑えているようです。
まとめ
この論文は、ここ10年以上の間、私たちはAIをより賢くするために、より大きくするか、より多くの本を読ませることで解決しようとしてきたことを示唆しています。しかし、この研究は、私たちに**「探索(exploration)」**という第3の要素が欠けていたことを示しています。AIに多くの可能性を生成させ、その中の勝者から学ぶことをさせることで、私たちは新しいレベルのパフォーマンスを解き放つことができます。
著者らは、これはまだ探求段階にある新しいパラダイムであることにも注意を払っています。画像、動画、および一部の言語タスクでは非常にうまく機能しますが、他のタイプのモデルにはさらなる調整が必要かもしれないと考えています。しかし、結果は有望です。彼らは、特別な「ガイダンス」のテクニックを使わずに、ImageNetにおいてほぼ完璧な結果(FIDスコア 1.43)を出す画像生成器を実現し、それと同時にトレーニングプロセスを効率化することに成功しました。
要するに、この論文は、AIの未来は単に「より大きな脳」を持つことではなく、「よりスマートな推測方法」を持つことにあると主張しています。AIに多くの経路を試し、その中の勝者を選ぶチャンスを与えることで、私たちはついに、ディープラーニングの他の分野が長年行ってきたように、全体像を一度に描き出すことを教えることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。