On the Power of Foundation Models
本論文は圏論を用いて、プロンプトベースの学習は表現可能なタスクに厳密に限られる一方、事前学習タスクによって定義される圏内において微調整を施した十分な能力を持つ基盤モデルは理論上あらゆる下流タスクを解決し、構造的対応を通じて未見のオブジェクトへも一般化し得ることを示す。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
「基盤モデルの力」に関する論文を、平易な言葉と創造的なアナロジーを用いて解説します。
大きな問い:スーパーブレインはすべてをこなせるか?
宇宙のすべての本を読み、無限の学習時間を持ち、練習テストで決して間違えない学生がいると想像してください。著者たちは、シンプルな問いを投げかけます:「この学生が練習テストで完璧であれば、彼に投げかけられるあらゆる新しい問題を自動的に解決できるでしょうか?」
AI の世界において、この「学生」は基盤モデル(ChatGPT や画像生成モデルの背後にあるようなもの)です。「練習テスト」はプレテキストタスク(文の次の単語を予測することや、画像がどのように回転したかを推測することなど)と呼ばれます。
この論文は、データ量やコンピュータの規模に関する既存の理論ではこの問いに答えられないと主張します。代わりに、著者たちは圏論(構造の「文法」と考えてください)と呼ばれる数学の一分野を用いて、これらのモデルが何ができ、何ができないかを明らかにしました。
彼らは、これらのモデルが新しいことを学ぶ方法について、主に 2 つの規則を発見しました。
規則 #1:「プロンプト」の限界(図書館カードのアナロジー)
シナリオ:モデルに新しい仕事(例えば、写真から猫を特定する作業)をさせたいが、再学習はしたくないとします。その代わり、特定の指示や「プロンプト」(「猫を探してください」と書かれた図書館カードのようなもの)を与えるだけです。
発見:モデルが新しい仕事を解決できるのは、その仕事が元のトレーニングの構造の中にすでに「隠されている」場合に限られます。
アナロジー:モデルを図書館だと想像してください。
- プレテキストタスク(トレーニング)は、図書館が本をどのように整理したかです。もし図書館が本を「色」だけで整理していたなら、本は赤、青、緑で分類されています。
- プロンプトチューニングは、司書に「歴史の本を探してもらえますか?」と頼むようなものです。
- 結果:図書館が「色」だけで整理されていた場合、司書は世界最高の記憶力を持っていても、歴史の本を見つけることはできません。「歴史」というカテゴリは、図書館の構造そのものに存在しないからです。
- 論文の証明:著者たちは、トレーニングタスク(画像の回転を推測するなど)がモデルに「回転」のことだけを教えている場合、モデルをプロンプトで「セグメンテーション(物体を切り抜く)」のような複雑なタスクに指示しても機能しないことを証明しています。なぜなら、「切り抜く」という概念は、その図書館の構造に組み込まれていないからです。
結論:モデルにチェスだけを教えた場合、単にプロンプトを与えてサッカーをさせることはできません。新しいタスクは、古い構造で表現可能でなければなりません。
規則 #2:「ファインチューニング」の力(マスターキーのアナロジー)
シナリオ:新しい仕事用の小さなデータセットを使って、モデルに少しだけ新しい学習(ファインチューニング)を行ってもよいとします。
発見:これははるかに強力です。モデルが初期トレーニング中に世界の「構造」を十分に学習していれば、新しいタスクをすべて学習できます。ただし、そのためには情報を結びつけるための十分なリソース(データと計算能力)を与える必要があります。
アナロジー:モデルを、特定の建物(プレテキストタスク)の鍵穴に合うように切り抜かれたマスターキーだと想像してください。
- ファインチューニングは、そのマスターキーを少し削って、別の建物の新しい扉に合うようにすることです。
- 結果:マスターキーが最初の建物の鍵の本質を捉えていれば、それを形変えて世界のほぼすべての扉を開けることができます。
- 論文の証明:著者たちは、モデルが「理想的」である場合(トレーニング構造を完璧に学習している場合)、それは下流のあらゆるタスクを解決するために必要なすべての情報を含んでいることを示しています。新しいタスクのトレーニングデータは、その情報をどのように形変えるべきかを示すガイドとして機能するに過ぎません。
結論:ファインチューニングはプロンプトの「表現可能性」によって制限されません。基盤が強ければ、モデルはほぼ何でも適応させることができます。
規則 #3:「魔法の橋」(翻訳者のアナロジー)
シナリオ:テキストを理解するモデルと画像を理解するモデルを組み合わせる場合(マルチモーダル学習)、何が起こるでしょうか?
発見:この論文は「一般化定理」を提示します。それは、2 つの異なる世界(例えばテキストと画像)の間に完璧な橋(数学的写像)を築けば、一方の世界の構造が他方に保存されることを述べています。
アナロジー:「テキスト」を「画像」に完璧に翻訳する辞書を持っていると想像してください。
- テキストの世界には、「アボカドの形をした椅子(Avocado Chair)」という概念があります。この物体は現実世界には存在せず、トレーニングデータにその写真も存在しないかもしれません。
- しかし、テキストの世界には「アボカド」と「椅子」を組み合わせる論理的な構造があり、その辞書(モデル)が画像世界へ翻訳する際にその構造を完璧に保存しているなら...
- 結果:モデルは、一度も見たことのない「アボカドの椅子」の完璧な画像を「幻覚(ハルシネーション)」として生成したり、生成したりできます。それは画像を記憶したからではなく、単語間の関係性を理解し、その構造を画像世界に適用したからです。
論文の証明:これが、DALL-E 2 や CLIP のようなモデルがトレーニングセットに存在しないものの画像を作成できる理由を説明しています。それらは単にコピーしているのではなく、言語の構造的論理を用いて新しい画像を構築しているのです。
論文の主張のまとめ
- プロンプティングには限界がある:モデルに、トレーニング方法にすでに「組み込まれている」ことしかさせることはできません。トレーニングが新しいタスクの構造を教えていなければ、単純なプロンプトでは機能しません。
- ファインチューニングは強力である:少しの追加学習を行えば、良い構造を学習したモデルは、ほぼあらゆるタスクを解決するように適応させることができます。
- 構造は新しいものを生み出す:ある領域(例えばテキスト)の構造を別の領域(例えば画像)に完璧に写像することで、モデルは(アボカドの椅子のように)これまで存在しなかったものを生成できます。それは単に画像を記憶しているのではなく、構造の論理的規則に従っているからです。
著者たちは、特定のネットワークのサイズやデータ量について話しているのではなく、タスク自体の論理的構造について話していると強調しています。彼らは数学を用いて、トレーニングタスクの「形状」が、モデルが最終的に何ができるかの「形状」を決定することを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。