From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond
本論文は、大規模言語モデルを世界モデルの退化した特殊なケースであると論じることで、大規模言語モデルと世界モデルの間の二項対立的な区別に異議を唱え、トークン予測から潜在空間シミュレーションに至るアーキテクチャの連続的なスペクトラムを提示するとともに、アクションラベル付き環境へのスケーリングおよび連続状態予測のためのトランスフォーマー・アーキテクチャの適応における重要な研究課題を浮き彫りにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きな誤解:二つの異なる世界?
AIコミュニティでは、二種類の異なる旅行者について議論が交わされています。
- グループA(LLM): 「私たちは単なる単語予測器です。あなたが入力した最後の単語を見て、次の単語を推測しているだけです。私たちは現実世界については何も知りません。ただ、言葉がどのように組み合わさるかを知っているだけなのです」
- グループ B(世界モデル): 「私たちは現実のシミュレーターです。チェスのプレイヤーが数手先を考えるように、将来の計画を立てるために、世界がどのように機能するかというメンタルマップ(心の地図)を構築します」
この論文は、これら二つのグループは実際には異なる角度から同じものを見ているのだと主張しています。著者であるポール・デュボアはこう述べています。「あなたは二つの異なる種を見ているのではありません。あなたは子犬と成犬の狼を見ているのです。子犬は、非常に制限された状態の狼に過ぎないのです」
クレーム #1:「子犬」は実は「小さな部屋の中にいる狼」である
この論文は、大規模言語モデル(LLM)も実際には「世界モデル」であると主張していますが、それらは非常に狭くて退屈な部屋の中に閉じ込められているのだとしています。
- 部屋(状態): 通常の世界モデルにおいて、「部屋」は全宇宙(車、天気、人々、物理法則)です。LLMにおける「部屋」は、単なる文字列です。
- アクション(行動): 通常の世界モデルでは、多くのことができます(運転する、跳ぶ、話すなど)。LLMにおいてできることは、「一つの単語を付け加える」ことだけです。
- トリック: LLMは単語を付け加えることしか許されていませんが、その脳内(隠れ層)には、密かに世界の地図を構築しています。
- 比喩: たった一言ずつしか話すことが許されない人がいると想像してください。もしその人に、「ポーン」「キング」「チェック」といった言葉だけでチェスのゲームをするよう求めた場合、彼らは物理的に駒を動かすことはできません。しかし、彼らの頭の中では、チェス盤全体のレイアウトを完璧に可視化しています。言葉は単なるインターフェース(接点)であり、世界モデルはその精神の中に生きているのです。
論文は、テキストのみで学習されたモデルであっても、直接教えられていない概念(チェス盤の配置や時間の経過など)を実際に「見て」いることを示すことで、これを証明しています。
クレーム #2:それは断崖絶壁ではなく、緩やかなスロープである
ヤン・ルカンのような多くの専門家は、我々は単語予測モデルを完全に放棄し、JEPA(潜在的な、あるいは隠れた空間における「状態」を予測するシステム)と呼ばれる全く新しいシステムに切り替える必要があると主張しています。
この論文はこう言っています。「崖から飛び降りる必要はありません。ただスロープを歩いて上がっていけばいいのです」
著者は、単純な単語予測器と複雑な現実シミュレーターをつなぐ**連続的なスペクトラム(滑らかなスライド)**を描いています。古いモデルを捨てる必要はありません。ルールを一つずつ緩めていけばよいのです。
以下が、スロープを登る道筋です:
- 出発点(標準的なLLM): 一度に一つの単語を予測します。
- メリット: 無限のデータ(インターネット全体)と、完璧なツール(Transformerアーキテクチャ)があります。
- ステップ1:マルチトークン予測: 一度にいくつかの単語を予測します。
- 変化: 一文字ずつ推測することを強制するのをやめます。これにより、モデルは推論においてわずかに賢くなりますが、依然としてインターネット上のテキストと既存のツールを使用しています。
- ステップ2:未来の要約: 未来の圧縮された要約を予測します。
- 変化: 次の単語を推測する代わりに、次の段落の「要旨」を推測します。依然としてインターネットのテキストを使用しています。
- ステップ3:次なる潜在状態の予測: 単語ではなく、次の「思考」(隠れ状態)を予測します。
- 変化: モデルは単語を出力するのをやめ、内部的な概念を出力し始めます。これは学習がより困難になりますが、依然としてインターネットのテキストを使用できます。
- スロープの頂上(JEPA): 行動に基づいた現実世界の次の状態を予測します。
- 大きな転落: ここで、簡単な要素がすべて消え去ります。
- データの問題: インターネットはもう使えません。ロボット、自動運転車、またはどの行動がどのような結果をもたらしたかを正確に知ることができるビデオゲームなどから得られる、特定のデータが必要です。このデータは希少で、入手が困難です。
- ツールの問題: 言葉のために使ってきた「Transformer」というツールは、うまく機能しない可能性があります。連続的な現実を扱うには、全く新しいツールが必要になるかもしれません。
- 大きな転落: ここで、簡単な要素がすべて消え去ります。
二つの大きなボトルネック
論文は、なぜ私たちがスロープの底部(LLMの段階)に留まっており、頂上(JEPAの段階)に到達できていないのか、その主な理由を二つ特定しています。
- データの断崖:
- 底部では: 学習するための言葉がインターネット上に数兆語もあります。それは無料で、容易に入手できます。
- 頂上では: ロボットが壁にぶつかったときのような、ラベル付けされた特定の相互作用が数百万件必要です。これは高価で、収集が困難です。
- アーキテクチャの疑問:
- 底部では: Transformerは言葉のために作られた機械です。それは、四角いボルトに完璧にフィットするレンチのようなものです。
- 頂上では: 連続的な現実(流体の動きなど)を予測する必要があります。そのレンチは適合しないかもしれません。私たちはまだ、それがどのような姿をしているのかさえ分かっていません。
結論:橋を焼き払うな
この論文は、現在のAIモデルを捨てる必要はないと結論づけています。
- ルカン氏は正しい。単純な単語予測器だけでは、複雑な物理的計画を立てることはできません。
- しかし、彼は間違っている。ゼロからやり直す必要はないのです。
代わりに、現在のモデルを長い旅路の第一歩として捉えるべきです。単語の予測から概念の予測へ、そして最終的には現実の予測へと、一歩ずつ、ゆっくりとアップグレードしていくことができます。目的地は明確ですが、その道筋は突然の跳躍ではなく、緩やかな登りなのです。
要約すると: LLMは「偽の」世界モデルではありません。単に、後ろ手に縛られた状態の世界モデルなのです。もし私たちがその手をゆっくりと解いてあげれば、全く新しい宇宙を発明することなく、私たちが望む強力なAIへと到達できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。