Belief-reality separation lives in routing over a shared value slot in language models
本論文は、言語モデルが、帰属された情報を格納する共有値スロットと、キャラクターの信念または客観的な現実のどちらから読み取るかを選択するクエリ・ポジション・ルーターという2つの異なるメカニズムを通じて、信念と現実を分離していることを特定しており、この能力は複数のアーキテクチャにおいて3Bから7Bパラメータの間で創発する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超高性能な言語モデルを、物語がリアルタイムで書かれ、読まれている、巨大で賑やかな図書館だと想像してみてください。長い間、私たちはこの図書館が、どのようにして登場人物の「信念」と「現実」を切り離して保持しているのかという謎に直面してきました。もし物語が「アンナはコップが青いと思っているが、実際には赤である」と言った場合、モデルは「アンナは何と考えているか?」と問われれば「青」と答え、「実際には何が真実か?」と問われれば「赤」と答えなければなりません。
この論文は、モデルの脳がまさにどのようにこれを行っているのかを明らかにするために、そのカーテンをめくって中身を見せてくれます。結論から言えば、モデルは「真実」と「嘘」のための別々の保管室を使っているわけではありません。代わりに、**「ユニバーサル・ファイリング・スロット(共通の記録用スロット)」と「スマート・スイッチ(賢い切り替え器)」**という、巧妙な二部構成のシステムを使用しています。
ユニバーサル・ファイリング・スロット
まず、モデルのメモリ内には「バリュー・スロット(値のスロット)」と呼ばれる特定の場所があります。これは、デスクの上にある、単なる汎用的な付箋のようなものだと考えてください。この付箋は、誰が見ているのか、あるいは何を信じているのかなどには関心がなく、ただ「青」という色を保持しているだけです。
論文によれば、このスロットには2通りの方法で情報が書き込まれます。
- 直接書き込み: テキストが明示的に「アンナはコップが青いと信じている」と言っている場合、モデルは「青」をその付箋に直接書き込みます。
- 探偵のような振り返り: テキストが「アンナはベンがコップを青く塗るのを見た」と言っている場合、モデルは少し探偵のような作業を行う必要があります。物語を遡って、アンナが実際に何を見ることができたのかを調べ、色が青であることを突き止めた上で、同じ付箋に「青」と書き込みます。
ここでの重要なポイントは、付箋自体には「これはアンナの信念である」とか「これは真実である」といったラベルが付いていないということです。それは単なる「青」という色のためのニュートラルな容器に過ぎません。もしこの付箋の色を入れ替えた場合、信念に関する質問への答えも、現実に関する質問への答えも、等しく変わってしまいます。付箋は単に「何が(what)」を保持するものであり、「誰が(who)」や「いつ(when)」を保持するものではないのです。
スマート・スイッチ(ルーター)
では、付箋がニュートラルであるなら、モデルはどうやってどちらのバージョンを読み取るべきかを判断しているのでしょうか?そこで、二つ目のメカニズムが登場します。それは、質問が行われるまさにその瞬間に作動する**「ルーター」**です。
図書館の出口に立っている交通整理の警官を想像してください。誰かが「アンナは何と考えていますか?」と尋ねると、警官はスイッチを「信念」レーンへと切り替えます。誰かが「実際には何が真実ですか?」と尋ねると、警官はスイッチを「現実」レーンへと切り替えます。
論文は、これら2つのレーンが完全に独立していることを証明しています。「信念」のスイッチと「現実」のスイッチは、異なるドアを開けるための2つの異なる鍵のようなものです。これらが混ざることはありません。「信念」の鍵を使って「現実」のドアを開けようとしても、ほとんど機能しません。この分離は、色の保管場所で行われるのではなく、質問が行われた瞬間に、まさにそのタイミングで行われるのです。
この「超能力」はいつ現れたのか?
研究者たちは、この能力がいつ備わるのかを確認するために、さまざまなサイズのモデルをテストしました。
- 小型モデル(30億パラメータ): これらのモデルは混乱します。彼らは誰が何を見たのかを追跡するのではなく、最後に聞いた色を単に繰り返す(これは「再帰性」と呼ばれるトリックです)ことがよくあります。
- 中型モデル(70億パラメータ): 突然、この能力がカチッと組み合わさります。30億から70億の間で、モデルは信念と現実を明確に分離することを学習します。70億パラメータに達する頃には、物語の順序に関わらず、これらのパズルをほぼ完璧に解くようになります。
これは「何ではない」のか
この論文は、いくつかの一般的な推測を排除することに細心の注意を払っています。
- 「真実」対「嘘」のタグではない: モデルは、色の付いた「信念」スタンプを持っているわけではありません。色「青」は、それが信念であっても事実であっても、同じ方法で保存されます。違いは、モデルがそれをどのように「読み取るか」という点にのみ存在します。
- 単なるコピーではない: テストは、単に最後に言及された単語をコピーするだけでは通用しないように設計されています。モデルは実際に、誰が何を見たのかを追跡しなければなりません。
- 単一の大きな「信念脳」ではない: この研究は、値を保存する部分が、どの視点を使用するかを決定する部分とは異なることを示しています。
結論
要約すると、モデルは「信念マシン」と「現実マシン」を持っているわけではありません。値のための**「共有ファイルキャビネット」と、質問に基づいてどの引き出しを開けるかを決定する「スマート・スイッチ」**を持っているのです。このシステムは、異なる種類のモデル(Qwen、Mistral、OLMoなど)にわたって機能し、モデルがある程度の大きさ(約70億パラメータ)になると鋭く出現します。
研究者たちは、モデルの内部コードの小さな断片(付箋やスイッチの交換のようなもの)を入れ替え、それによって答えがどう反転するかを観察することで、この仕組みを発見しました。彼らは、この同じ「スロットとスイッチ」のシステムが、他のトリッキーな状況(タイムトラベルの物語や「もしも」のシナリオなど)でも機能する可能性があると考えていますが、この特定の論文は、信念と現実の分離にのみ焦点を当てています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。