← 最新の論文
💬 NLP

One mechanism for many mental spaces: a shared router over a value slot in language models

本論文は、トランスフォーマー言語モデルが、各コンテキストの型ごとに個別の論理構造を採用するのではなく、単一の再利用可能なスロットから値を選択する共有された低ランクルーターを用いることで、多様なメンタルスペース(信念、フィクション、反事実など)のための統一されたメカニズムを実装していることを実証している。

原著者: Oliver Steele, Jiangtao Wen, Yuxing Han

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Oliver Steele, Jiangtao Wen, Yuxing Han

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

言語モデルを、単に本を保管するだけでなく、単一の図書館の中に「世界」そのものを格納している、超整理整頓された司書として想像してみてください。この図書館では、ある花は「現実世界」セクションでは赤色であり、「肖像画」セクションでは紫色であり、「アリスの夢」セクションでは緑色になります。大きな疑問はこうでした。司書はこれらの世界を、それぞれ異なるルールを持つ完全に分離された魔法の部屋に保管しているのでしょうか?それとも、これらすべてを扱うための、一つの巧妙で再利用可能なシステムを使用しているのでしょうか?

この論文は、司書がすべてに対して一つの共有されたシステムを使用していることを示唆しています。

魔法のタグとルーター

花の色のことを、棚に置かれたデータの一片だと考えてください。この論文は、モデルがどの世界を読み込むかを選択するために、特別な低ランクの「タグ」(ルーターまたは空間インデックスと呼ばれます)を使用していることを見出しました。このタグは、データそのものとは別物です。データは**バリュー・スロット(値のスロット)**と呼ばれる中立的なストレージ領域に置かれており、そこには色が保持されていますが、その色が現実のものか夢のものかは問いません。

しかし、もしあなたが「肖像画の中の花は何色ですか?」と尋ねたとき、モデルはどうやってその色を選び出すのでしょうか?モデルはルーターを使用します。このルーターは、因果的に操作可能なスマートなインデックスと考えることができます。あなたが肖像画について尋ねると、ルーターは「肖像画」の設定を選択し、モデルは共有されたスロットから紫色の花を読み取ります。あなたが現実について尋ねると、ルーターは「現実」を選択し、モデルは赤色の花を読み取ります。

この論文は、このルーターが世界の種類ごとに異なるマシンではないことを示しています。それが信念(アリスが考えていること)であれ、記憶(昨日)であれ、仮定(もし〜だったら…)であれ、あるいはフィクション(映画の中)であれ、モデルは同じ種類のルーターを使用しています。

すべてを支配する一つのスイッチ

研究者たちは、モデルに「仮定」(起こり得ること)のような、たった一つのタイプの世界を制御するように訓練することで、この検証を行いました。そして、その同じ制御メカニズムを、「信念」や「映画」のような他の世界に対して試してみました。

結果はどうだったでしょうか?スイッチはすべてに対して機能しました。

  • モデルに仮定のシナリオにおける色を反転させるように訓練したところ、その同じ訓練によって、信念のシナリオにおける色も(モデルのファミリーによりますが)71%から89%の確率で反転しました。
  • これは、モデルが「信念用のマシン」と「映画用のマシン」を完全に別物として持っているのではなく、あらゆるコンテキストを処理するための一つの共有されたルーターを持っていることを示唆しています。

それが「何ではない」のか(排除されたアイデア)

この論文は、このシステムが「何ではないか」についても非常に慎重に述べています。

  • 単なる言葉の記憶ではない: モデルは単に「現実」の近くに「赤」という言葉が現れ、「肖像画」の近くに「紫」が現れるということを暗記しているわけではありません。システムは、コンテキスト(文脈)そのもののコードを実際に保持しています。
  • 信念のための別々の部屋ではない: 形式論理学では、「信念」をルールが変わる全く異なる不透明なカテゴリーとして扱うことがよくあります。しかし、この論文は、メカニズムとしては、モデルは信念を他のあらゆる空間と同じように扱っていると主張しています。「信念」のタグは、モデルの配線において「仮定」のタグとは特別であったり分離されていたりすることはありません。
  • 静的な付箋ではない: モデルは色を永久的なメモに書き込んでそこに置いておくわけではありません。むしろ、それは検索システムに似ています。質問を受けると、モデルはソーステキストに戻り、現在の「空間」設定に基づいて色を再読します。それは、永久的なストレージ・スロットではなく、「ジャスト・イン・タイム(必要な時にその場で)」の読み込みなのです。

「報告」と「推論」の分離

ここで、論文が発見した面白い展開があります。モデルには、同じ情報に対する2つの異なるパスが存在します。

  1. 報告パス(Report Path): これはモデルが声に出して言う内容です。
  2. 推論パス(Reasoning Path): これはモデルがパズルを解くために使用する内容です。

研究者たちは、これらのパスを個別に制御できることを見出しました。モデルに「花は緑色である」と言わせる(報告を反転させる)一方で、モデルが「花は青色である」として論理パズルを解き続ける(推論を変化させない)ように訓練することができたのです。これは、モデルが「何を言うか」と「何を考えるか」を、同じ情報源から来ていながらも、脳のわずかに異なる部分に保持していることを証明しています。

新しい世界の構築

モデルが「アリスはかつて、カップは青いと信じていた」のような複雑な文章に遭遇したとき、モデルは新しい空間(「過去」と「信念」の混合)を構築しています。論文は、モデルがこれのために全く新しいライブラリを構築しているのではないことを示しています。代わりに、モデルは同じバリュー・スロット(カップの色)を再利用しながら、この新しい結合された世界のために**新しいルーターを鋳造(ミント)**しています。これは、既存の本を取り出し、物語全体を書き換えることなく、新しい一時的なカバーラベルを付けるようなものです。

どの程度確かなのか?

論文はこれらの知見についてかなりの自信を持っていますが、特定の限界も設けています。

  • ラボでの証明: 結果は、3つの異なるモデルファミリー(Qwen、Pythia、Falcon3)におけるモデルの内部的な「活性化(アクティベーション)」(その電気信号)の直接的な測定に基づいています。研究者たちは単に推測したのではなく、ルーターが挙動を引き起こすことを証明するために、モデルのコードに物理的に介入しました。
  • 万能薬ではない: 論文は、ルーターは共有されているものの、すべてのタイプの世界に対して完全に同一というわけではないことを認めています。例えば、「絵画」や「映画」のコンテキストは、時として「信念」のコンテキストとは少し異なる挙動を示すことがあります。また、モデルがこれらの世界を扱う能力は「検索型(retrieval-shaped)」であり、テキストを再読することに依存しているため、一部のテストではわずかに「漏れ(leaky)」が生じます。
  • 規模が重要: これらのメカニズムの詳細は、より小さなモデル(30億パラメータ)で見つかったものです。しかし、その「挙動」(これらの世界を扱う能力)は、巨大なフロンティアモデル(GPT-4oや72Bモデルなど)においても存在することが確認されており、巨大なモデルの内部を覗くことは容易ではなくても、このメカニズムはスケールアップしても維持されることを示唆しています。

要約すると、この論文は、言語モデルが、現実、夢、信念、映画をそれぞれ異なるツールを使うのではなく、単一の再利用可能な「空間ルーター」を用いることで、これらを使い分けていることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →