あなたの心を読み、文章の続きを補完できる超スマートなロボットがいると想像してみてください。このロボットを研究する科学者たちは「大規模言語モデル(LLM)」と呼ばれ、まるで探偵のように、ロボットが「どのように」考えているのかを解明しようとしています。彼らは単にロボットの最終的な答えを見るだけでなく、作業中のロボットの「脳」の中を覗き込み、どの部分が何をしているのかを知ろうとするのです。一つの大きな謎は、ロボットが「もし数字が大きければ『犬』と言い、そうでなければ『猫』と言う」といった、その場で学んだルールをどのように処理するかという点です。ロボットは、「犬」と「猫」の間で切り替わる、専用の再利用可能なスイッチを持っているのでしょうか?それとも、ルールと答えを混ぜこぜにした、ぐちゃぐちゃな方法で、毎回ゼロから答えを導き出しているのでしょうか?ロボットがどのように判断を下しているのかを正確に理解できれば、より良いルールを教えたり、間違いを防いだりすることができるようになるため、これは極めて重要です。
この論文は、まさにその問いを深く掘り下げたものです。研究者たちは、3つの異なるAIモデルに対し、単純な「もし〜ならば、〜」というルールに従うよう指示するゲームを用意しました。これは6つの異なる言語で行われました。彼らは「アクティベーション・パッチング」と呼ばれる巧妙なトリックを使いました。これは、ロボットの脳内にある特定の思考を、別のシナリオからの思考と入れ替えることで、ロボットの答えが変化するかどうかを確認するというものです。車のエンジンに使う燃料を入れ替えて、車がまだ走れるかどうかを確認するようなものだと考えてください。
研究の結果、驚くべきことが分かりました。ロボットの脳は、2つの非常によく異なるゾーンに分かれているのです。第一のゾーンは、彼らがTESTと呼んでいるもので、専用のモジュール式のスイッチのようなものです。ロボットが「数字が5より大きいか」をチェックするとき、この特定の脳の部分が「真(True)」または「偽(False)」という答えと共に点灯します。研究者たちは、この「真/偽」の信号を別の信号と入れ替えたところ、ロボットが即座に新しい信号に合わせて最終的な答えを変えたことで、これを証明しました。この「TEST」ゾーンは、異なるモデル、異なる言語(タミル語やシンハラ語さえも)、そして異なる種類のルールにおいても、同様に機能します。これは、クリーンで再利用可能なモジュールなのです。
しかし、第二のゾーン、彼らがROUTEと呼んでいる部分は、完全な混乱状態にあります。ここは、その「真/偽」の信号を受け取り、「犬」と言うべきか「猫」と言うべきかを決定するはずの部分です。研究者たちは、このルーティング(経路制御)を扱う特別な「スイッチ」や「部分空間」を見つけようとしました。彼らは、「犬」と「猫」を完璧に入れ替える方向を見つけ出しました。しかし、問題はここにあります。その同じスイッチを、「キツネ」と「フクロウ」のような別の単語のペアに対して使おうとしたところ、全く機能しなくなったのです。それはまるで、特定のドアを開けることができる鍵は見つけたものの、見た目が同じ他のドアには一切開かない鍵を見つけたようなものでした。
したがって、大きな結論は「非対称性」にあります。ルールを「チェックする」部分は、頑丈で、持ち運び可能で、再利用可能なツールです。しかし、答えを「届ける」部分は、独立した再利用可能なツールではありません。むしろ、使用されている特定の単語に、きつく接着されているようです。もし単語を変えてしまうと、「ルーティング」の仕組みは壊れてしまいます。ロボットには普遍的な「回答スイッチ」は存在しません。ただ、その瞬間に学習した特定の単語に対して、答えを読み出すための特定の方法を持っているだけなのです。これは、私たちがロボットの論理(「TEST」)を操るのは容易かもしれませんが、その具体的な選択(「ROUTE」)を操ろうとすることは、期待していたよりもずっと難しく、信頼性に欠ける可能性があるということを意味しています。
技術要約:テスト、そしてルーティング:言語モデルはいかにして文脈内条件規則を実行するか
問題提起
大規模言語モデル(LLM)は、「もし P(x) ならば A、そうでなければ B」という形式の文脈内条件規則を頻繁に実行する。メカニスティック・インタープリタビリティにおける根本的な問いは、モデルがテスト(述語 P(x) の評価)とルーティング(適切な回答 A または B の選択)のための分離可能なモジュールからなるランタイム回路を組み立てているのか、それともこれらのプロセスが単一の不可分なメカニズムの中に絡み合っているのか、ということである。行動評価によってモデルがルールに従うことは確認できるが、これらは内部の組織構造を区別することはできない。重みに格納された回路(例:間接目的語識別)とは異なり、文脈内条件付きルールは、推論時に動的なプロンプト内容に基づいて回路を組み立てる必要がある。
手法
著者らは、アクティベーション・パッチングを用いて、「テスト」(述語の評価)と「ルート」(回答の選択)を分離するための新しい実験デザインを提案している。
4つのドナーによる設計: コアとなる革新は、述語の真理値と回答単語の間に「不一致」を生じさせる4つのドナー・プロンプトの設定である。
- BASE: 標準的なルール、述語 TRUE → 回答 A。
- O-DONOR: 標準的なルール、述語 FALSE → 回答 B(結果を反転させる)。
- MAP-DONOR: 入れ替えられたルール(「もし P(x) ならば B、そうでなければ A」)、述語 TRUE → 回答 B(マッピングを反転させ、述語の真理値は維持)。
- MAP-NULL: 入れ替えられたルール、述語 FALSE → 回答 A(マッピングを反転させ、述語の真理値は維持)。
- ロジック: MAP-DONOR と MAP-NULL では、真理値と回答単語が逆のラベルを指している。研究者がある層の残差ストリームをドナーからベースの実行へとパッチングすることで、その層が条件(真理値に従う)を運んでいるのか、あるいは回答(単語に従う)を運んでいるのかを判断できる。
指標:
- 反転確率 (Flip Probability): パッチングによってモデルがドナーの回答を出力するかどうかを測定する。これは、分布崩壊によるアーティファクトを避けるため、ラベル質量閾値(≥0.30)によって制御される。
- スイング回復率 (R): パッチングによってベースのロジット差がどれだけドナーの方へ移動したかを測定する段階的な指標。
- 転移コントロール: 真のルーティング・モジュールとトークン固有のリードアウトを区別するため、著者らは一つのラベルペア(例:dog/cat)に対して低ランク部分空間(DAS-lite)を学習させ、保持された別のペア(例:fox/owl)に対してその能力をテストする。また、言語間転移についてもテストを行う。
実験範囲:
- モデル: 2つのファミリーに属する3つのオープンウェイトモデル(Gemma-3-4B, Gemma-3-12B, Qwen3-8B)。
- 言語: 4つのスクリプトにわたる6つの言語(英語、中国語、ヒンディー語、インドネシア語、タミル語、シンハラ語)。
- コントロール: 全てのセルで共有される固定された250個のアイテムバンクを使用。ルール理解と翻訳効果を分離するため、回答ラベル(dog/cat)はラテン文字で保持される。
主な結果
モジュール化された述語(TEST):
- 全18の実験セル(3モデル × 6言語)を通じて、明確な中間層の残差バンド(例:Gemma-3-4Bにおけるレイヤー21–22)が述語の真理値を運んでいる。
- このバンドをO-DONOR(真理値を反転させるもの)でパッチングすると、回答が再ルーティングされる確率は ≈1.0 である。
- 同じバンドをMAP-DONOR(マッピングを反転させるが真理値は維持するもの)でパッチングしても、回答は変化しない(≈0.0)。
- この分離性は、5つの異なる述語ファミリー(数値閾値、集合メンバーシップ、母音開始)および3つの出力バリアントにおいて保持されており、このモジュールが特定のルールではなく、抽象的な真理値を計算していることを裏付けている。
非分離なルーティング(ROUTE):
- ROUTE段階(真理値が回答単語にマッピングされる段階)には、分離可能で転移可能な部分空間は見られない。
- 学習された部分空間は、訓練されたラベルペアを完璧に反転させることができるが(相互置換精度 ≈1.00)、保持された新しいラベルペアへの転移には失敗する(精度 ≈0)。
- 言語間転移: Gemma-3-4Bにおいて、固定されたペア(dog/cat)に対する学習された方向は、他の言語(タミル語、中国語)における同じペアに対してほぼ完全に転移する(≈0.98)。これは、この方向がトークンに紐付いたもの(特定の回答トークンに特有)であり、抽象的なルーティング・メカニズムではないことを示している。
- Qwen3-8Bでは、方向はペアごとに特有であり、リードアウトとは直交しているが、依然として新しいペアへの転移性は持たない。
段階の境界:
- 実験により、明確な段階の境界(例:Gemma-3-4Bにおける L22→L23)が明らかになった。この境界より下ではパッチは条件に従い、境界より上ではパッチは回答単語に従う。
- TESTのアドカー(基準点)は言語に依存せず、一貫した相対的な深さに位置している。一方、ROUTEの発現時期はモデルや言語によって異なり、これはリードアウトがスタックの後半で結晶化することを示唆している。
意義と主張
本論文は、LLMがいかにして文脈内条件付きを実行するかについて、根本的な非対称性があることを主張している:
- テストはモジュール的である: 述語の評価は、因果的に分離可能で、局在化可能であり、移植可能なモジュールである。それは抽象的な真理値を運んでおり、それを上書きすることでモデルの決定を制御できる。
- ルートは絡み合っている: ルーティング・メカニズムは、再利用可能な抽象的モジュールではない。むしろ、それはトークンに紐付いたリードアウト方向(またはペア固有の方向)であり、特定の回答語彙と絡み合っている。これは異なるラベルペア間では汎用化されない。
含意:
- ステアリング(制御): 述語レベルのステアリング(真理値の修正)は、回答レベルのステアリングよりも、プロンプトや語彙セットに対して移植性が高い。
- 監査: 分離されたTESTバンドは、最終的な出力が放出される前に、判断と行動の不一致を検出するための「モニタリング・フック」を提供する。
- メカニスティックな理解: 本知見は、すべての文脈内行動が再利用可能な重み格納型回路に依存しているという仮定に疑問を投げかける。代わりに、ランタイムの組み立てには、テスト段階のみがモジュール的であるという、異なるフェーズが存在することを示している。
限界
著者らは、これらの結果がオープンウェイトモデルおよび制御された合成タスク(単一トークンのラテン文字ラベルを使用)に特有のものであると述べている。これらの知見が、プロプライエタリな最先端モデル、ネイティブスクリプトの条件付き、または自由形式の補完にまで及ぶとは主張していない。また、「絡み合った」性質としてのルーターの特性は、テストされた設定においては正確であるが、一般的なルーティング・タスクに汎用できるとは限らない。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録