← 最新の論文
💬 NLP

Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages

本論文は、アクティベーション・パッチングを通じて、言語モデルが中間層の残差バンドにおいて条件付き述語の真理値をモジュール的に符号化している一方で、これらの条件に基づいて回答をルーティングするメカニズムは、抽象的で転移可能なモジュールではなく、モデルや言語によって異なる、トークンに拘束されたペア固有のプロセスであることを実証している。

原著者: Luxshan Thavarasa, Sivasuthan Sukumar

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Luxshan Thavarasa, Sivasuthan Sukumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの心を読み、文章の続きを補完できる超スマートなロボットがいると想像してみてください。このロボットを研究する科学者たちは「大規模言語モデル(LLM)」と呼ばれ、まるで探偵のように、ロボットが「どのように」考えているのかを解明しようとしています。彼らは単にロボットの最終的な答えを見るだけでなく、作業中のロボットの「脳」の中を覗き込み、どの部分が何をしているのかを知ろうとするのです。一つの大きな謎は、ロボットが「もし数字が大きければ『犬』と言い、そうでなければ『猫』と言う」といった、その場で学んだルールをどのように処理するかという点です。ロボットは、「犬」と「猫」の間で切り替わる、専用の再利用可能なスイッチを持っているのでしょうか?それとも、ルールと答えを混ぜこぜにした、ぐちゃぐちゃな方法で、毎回ゼロから答えを導き出しているのでしょうか?ロボットがどのように判断を下しているのかを正確に理解できれば、より良いルールを教えたり、間違いを防いだりすることができるようになるため、これは極めて重要です。

この論文は、まさにその問いを深く掘り下げたものです。研究者たちは、3つの異なるAIモデルに対し、単純な「もし〜ならば、〜」というルールに従うよう指示するゲームを用意しました。これは6つの異なる言語で行われました。彼らは「アクティベーション・パッチング」と呼ばれる巧妙なトリックを使いました。これは、ロボットの脳内にある特定の思考を、別のシナリオからの思考と入れ替えることで、ロボットの答えが変化するかどうかを確認するというものです。車のエンジンに使う燃料を入れ替えて、車がまだ走れるかどうかを確認するようなものだと考えてください。

研究の結果、驚くべきことが分かりました。ロボットの脳は、2つの非常によく異なるゾーンに分かれているのです。第一のゾーンは、彼らがTESTと呼んでいるもので、専用のモジュール式のスイッチのようなものです。ロボットが「数字が5より大きいか」をチェックするとき、この特定の脳の部分が「真(True)」または「偽(False)」という答えと共に点灯します。研究者たちは、この「真/偽」の信号を別の信号と入れ替えたところ、ロボットが即座に新しい信号に合わせて最終的な答えを変えたことで、これを証明しました。この「TEST」ゾーンは、異なるモデル、異なる言語(タミル語やシンハラ語さえも)、そして異なる種類のルールにおいても、同様に機能します。これは、クリーンで再利用可能なモジュールなのです。

しかし、第二のゾーン、彼らがROUTEと呼んでいる部分は、完全な混乱状態にあります。ここは、その「真/偽」の信号を受け取り、「犬」と言うべきか「猫」と言うべきかを決定するはずの部分です。研究者たちは、このルーティング(経路制御)を扱う特別な「スイッチ」や「部分空間」を見つけようとしました。彼らは、「犬」と「猫」を完璧に入れ替える方向を見つけ出しました。しかし、問題はここにあります。その同じスイッチを、「キツネ」と「フクロウ」のような別の単語のペアに対して使おうとしたところ、全く機能しなくなったのです。それはまるで、特定のドアを開けることができる鍵は見つけたものの、見た目が同じ他のドアには一切開かない鍵を見つけたようなものでした。

したがって、大きな結論は「非対称性」にあります。ルールを「チェックする」部分は、頑丈で、持ち運び可能で、再利用可能なツールです。しかし、答えを「届ける」部分は、独立した再利用可能なツールではありません。むしろ、使用されている特定の単語に、きつく接着されているようです。もし単語を変えてしまうと、「ルーティング」の仕組みは壊れてしまいます。ロボットには普遍的な「回答スイッチ」は存在しません。ただ、その瞬間に学習した特定の単語に対して、答えを読み出すための特定の方法を持っているだけなのです。これは、私たちがロボットの論理(「TEST」)を操るのは容易かもしれませんが、その具体的な選択(「ROUTE」)を操ろうとすることは、期待していたよりもずっと難しく、信頼性に欠ける可能性があるということを意味しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →