急速に進化する人工知能の世界において、大規模言語モデルは複雑なパズルを解いたり、膨大な量の情報を想起したりすることが可能になっています。科学者たちは、こうしたデジタル脳が実際にどのように機能しているのかを長らく疑問に思ってきました。有力な説の一つは、論理的推論や単純な事実の想起といった特定の振る舞いは、モデルの内部メモリ内にある明確で固定された経路に結びついているというものです。モデルの精神を、あらゆる思考が痕跡を残す広大で多次元的な空間だと想像してみてください。もしこの考えが真実であれば、数学の問題を考え抜いているモデルと、単に事実を思い出しているモデルの違いは、特定の方向を指す一本の直線として可視化できるはずです。この概念は非常に魅力的であるため、一部の研究者は、見つけた経路が安定して信頼できるものになると想定し、それらの固定された線をガイドとしてモデルの思考能力を高めようと試みてきました。
しかし、新しい研究は、これらの経路が留まり続けるという仮定に異を唱えています。研究者たちは、Qwen3-0.6Bとして知られる小型の言語モデルを詳しく調査し、厳格なトレーニングが行われた際に、この「固定された方向」という考えが成立するかどうかを確認しました。彼らは、半分が論理的推論を必要とし、残りの半分が事実の想起を必要とする、慎重にバランスの取れた400個の例を集めました。文の長さや特定の語彙といったノイズを取り除くことで、発見された差異が、まさに思考のタイプそのものに起因することを保証しました。彼らの最初の発見は心強いものでした。それは、ある特定の時点においては、推論と記憶の差は実に明白であり、一本の線によってこれら二つのグループを完璧に分離できることを確認したという点です。実際、この単純な線は、あらゆる角度からデータを分析する複雑な高次元解析と同等の精度を発揮しました。
物語は、研究者たちが推論スキルを向上させるために設計された「グループ相対方策最適化(group-relative policy optimization)」と呼ばれる強力な手法を用いてモデルを訓練したところで、転換を迎えます。もし固定方向の仮説が正しいならば、推論と記憶を分ける線は、モデルが学習を進めても同じ場所に留まるはずだと彼らは予想していました。ところが、モデルは依然として二つのタスクの違いを完璧に理解していたものの、その知識の「実際の方向」は劇的に変化していたことが判明したのです。訓練後、かつて明確に「推論」を指していた線は、元の位置とは一致しないほど大きく回転していました。平均して、新しい方向は以前の方向と約45パーセントしか似ておらず、モデルの最も深い層では、内部表現のドリフト(漂流)はさらに顕著になり、半分以上に達していました。
この発見は、モデルが「何を知っているか」と「その知識をどのように保存しているか」との間の決定的な違いを明らかにしています。情報自体は消失していませんでした。モデルは訓練後も、数学の問題とトリビアの質問を完璧な精度で区別することができました。しかし、その区別を表現するために使用していた幾何学的な座標は、完全に再編成されていたのです。それはまるで、都市の地図が図書館の場所を教える上では依然として完璧に正確であるものの、地図上のコンパスの方向が回転してしまい、「北」がかつての「東」を指すようになったような状態です。研究者たちは、訓練前と訓練後のモデルの内部状態を比較することでこの変化を測定し、その変化が単なる微調整ではなく、モデルの内部景観の实质的な再編であったことを突き止めました。
本研究は、推論と記憶を分離する能力は強固である一方で、この能力が単一の不変の方向に依存しているという考えは誤りであると結論付けています。情報は存続しますが、それがモデルの精神の中を通る具体的な経路は流動的であり、学習とともに変化します。このことは、これらの内部方向を用いて人工知能を導こうとする将来の取り組みにおいて、科学者たちは一度経路を見つけたらそれが有効であり続けると仮定することはできないことを示唆しています。代わりに、ランドマーク(目印)はそのまま残っていたとしても、地図自体は常に描き直されているのだという事実を受け入れなければならないのです。知識の安定性は、それにアクセスするために用いられる経路の安定性を保証するものではありません。
技術要約:固定された方向を超えて
問題提起
メカニスティック・インタープリタビリティ(機械論的解釈可能性)および強化学習(RL)における近年の研究では、大規模言語モデル(LLM)における高レベルな行動上の区別(例えば、推論指向のタスクと事実想起タスクの違い)は、活性化空間における単一の固定された方向によって特徴付けられるという提案がなされている。DiRLのような手法は、探索をバイアスさせるために、このような方向をグループ相対方策最適化(GRPO)における固定された幾何学的アンカーとして利用する。
本論文は、「固定方向」仮説の根底にある2つの仮定の妥当性を調査するものである:
- 分離可能性(Separability): 推論指向のタスクグループと事実想起のタスクグループの区別は、トランスフォーマーの各層において単一の線形方向によって捉えることができるか?
- 安定性(Stability): RL(GRPO)による学習が行われた後、特定された特定の方向は幾何学的に整合性を保っているか?
著者は、デコーダブル(復号可能)であること(情報が表現の中に存在するかどうか)と、方向の安定性(Directional Stability)(その情報を符号化している特定のベクトルが不変であるかどうか)を区別して論じている。
手法
モデルおよびデータ
- モデル: 本研究では Qwen3-0.6B を使用する。安定性分析(RQ2)においては、ベースモデルを公開されているGRPO学習済みチェックポイント(
x32/Qwen3-0.6B-GRPO-GSM8K-Think)と比較する。
- データセット: 制御された400個の例(推論指向200、事実想起200)からなるデータセットを構築した。
- 推論: MATH-500およびGSM8Kから抽出。
- 事実想起: PopQAおよびTriviaQAから抽出。
- コントロール: トークン長による交絡変数(これにより、制御されていない設定では約0.965の精度が得られていた)を排除するため、著者は幅10のトークン長ビンを用いた**長さ一致手順(length-matching procedure)**を採用した。これにより、表面的な語彙や長さは制御されているものの、語彙的・ドメイン的な相関は残るバランスの取れたセットとなった。
実験設計
本研究は2つのリサーチクエスチョン(RQ)に取り組む:
RQ1: 単一方向による分離可能性
- 方向の構築: 各28層のトランスフォーマー層において、分離方向を定義するために2つの手法を用いた:
- 平均差方向(Mean-Difference Direction): クラス平均の隠れ状態の差分ベクトル。
- プローブ重み方向(Probe-Weight Direction): タスクグループを分類するために学習されたロジスティック回帰プローブの重みベクトル。
- 評価: これらの一次元投影の性能を、ホールドアウト層化交差検証を用いて、フル次元(1024次元)の線形プローブ(ロジスティック回帰)と比較した。
- コントロール: パイプラインのアーティファクトではないことを確認するため、長さのみの分類器、TF-IDF語彙分類器、およびランダムラベル・プローブを含む実験を行った。
RQ2: GRPO後の方向の安定性
- 安定性指標: ベースモデルとRL学習済みモデルから抽出された方向間のコサイン類似度を算出した:
- 平均差方向間の比較 (cos(d^B,d^RL))。
- プローブ重み方向間の比較 (cos(w^B,w^RL))。
- 表現ドリフト(Representation Drift): タスクラベルに依存しない広範な幾何学的変化を測定するため、2つのチェックポイント間における、同一入力例の対応する隠れ状態間の平均コサイン距離を計算した。
- デコーダビリティ・チェック: RLモデルにおいてもタスクグループがデコーダブルであるかを、RLの表現に対して特別に学習されたプローブを用いて検証した。
主な結果
RQ1: 単一方向によるデコーダブル性
- 完全な分離可能性: 制御された400例のデータセットにおいて、単一の一次元投影(平均差方向またはプローブ重み方向のいずれか)は、フル次元(1024次元)のプローブの性能と一致する AUROC = 1.00 を達成した。
- 層ごとの性能: 最良の平均差方向は第18層で発生し、最良のプローブ重み方向は第12層で発生した。両者とも、ほぼ完全な精度(0.9975)およびAUROC(1.0000)に達した。
- コントロールの検証: 長さ一致処理後、長さのみの分類器は精度が約0.65まで低下したが、TF-IDFベースラインは依然として強力(約0.96)であり、語彙的およびドメイン的な構造が依然としてタスクラベルと相関していることを示した。しかし、隠れ状態の分類器はTF-IDFを上回っており、分離が単なる表面的な語彙によるものではないことを裏付けている。
- 結論: このモデルの状態において、推論と事実想起の区別は、近似的に単一方向で分離可能である。
RQ2: 幾何学的不安定性
- 方向の回転: RLモデルにおいても完全なデコーダブル性が維持されているにもかかわらず、その区別を担う特定の方向は安定していなかった。
- ベースモデルとRLモデル間の平均方向コサイン類似度は平均 0.453(中央値 0.492)であった。
- プローブ方向のコサイン類似度は平均 0.445(中央値 0.439)であった。
- 最小の類似度は約0.17まで低下しており、一部の層ではほぼ直交していることを示している。
- 表現ドリフト: 広範な表現も大幅にシフトした。表現ドリフト(隠れ状態のコサイン類似度の1 - 類似度)は深さとともに増加し、最終層(第28層)で 0.511 に達した。
- デコーダブル性の保持: 決定的なことに、RLの表現に対して学習されたプローブは、依然として AUROC = 1.00 を達成した。
- 結論: タスクグループを区別する情報はRL後に保持されているが、その情報を符号化するために使用される幾何学的座標(特定の方向ベクトル)は大幅に再構成されている。
主な貢献
- 制御されたプロトコル: 著者は、制御されていないデータセットの比較(トークン長によって交絡していたもの)から、表面的な特徴を分離するために、厳格な長さ一致を用いたマルチデータセット評価(400例)へと移行した。
- 推定器の直接比較: 平均差方向(閉形式の統計量)と学習されたプローブ方向(識別的最適化)を全28層にわたって直接比較し、それらが高度に整列している(約0.85のコサイン類似度)一方で、明確に異なることを明らかにした。
- 情報と幾何学の分離: 本論文は、情報の保持は幾何学的な保持を意味しないという事実を実証的に示した。ある方向は、あるモデルの状態においては有効な分離器となり得るが、ポストRLの状態においては、情報が完全にデコーダブルである場合でも、幾何学的に異なる(回転した)方向となり得る。
意義と主張
本論文は、DiRLのような手法で使用される「固定方向」の仮定に関して、控えめながら具体的な主張を行っている:
- 不変性の拒絶: 本研究は、抽出された方向がRLにおけるメカニスティックな不変量であるという仮定に異議を唱えている。ベースモデルにおいて「推論の方向」として特定された特定のベクトルは、GRPO学習後のモデルにおけるベクトルとは同一ではない。
- デコーダブル性の検証: 学習後も、推論と事実想起の区別に関する情報は、隠れ状態の中でアクセス可能であり続けることを確認した。
- RL手法への示唆: 著者は、RL前の方向を固定された幾何学的アンカーとして解釈することは、DiRLが提案するように探索をバイアスさせるために操作的に有用である可能性はあるものの、それは測定されるべき仮定であって、前提とされるべきではないと主張している。
結果は、推論が単一のモデル状態において一つの方向として表現され得るという仮説を支持する一方で、この方向が学習の介入を通じて固定されたままであるという仮説を否定している。
著者は、自身が因果的な「推論ニューロン」を発見したとか、基礎となる計算が変わったことを証明したと主張しているのではない。むしろ、区別のデコーダブル性が持続する一方で、その表現の幾何学的実現が変化することを実証したのである。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録