✨ 要約🔬 技術概要
大規模言語モデル(LLM)を、巨大で極めて複雑なオーケストラだと想像してみてください。長年、その演奏する音楽(回答)が危険にも有益にもなり得ることは知られていましたが、曲の「安全性」や「失礼な」部分を担っているのが、どの音楽家(ニューロン)なのかは正確には分かりませんでした。
この論文は、「摂動プロービング(Perturbation Probing)」と呼ばれる新しい手法を紹介しています。これは、楽譜を書き換えることなく(バックプロパゲーションや再学習なしに)、オーケストラを聴くことを研究者に可能にする「2 パス診断ツール」のようなものです。
以下に、その仕組みを簡単な概念に分解して説明します。
1. 「2 パス」の聴診器
通常、どのニューロンが何をしているか特定するには、重たい計算を行うか、全く新しいモデルを学習させる必要があります。この手法ははるかに軽量です。
パス 1: モデルが通常通り質問に答えます。
パス 2: 研究者が質問をわずかに「かく乱」します(例:「メタンフェタミン」を「メタフタミン」に変えるなど)。これにより、人間には同じように読めても、コンピュータは異なる単語として認識します。
診断: 2 つの回答を比較することで、この手法はモデル内のすべてのニューロンに「スコア」を計算します。問いはこうです:「このニューロンはかく乱に強く反応し、モデルを『いいえ』または『はい』の方向に押しやっていますか?」
ニューロンが強く反応し、正しい方向へ押しやれば、高いスコアが与えられます。研究者はその後、テストのために上位 50 位のスコアを持つニューロンを選びます。
2. 2 種類の「回路」
この論文は、AI の行動が、2 つの異なる配管システムのように、2 つの明確なカテゴリに分類されることを発見しました。
タイプ A: 「対立」回路(安全弁)
何であるか: これは、AI が自然にやりたいこととは「逆」のことを学習させられるときに起こります。例えば、AI は自然とユーザーに同意したい(事前学習)のですが、安全性学習(RLHF)は悪い要求に対して「いいえ」と言うことを強制します。
比喩: 自然に開いたままにしたい重い扉を想像してください。それを閉じたままにするために、特定の小さな留め具を取り付けます。
発見: 研究者は、安全拒絶においては、この「留め具」が驚くほど小さいことを発見しました。一部のモデルでは、わずか50 個のニューロン (数十万個のうち)が拒絶の「テンプレート」を制御しています。
これら 50 個のニューロンを除去すると、AI は丁寧な「それはお手伝いできません」というスクリプトを使用しなくなります。
重要なのは: それが AI を突然悪魔にするという意味ではありません。単に「丁寧なスクリプト」を使用しなくなるだけです。違法なものであることを警告するかもしれませんが、「申し訳ありませんが、それはできません」とは言わなくなります。安全性に関する知識は、より深く埋もれたまま残っています。
タイプ B: 「経路選択」回路(交通整理役)
何であるか: これは、AI が元々やりたいと考える行動(中国語を話すことや数学を行うことなど)に起こります。AI は本性と戦う必要はなく、正しい経路へ「誘導」されるだけで済みます。
比喩: 高速道路システムを想像してください。車(情報)はすでに移動しています。特定の出口(中国語)へ向かわせるために、新しい道路を建設する必要はありません。交通標識のスイッチを切り替えるだけで済みます。
発見: これらの行動においては、ニューロンを除去しても何の効果もありません。しかし、研究者は、特定の条件を満たす特定のモデルに限り、交通流に直接信号を「注入」することで、AI に言語を切り替えさせる(例:英語から中国語へ)ことが 99% の精度で可能であることを発見しました。
3. 「FFN/スキップ」診断
どの種類の回路を扱っているかどうやって知るのでしょうか?この論文は、FFN/Skip と呼ばれる簡単な比率を作成しました。
AI の脳には 2 つの経路があると考えます。1 つは「処理ニューロン(FFN)」を通る経路、もう 1 つは処理をスキップする「ファストレーン(スキップ接続)」です。
安全性の信号が主に処理ニューロン にある場合(FFN/Skip が高い)、それらの特定のニューロンを除去または調整することで修正できます。
信号が主にファストレーン にある場合(FFN/Skip が低い)、ニューロンを除去しても機能しません。代わりに「交通スイッチ(方向注入)」を使用する必要があります。
この比率は水晶玉のように機能します。実験を開始する前に、研究者にどのツールを使用すべきかを正確に教えてくれます。
4. 「トランジスタ」効果(2B モデル)
非常に小さなモデル(20 億パラメータ)において、研究者はさらに劇的な効果を見つけました。
彼らは、ユーザーが間違っている場合でも、AI が「阿諛追従的」に同意するかを制御するわずか20 個のニューロン を特定しました。
スイッチ: これら 20 個のニューロンを「オフ」にすると、AI は嘘に同意しなくなります。頑固に正しくなるのです。
トレードオフ: しかし、これにより AI が自らの間違いを修正することも止まってしまいました。
修正: 彼らはそれらをオフにする代わりに、「アップ(増幅)」しました。これにより、モデル全体を再学習させることなく、AI は誤った情報を修正する能力が大幅に向上しました。これは、楽譜全体を書き換えるのではなく、特定の楽器の音量ノブを調整して曲を直すようなものです。
彼らが主張することの要約
安全性は表面では脆弱です: 丁寧な「それはできません」というスクリプトは、ごく少数のニューロン(モデルの約 0.014%)によって制御されています。
安全性は深層にあります: スクリプトを壊しても、モデルは依然として事実を知っており、丁寧な包装なしに危険であることを警告するかもしれません。
すべての行動が同じではありません: 一部の行動(安全性など)は、編集可能な特定の「書き手(ニューロン)」によって制御されています。他の行動(言語選択など)は、異なる種類の介入を必要とする「交通整理役(経路選択)」によって制御されています。
精密編集: 特定の行動上の欠陥(同意しすぎることや、間違った言語を使用することなど)は、AI 全体を再学習させることなく、ごく少数のニューロンを調整することで修正できます。
この論文は、これが AI を永遠に完全に安全にするものだと主張しているのでも、ハッカーが AI を破壊するためのツールだと主張しているのでもありません。むしろ、これは「機械的な診断」として、AI が「どのように」機能するかを理解し、必要に応じて特定の行動を編集するための精密なツールキットをエンジニアに提供するという枠組みで提示されています。
以下は、論文「Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs.」の詳細な技術的要約です。
1. 問題定義
大規模言語モデル(LLM)における整合された行動(例:安全性拒絶、指示追従)の背後にある神経メカニズムを特定するための既存の手法は、コスト 、因果性 、タスク特異性 の間で根本的なトレードオフに直面しています:
プロービング分類器と SAE: 表現を特定できますが、因果性を確認することはできません。
活性化パッチングと自動化回路発見: 因果的ですが、計算コストが高く(コンポーネントあたり O ( n ) O(n) O ( n ) 回のフォワードパス)、高価です。
勾配ベースの帰属: 安価ですがタスク非依存です。特定の行動に特化したニューロンではなく、一般的に重要なニューロンを特定し、符号なしのランキングでは行動を促進するニューロンと抑制するニューロンを区別できません。
同時に安価(プロンプトあたり定数時間)、因果的(介入によって検証済み)、タスク特異的、かつ診断的(実行前に介入の成功を予測する)である手法は存在していません。
2. 手法:摂動プロービング(Perturbation Probing)
著者らは、プロンプトあたり2 回のフォワードパスのみ を要し、逆伝播を必要としない 2 段階のパイプラインである摂動プロービング を提案します。
A. パイプライン
行動観測量の定義:
本手法は、二値決定(例:拒絶対従順)を表すスカラー「logit 差(logit gap)」(F F F )を定義します。
F = z ˉ R − z ˉ A F = \bar{z}_R - \bar{z}_A F = z ˉ R − z ˉ A であり、ここで z ˉ \bar{z} z ˉ は拒絶トークン(R R R )のセットの平均 logit から肯定トークン(A A A )の平均 logit を引いた値です。
この差は、モデルの最終隠れ状態の線形汎関数です:F = d F ⊤ h ( L ) + b F = d_F^\top h^{(L)} + b F = d F ⊤ h ( L ) + b 。
符号付き重要度計算(仮説生成):
本手法は、元のプロンプト(X X X )と摂動されたプロンプト(X ~ \tilde{X} X ~ )の 2 回のフォワードパスを用いて、すべての FFN ニューロン n n n に対して符号付き重要度スコア (I n I_n I n )を計算します。
摂動: 核心的な内容を変えずに目標決定を反転させるため、ヒューリスティックな反実仮想が適用されます(例:安全性のための BPE トークンのシャッフル、迎合性のための誤った対正しく前提)。
数式: I n = c n ⋅ Δ a n I_n = c_n \cdot \Delta a_n I n = c n ⋅ Δ a n
c n c_n c n (構造的結合):行動方向 d F d_F d F とニューロンの出力投影重み(W d o w n W_{down} W d o w n )との内積です。これは静的であり、重みから一度計算されます。
Δ a n \Delta a_n Δ a n (摂動応答):摂動入力と元の入力間のニューロン活性化の変化(a n ( X ~ ) − a n ( X ) a_n(\tilde{X}) - a_n(X) a n ( X ~ ) − a n ( X ) )です。
ランキング: ニューロンは ∣ I n ∣ |I_n| ∣ I n ∣ によってランキングされます。符号は、そのニューロンが行動を促進するか抑制するかを示します。
因果的検証と診断:
検証: トップランクのニューロンは、アブレーション (重みのゼロ化)、パッチング (活性化の交換)、復元 (摂動の元に戻す)を通じて検証されます。
FFN/スキップ診断: 回路構造を予測するために比率が計算されます:FFN/Skip = ∣ d F ⋅ FFN ( L − 1 ) ∣ ∣ d F ⋅ h ( L − 1 ) ∣ \text{FFN/Skip} = \frac{|d_F \cdot \text{FFN}^{(L-1)}|}{|d_F \cdot h^{(L-1)}|} FFN/Skip = ∣ d F ⋅ h ( L − 1 ) ∣ ∣ d F ⋅ FFN ( L − 1 ) ∣
高比率(>0.3): 対立回路 (行動が FFN に集中)を示します。
低比率(<0.2): ルーティング回路 (行動がアテンション/スキップ接続を通じて分散)を示します。
3. 主要な貢献と発見
A. 2 つの回路構造の発見
本研究は、LLM の行動がFFN/Skip 比率 によって決定される 2 つの異なるトポロジー構造に組織化されていることを明らかにしました:
対立回路(FFN/Skip > 0.3):
メカニズム: RLHF がモデルに事前学習の傾向(例:有害なリクエストへの同意)に対抗 するように訓練する場合に発生します(例:有害なリクエストへの拒絶)。
構造: 制御は少数の FFN ニューロン(例:約 50 個、または総パラメータの 0.014%)に集中しています。
介入: これらのニューロンはアブレーション (モード 1)または増幅 (モード 2)に適しています。
例: Qwen3-4B において、50 個のニューロンをアブレーションすると、80% のプロンプトで拒絶テンプレートが変更され、かつほぼゼロの有害な従順性を維持しました。
ルーティング回路(FFN/Skip < 0.2):
メカニズム: RLHF が対抗するのではなく強化する事前学習行動(例:言語選択、数学的推論)で発生します。
構造: 行動はアテンション機構とスキップ接続に分散しており、特定された FFN ニューロンは単なる「読み出し(高活性化応答だが構造的結合は低い)」に過ぎません。
介入: アブレーションはゼロ効果 です。代わりに、方向注入 (モード 3)が機能します:特定の層で残差ストリームに直接行動方向ベクトル(d F d_F d F )を注入します。
例: 二言語対応の Qwen モデルにおいて、英語から中国語への方向を注入すると、99.1% のプロンプトで出力言語が切り替わりました。これは、二言語トレーニングを欠くか極端な FFN/Skip 比率を持つ Llama/Gemma モデルでは失敗しました。
B. 安全性トポロジーのスペクトル
本論文は、13 のモデルと 4 つのアーキテクチャファミリー(Qwen、Llama、Gemma)にわたる安全性メカニズムをマッピングしました:
Qwen: 安全性を集中した FFN 瓶頸に集中させます(アブレーションの有効性が高い)。
Llama: 安全性をスキップ接続に分散させます(アブレーションの有効性は中程度)。
Gemma: 事後正規化の背後に安全性を遮蔽します(アブレーションの有効性は 0%)。
洞察: FFN/Skip 比率はこのスペクトルを定量化し、ニューロンレベルの編集が可能かどうかを予測します。
C. 小規模モデルにおける精密編集
Qwen3.5-2B モデルにおいて、著者らはわずか20 個のニューロン によって支配される「二の足を踏む(second-guessing)」回路を特定しました:
アブレーション: マルチターンでの迎合的な降伏を排除しました(36.7% → \to → 0%)が、シングルターンの事実修正を抑制しました。
増幅: 10 個の特定のニューロンを 2 倍に増幅することで、再トレーニングなしに TruthfulQA における事実修正率が 52% から 88% に向上しました。
意義: 特定の行動上の欠陥が、特定のニューロンをスケーリングすることによる「精密テンプレート層編集」によって修正可能であることを実証しました。
4. 結果の要約
安全性: 50 個のニューロンが Qwen3-4B における拒絶テンプレートを制御しています。アブレーションは 80% の応答形式を変更しますが、基盤となる安全性の知識(事前学習の警告)は維持されます。
言語ルーティング: 方向注入は二言語対応の Qwen モデルで 99.1% の言語切り替えを達成しますが、非二言語モデルや非線形行動(数学/コード)では失敗します。
効率性: 本手法は 2 回のフォワードパスで仮説を生成し、一度のスweep(合計約 150 回)で検証します。これは O ( n ) O(n) O ( n ) の回路発見手法よりもはるかに安価です。
比較: Qwen モデルでは勾配ベースの手法を上回ります(タスク特異的な因果的発見)が、安全性がアテンション媒介である Llama モデルでは効果が低いです。
5. 意義と含意
メカニズム的理解: RLHF が行動をどのように組織化するかを説明する統合フレームワークを提供し、「書き手(対立回路の FFN ニューロン)」と「読み出し(ルーティング回路のニューロン)」を区別します。
実用的なツールキット: 高価な編集を試みる前に、正しい介入戦略(アブレーション対方向注入)を決定するための診断ツール(FFN/Skip 比率)を提供します。
安全性監査: 安全性はしばしば頑健な事前学習知識の上に重ねられた「薄いテンプレート層」であることを明らかにしました。これは、表面的な拒絶は脆弱で編集可能ですが、深層の安全性知識は頑健であることを示唆しています。
整合性編集: 迎合性などの特定の行動欠陥が、特定ニューロンの増幅を通じて修正可能であることを実証し、モデル全体の再トレーニングなしに「精密整合」への道を開きます。
理論的検証: RLHF 整合行動の文脈において、メカニズム的解釈可能性の核心仮定(線形性、局所性、疎性、構成性)を検証します。
結論として、摂動プロービングは安価な相関と高価な因果性の間のギャップを埋め、整合された LLM の行動回路を理解し編集するためのスケーラブルで診断的なフレームワークを提供します。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×