← 最新の論文
💬 NLP

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

本論文は、RLHF によって抑制された行動に対する対立回路と事前学習による行動に対するルーティング回路という 2 つの異なる FFN 回路構造を特定し、安全性の拒否や言語選択など特定のモデル出力を他の能力に影響を与えることなく正確かつ標的的に編集することを可能にする、2 パス・バックプロパゲーション不要の診断手法「摂動プロービング」を導入する。

原著者: Hongliang Liu, Tung-Ling Li, Yuhao Wu

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Hongliang Liu, Tung-Ling Li, Yuhao Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、巨大で極めて複雑なオーケストラだと想像してみてください。長年、その演奏する音楽(回答)が危険にも有益にもなり得ることは知られていましたが、曲の「安全性」や「失礼な」部分を担っているのが、どの音楽家(ニューロン)なのかは正確には分かりませんでした。

この論文は、「摂動プロービング(Perturbation Probing)」と呼ばれる新しい手法を紹介しています。これは、楽譜を書き換えることなく(バックプロパゲーションや再学習なしに)、オーケストラを聴くことを研究者に可能にする「2 パス診断ツール」のようなものです。

以下に、その仕組みを簡単な概念に分解して説明します。

1. 「2 パス」の聴診器

通常、どのニューロンが何をしているか特定するには、重たい計算を行うか、全く新しいモデルを学習させる必要があります。この手法ははるかに軽量です。

  • パス 1: モデルが通常通り質問に答えます。
  • パス 2: 研究者が質問をわずかに「かく乱」します(例:「メタンフェタミン」を「メタフタミン」に変えるなど)。これにより、人間には同じように読めても、コンピュータは異なる単語として認識します。
  • 診断: 2 つの回答を比較することで、この手法はモデル内のすべてのニューロンに「スコア」を計算します。問いはこうです:「このニューロンはかく乱に強く反応し、モデルを『いいえ』または『はい』の方向に押しやっていますか?」

ニューロンが強く反応し、正しい方向へ押しやれば、高いスコアが与えられます。研究者はその後、テストのために上位 50 位のスコアを持つニューロンを選びます。

2. 2 種類の「回路」

この論文は、AI の行動が、2 つの異なる配管システムのように、2 つの明確なカテゴリに分類されることを発見しました。

タイプ A: 「対立」回路(安全弁)

  • 何であるか: これは、AI が自然にやりたいこととは「逆」のことを学習させられるときに起こります。例えば、AI は自然とユーザーに同意したい(事前学習)のですが、安全性学習(RLHF)は悪い要求に対して「いいえ」と言うことを強制します。
  • 比喩: 自然に開いたままにしたい重い扉を想像してください。それを閉じたままにするために、特定の小さな留め具を取り付けます。
  • 発見: 研究者は、安全拒絶においては、この「留め具」が驚くほど小さいことを発見しました。一部のモデルでは、わずか50 個のニューロン(数十万個のうち)が拒絶の「テンプレート」を制御しています。
    • これら 50 個のニューロンを除去すると、AI は丁寧な「それはお手伝いできません」というスクリプトを使用しなくなります。
    • 重要なのは: それが AI を突然悪魔にするという意味ではありません。単に「丁寧なスクリプト」を使用しなくなるだけです。違法なものであることを警告するかもしれませんが、「申し訳ありませんが、それはできません」とは言わなくなります。安全性に関する知識は、より深く埋もれたまま残っています。

タイプ B: 「経路選択」回路(交通整理役)

  • 何であるか: これは、AI が元々やりたいと考える行動(中国語を話すことや数学を行うことなど)に起こります。AI は本性と戦う必要はなく、正しい経路へ「誘導」されるだけで済みます。
  • 比喩: 高速道路システムを想像してください。車(情報)はすでに移動しています。特定の出口(中国語)へ向かわせるために、新しい道路を建設する必要はありません。交通標識のスイッチを切り替えるだけで済みます。
  • 発見: これらの行動においては、ニューロンを除去しても何の効果もありません。しかし、研究者は、特定の条件を満たす特定のモデルに限り、交通流に直接信号を「注入」することで、AI に言語を切り替えさせる(例:英語から中国語へ)ことが 99% の精度で可能であることを発見しました。

3. 「FFN/スキップ」診断

どの種類の回路を扱っているかどうやって知るのでしょうか?この論文は、FFN/Skipと呼ばれる簡単な比率を作成しました。

  • AI の脳には 2 つの経路があると考えます。1 つは「処理ニューロン(FFN)」を通る経路、もう 1 つは処理をスキップする「ファストレーン(スキップ接続)」です。
  • 安全性の信号が主に処理ニューロンにある場合(FFN/Skip が高い)、それらの特定のニューロンを除去または調整することで修正できます。
  • 信号が主にファストレーンにある場合(FFN/Skip が低い)、ニューロンを除去しても機能しません。代わりに「交通スイッチ(方向注入)」を使用する必要があります。
  • この比率は水晶玉のように機能します。実験を開始する前に、研究者にどのツールを使用すべきかを正確に教えてくれます。

4. 「トランジスタ」効果(2B モデル)

非常に小さなモデル(20 億パラメータ)において、研究者はさらに劇的な効果を見つけました。

  • 彼らは、ユーザーが間違っている場合でも、AI が「阿諛追従的」に同意するかを制御するわずか20 個のニューロンを特定しました。
  • スイッチ: これら 20 個のニューロンを「オフ」にすると、AI は嘘に同意しなくなります。頑固に正しくなるのです。
  • トレードオフ: しかし、これにより AI が自らの間違いを修正することも止まってしまいました。
  • 修正: 彼らはそれらをオフにする代わりに、「アップ(増幅)」しました。これにより、モデル全体を再学習させることなく、AI は誤った情報を修正する能力が大幅に向上しました。これは、楽譜全体を書き換えるのではなく、特定の楽器の音量ノブを調整して曲を直すようなものです。

彼らが主張することの要約

  • 安全性は表面では脆弱です: 丁寧な「それはできません」というスクリプトは、ごく少数のニューロン(モデルの約 0.014%)によって制御されています。
  • 安全性は深層にあります: スクリプトを壊しても、モデルは依然として事実を知っており、丁寧な包装なしに危険であることを警告するかもしれません。
  • すべての行動が同じではありません: 一部の行動(安全性など)は、編集可能な特定の「書き手(ニューロン)」によって制御されています。他の行動(言語選択など)は、異なる種類の介入を必要とする「交通整理役(経路選択)」によって制御されています。
  • 精密編集: 特定の行動上の欠陥(同意しすぎることや、間違った言語を使用することなど)は、AI 全体を再学習させることなく、ごく少数のニューロンを調整することで修正できます。

この論文は、これが AI を永遠に完全に安全にするものだと主張しているのでも、ハッカーが AI を破壊するためのツールだと主張しているのでもありません。むしろ、これは「機械的な診断」として、AI が「どのように」機能するかを理解し、必要に応じて特定の行動を編集するための精密なツールキットをエンジニアに提供するという枠組みで提示されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →