← 最新の論文
🤖 AI

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

本論文は、大規模言語モデルにおける安全性に適合した拒否行動が、分散的な特性ではなく、主にネットワーク中層のMLP層に局在していることを実証しており、特定の重みのサブセットを移植することで拒否能力を効果的に転移できることを明らかにすると同時に、安全性適合の非加法性とベンチマーク依存性を浮き彫りにしている。

原著者: Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、物語を書き、数学の問題を解き、どんなことでもチャットできる超スマートなロボットを作ったと想像してみてください。しかし、一つだけ注意点があります。それは、誰かが爆弾を作る手助けをしたり、意地悪な手紙を書いたりするのを、うっかり助けてしまわないようにしなければならないということです。これが、私たちが今日使っている多くのチャットボットの背後にあるAIの脳、「大規模言語モデル(LLM)」の世界です。これらを安全に保つために、エンジニアは「アライメント(調整)」を行い、危険な要求に対して「ノー」と言うように教え込みます。長い間、科学者たちは、この「安全性」はロボットの脳全体に均一に広がった、柔らかく目に見えない霧のようなものだと考えてきました。脳のどの部分を微調整しても、安全性が少し揺らぐことはあっても、基本的には同じままであると考えていたのです。しかし、現実の世界では、これらの安全シールドは驚くほど脆弱です。巧妙なトリックや小さな変化によって、ロボットがルールを完全に忘れてしまうことがあります。ここで、大きな、非常に興味深い謎が生じます。ロボットの脳のどこに「ノー」ボタンが隠されているのでしょうか? それは脳のいたるところに散らばっているのでしょうか、それとも特定の小さな隅っこに格納されているのでしょうか?

ある研究チームが、この謎を解くために探偵役を務めることにしました。ただ推測するのではなく、彼らは**重みの移植(weight transplantation)**という大胆な実験を行いました。想像してみてください、あなたには二体の同一のロボットがあります。一方は「善玉ロボット(安全性に調整済み)」、もう一方は「未調整ロボット(元の、調整されていないバージョン)」です。研究者たちは、善玉ロボットの脳のパーツを、未調整ロボットへと一つずつ入れ替えていき、どのパーツが実際に「拒絶」する力を持っているのかを調べました。彼らは脳全体を丸ごと入れ替えたのではありません。言葉に注目する部分(アテンション)と、情報を処理して思考する部分(MLPレイヤー)といった、特定の種類の接続を入れ替えたのです。

彼らが発見した内容は、ロボットの「ノー」は決してガードマンのチーム全体ではなく、非常に特定の、小さな専門家部隊であるという発見に近いものでした。

1. 「思考」する部分が主導権を握る
研究者たちは、文脈に注目する部分(アテンション・ウェイト)が主要な安全ガードであると予想していました。しかし、彼らは間違っていました!「思考」する部分(MLPウェイト)だけを善玉ロボットから未調整ロボットへと入れ替えたところ、未調整ロボットは「集中」するパーツを入れ替えた時よりも、少なくとも2.7倍高い頻度で不適切な要求を拒絶するようになりました。結局のところ、安全性の「ノー」は、ネットワークが実際に情報を処理し変換する部分であるMLPレイヤーに主にエンコードされていることが分かりました。

2. 「中間」こそが魔法のゾーン
しかし、それは単なる思考パーツではありません。研究者たちは、安全性の信号が脳の非常に特定の真ん中のセクションに集中していることを発見しました。彼らがテストしたモデルでは、最も強力な「拒絶」の力はブロック3、つまりレイヤー8から11に対応する部分で見つかりました。ロボットの脳を28階建てのビルとして捉えるなら、安全ガードは主に8階から11階に住んでいるのです。これらの特定のフロアだけを入れ替えると、ロボットは「ノー」と言うのが非常に上手くなりました。

3. 多ければ良いというわけではない(「ゴールドリックス」効果)
ここで、物語をより面白くするひねりがあります。研究者たちは、もし一つのブロックが安全であれば、すべての安全ブロックを入れ替えれば完璧になるだろうと考えていました。しかし、そうではありませんでした!多くの場合、調整済みのブロックを「追加」することは、むしろロボットの拒絶能力を悪化させました。これはセキュリティガードのチームのようなものです。もしあまりに多くの人員を投入しすぎると、彼らは互いに足を引っ張り合ったり、言い争ったりして、結果としてセキュリティが低下してしまうのです。研究者たちは、わずか6つのブロックによる選択的な混合の方が、安全システム全体を入れ替えるよりも効果的であることが多いと発見しました。時には、7番目のブロックを追加することが、ロボットの「ノー」と言う能力を減少させてしまうこともありました。

4. 「過剰拒絶」の罠
もう一つの落とし穴があります。ロボットが悪質な要求に対して「ノー」と言う仕組みは、無害な要求に対しても「ノー」と言ってしまう仕組みでもあります。これは**過剰拒否(over-refusal)**と呼ばれます。研究者がMLPウェイトを入れ替えた際、ロボットは悪い奴らを止めることには長けていましたが、「今日の天気は?」や「ジョークを言って」といった無実の質問に対しても「ノー」と言い始めました。これは、安全メカニズムが少し鈍器のようなものであることを示唆しています。「悪いことを止める」信号と「すべてを止める」信号を、パーツの入れ替えだけで切り離すことは難しいのです。

なぜこれが重要なのか?
この発見は、AIの安全性とは、ネットワーク全体に広がった巨大で壊れない盾ではないことを示唆しています。むしろ、それはいくつかの特定のレイヤーに集中した、局所的で脆弱な特徴なのです。これが、AIの安全性がこれほどまでに脆い理由を説明しています。もしあなたが誤ってそれらの特定のレイヤー(レイヤー8〜11)を調整したり取り除いたりすると、安全システム全体が崩壊してしまうのです。また、これは将来AIの安全性を改善したい場合、ロボット全体を再学習させる必要はないということも意味しています。私たちは、単にそれらの特定の「中間」レイヤーを注意深く調整したり保護したりすればよいのかもしれません。

研究者たちは、すべての安全問題を解決する魔法の弾丸を見つけたわけではありません。彼らは、安全性が**相互作用に敏感(interaction-sensitive)**であること、つまり、脳の各パーツは複雑な方法で共に機能しており、単に安全なパーツを大量に投入すれば結果が良くなるわけではないということを発見しました。しかし、どこに「ノー」が住んでいるのかを正確に特定したことで、彼らはAIがなぜ失敗するのかを理解するための地図、そして将来どのようにしてより強固な安全システムを構築できるかを知るための手がかりを与えてくれました。これは、広大で複雑なAIの世界においても、最も重要なことはしばンド中間に起こるということを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →