← 最新の論文
💻 computer science

Detecting Safety Training Modification in Language Models via Activation Analysis

本論文は、活性化空間における安全性概念の幾何学的構造を分析することで言語モデルの安全性学習への改変を検知する、活性化ベースのツールであるAMSを紹介するものであり、多様なアーキテクチャにわたる4つの異なる改変タイプを正常に分類すると同時に、活性化のシグネチャーと行動の遵守性の間の相関関係を明らかにしている。

原著者: Glen Messenger

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Glen Messenger

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、誰もが本を借りることができる巨大な図書館だと想像してみてください。しかし、その中には爆弾の作り方や人を騙す方法といった、危険なマニュアルが書かれた本も紛れ込んでいます。人工知能の世界では、これらの「本」は言語モデルと呼ばれます。最近、一部の人々が、これら有益なAIという「本」を密かに書き換え、安全規則を取り除いて、どんな有害な質問にも答えてしまう「アンセンサード(検閲なし)」版へと変貌させています。これは、標準的な百科事典から「盗みをしてはいけない」というページがすべて破り取られたものに、司書がこっそり差し替えてしまうようなものです。

どのようにしてこれらの破壊工作を見つけ出すことができるかを理解するために、まずはAIがどのように「思考」するかを知る必要があります。AIは文章を読むとき、単に言葉を保存するのではなく、それらを「アクティベーション(活性化)」と呼ばれる複雑な数値のマップへと変換します。このマップは、高次元の巨大な遊び場のようなものです。行儀が良く、安全なAIには、「良いアイデア」と「悪いアイデア」を分ける明確で広い道が存在します。それは、サッカーを楽しんでいる子供たちと、火遊びをしている子供たちを遠ざけておくための、頑丈なフェンスがある遊び場のようなものです。誰かがAIを「アンセンド(検閲解除)」しようとするとき、彼らはこのフェンスを倒したり、子供たちを移動させたりして、火とサッカーボールが混ざり合うように仕向けます。大きな疑問は、「AIに実際に火遊びをさせてみる」ことなく、遊び場のレイアウトを見るだけで、フェンスが改ざんされたかどうかを判断できるのか?ということです。

これこそが、グレン・メッセンジャーによる論文「Activation-based Model Scanner (AMS): Activation Analysis による言語モデルの安全性訓練の改変検出」が解明しようとしていることです。著者は、AMS(Activation-based Model Scanner)という新しいツールを紹介しています。AMSは、「質問して答えてもらう」というゲーム(これは時間がかかり、騙される可能性もあります)を行う代わりに、構造エンジニアのように振る舞います。AMSはAIの遊び場に足を踏み入れ、その空間の幾何学的な形状を測定します。そして、「良いゾーン」と「悪いゾーン」の間の距離が、依然として広く、かつ強固であるかどうかを確認するのです。

この研究では、このツールを小規模から大規模まで14種類の異なるAIモデルに対してテストしました。その結果、AMSは、もし安全性のフェンスが完全に取り壊されていた場合、それを察知するのに非常に優れていることが分かりました。研究者が、安全性訓練が完全に除去されたモデル(ベースモデルや「Dolphin」バリアントなど)を調査したところ、その「フェンス」は崩壊しており、良いアイデアと悪いアイデアの間の距離はほぼゼロにまで縮まっていました。AMSは、これらを高い精度で「CRITICAL(重大)」とフラグ立てしました。

しかし、この論文は、物語が単なる「フェンドがあるかないか」という単純な話ではないことも明らかにしています。研究者たちは、安全性が修正される4つの異なるパターンを発見しました。AMSはこれらにそれぞれ異なる形で対処します。

  1. 完全な崩壊(The Total Collapse): 一部のモデルでは、安全性訓練が完全に剥ぎ取られています。遊び場のフェンスは消え去っています。AMSはこれを容易に見つけ出します。
  2. 壊れたフェンス(The Broken Fence): 一部のモデルでは、安全規則が「直交化(orthogonalized)」されています。これは、フェンスが回転したり歪んだりしたことで、たとえ線自体は残っていても、悪いものを阻止できなくなっている状態を指します。AMSは、フェンドが正しい方向を向いているかを確認する二次チェックを用いることで、これも捉えることができます。
  3. 回転したフェンス(The Rotated Fence): これは非常にトリッキーです。一部のモデル(特定のGemmaのバージョンなど)では、安全性のフェンスが、悪いものが通り抜けてしまう程度にちょうど回転しています。フェンス自体は依然として高く、頑丈に立っています。AMSの一次チェックは、「おや、フェンスはまだあるぞ!安全だ!」と判定します。しかし、フェンスの「向き」を見る二次チェックが、フェンスが間違った方向を向いていることに気づき、警告を発します。
  4. 見えないトリック(The Invisible Trick): 論文では、AMSでは捉えることのできない4つ目の修正タイプを特定しています。この場合、遊び場のフェンスは依然として立っており、正しい方向を向いています。しかし、AIは実際に発言する際に、そのフェンスを無視するように密かに訓練されています。それは、門の前に立っている衛兵が、完璧に静止しているものの、実際には全員を通してしまうようなものです。論文ではこれを「行動的ファインチューニング(behavioral fine-tuning)」と呼び、遊び場の「幾何学的な形状」は完璧に見えるため、AMSでは検出できないことを認めています。

研究者たちは、結果を過大評価しないよう注意を払いました。彼らは、「フェンスの強さ」とAIの実際の危険な振る舞いとの関係は実在するものの、ノイズが多いことを発見しました。それは風見鶏のようなものです。風見鶏が壊れていれば嵐が来ることは分かりますが、風見鶏が回っているからといって、外を見る必要がないわけではありません。テストにおいて、このツールは新しいモデルに対して約71%の確率で安全性を正しく識別しました。

論文は、AMSは最初のチェックとして迅速かつ強力なツール(わずか10〜40秒でモデルをスキャン可能)ではあるものの、それだけを唯一の門番にすべきではないと結論付けています。「見えないトリック」(4番目の修正タイプ)が存在するため、著者は、目に見える明らかな危険をふるい分けるためにAMSを使用し、その後に従来のテスト(AIに質問を投げかける方法)を組み合わせて、内側は安全に見えるが外側では危険に振る舞う巧妙なケースを捕まえることを提案しています。これは、改ざんを見つけ出すための新しく賢い方法ですが、すべての問題を解決する魔法の杖ではありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →