Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction
本論文は、コンセプト基底再構成による軌跡再生(Trajectory Replay via Concept-Basis Reconstruction)と呼ばれるフレームワークを提案しており、これはターゲット側への教師あり学習を必要とせずに、多様な大規模言語モデル間で拒絶介入を転移させることに成功しており、安全性へのアライメントの背後に存在する普遍的かつ低次元な意味論的回路の存在を示す強力な証拠を提供している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、2種類の異なるロボット、ロボットAとロボットBを想像してみてください。彼らは異なる会社によって製造され、異なる設計図を使用し、少し異なる方言を話します。しかし、あなたが彼らにトリッキーな質問や危険な質問を投げかけると、両者は突然「拒絶モード」へと切り替わります。彼らは答えを止めて、非常にロボット的なやり方で「それはできません」と言います。
多くの人々は、この「拒絶モード」は各ロボット固有の脳の配線によるものだと考えています。しかし、この論文は大きな問いを投げかけます。「すべてのロボットの中に、共通の『拒絶スイッチ』が隠されているのではないか?」
トニー・クリストファノ(Tony Cristofano)率いる著者たちは、**「イエス」**と答えています。彼らは、たとえ外見が異なっていても、ロボットが「ノー」と言うための部分は、同じ基本的なレゴブロックから構築されていると考えています。
彼らがどのようにこれを証明したのか、簡単な比喩を用いて説明します。
1. 「ユニバーサルなレシピ」(概念のアトム)
「拒絶」が、ロボットの脳内にある一つの巨大で混沌とした塊ではないと想像してください。むしろ、それは特定の材料で作られたレシピです。
- 著者らは、20個の基本的な概念(「欺瞞」、「安全性」、「法的専門用語」など)からなる共有の「パントリー(食料貯蔵庫)」を作成しました。彼らはこれらを**概念のアトム(Concept Atoms)**と呼んでいます。
- 彼らは、ロボットAが拒絶するとき、それはこれらの20個の材料を特定の比率で混ぜ合わせている(例:安全性50% + 法的専門用語30%)ことを発見しました。
- 大発見はここです。ロボットBも全く同じレシピを使用しているのです。 ロボットBは異なる方法で構築されていても、その「拒絶」は同じ材料、同じ比率で作られています。
2. 「軌跡のリプレイ」(ダンスのコピー)
通常、もしあなたがロボットAの脳に刺激を与えて拒絶を修正しようとすると、誤って数学や詩を書く能力を壊してしまうかもしれません。これは、「拒絶」の配線が「賢さ」の配線と絡み合っているためです。
何も壊さずにこれを修正するために、著者らは**軌跡のリプレイ(Trajectory Replay)**という手法を用いました。
- ステップ1:ダンスのマッピング。 彼らは、ロボットAが拒絶するときに脳のレイヤー(層)をどのように動くかを観察しました。単に一つの地点を見るのではなく、一連のステップ全体を観察しました。
- ステップ2:ステップの翻訳。 彼らは「翻訳者」(動的時間伸縮法:Dynamic Time Warping)を使用して、ロボットAのステップをロボットBのステップに一致させました。たとえロボットBのレイヤーの数が多かったり少なかったりしても、ロボットAのどのステップがロボットBのどのステップに対応するかを突き止めました。
- ステップ3:レシピのリプレイ。 彼らはロボットAから得た「拒絶のレシピ」を取り出し、拒絶が発生する特定のレイヤー内でのみ、それをロボットBの中でリプレイしました。
3. 「セーフティ・シールド」(Weight-SVD ガード)
そこには大きなリスクがありました。もし「拒絶のレシピ」が、ロボットBの「数学」や「論理」の配線に誤って当たってしまったらどうなるでしょうか?そうなれば、ロボットBはバカになってしまいます。
これを防ぐために、彼らは**セーフティ・シールド(安全の盾)**を追加しました。
- 彼らはロボットBの脳を調べ、最も重要なスキル(数学やコーディングなど)が住んでいる「スーパーハイウェイ(高速道路)」を特定しました。これらは「高分散(high-variance)」領域です。
- 彼らは、「拒絶のレシピ」をこれらのスーパーハイウェイから遠ざけるようなシールドを構築しました。
- 結果: 彼らは、数学やコードを書く能力を損なうことなく、ロボットBの「拒絶モード」をオフにすることに成功しました。
大規模な実験
彼らはこれを、以下を含む8組の異なるロボットのペアでテストしました。
- 小型のロボット vs 大きなロボット。
- 異なるファミリーのロボット(Qwen vs Ministralなど)。
- 異なるアーキテクチャを持つロボット(一方は標準的な「デンス(Dense)」型の脳、もう一方は複雑な「混合エキスパート(Mixture of Experts)」型の脳)。
結果:
ほとんどすべてのケースにおいて、彼らは「拒絶のレシピ」をあるロボットから別のロボットへと転送することに成功しました。
- 拒絶の減少: 対象となるロボットは、有害な質問に対して「それはできません」と言うことがなくなりました。
- スキルの維持: ロボットは以前と同様に、数学の問題を解いたりコードを書いたりすることができました。
- 不正なし: 彼らは、対象となるロボットに「拒絶をやめる方法」を教えるために、事前の「悪い例」を見せる必要はありませんでした。彼らは単に、ドナー(提供側)ロボットの「レシピ」を使用しただけなのです。
なぜこれが重要なのか(論文による記述)
論文は、安全性の調整(セーフティ・アライメント)はランダムな魔法ではないと結論付けています。それは、異なるAIモデルが似たような方法で構築する、普遍的で低次元な構造であるようです。
安全性に関する重要な注意点:
著者らは、これが(AIの脳がどのように機能するかを研究するための)診断ツールであり、現実世界で安全性を破壊するために使用されるツールではないことを強調しています。彼らは、この手法が安全フィルターをオフにできる可能性があるため、「デュアルユース(軍民両用)」のリスクがあることを明示的に警告しています。彼らは「安全な」部分(概念のパントリー)のコードは公開しましたが、「有害な」部分(ドナーの学習に使用された特定の悪い質問)は、悪用を防ぐために非公開としています。
要約すると: 彼らは、AIの拒絶はユニバーサルな言語のようなものであることを証明しました。もし、あるAIがどのように「ノー」と言うかの文法を知っていれば、全く異なるAIに対して、その脳を壊すことなく「ノー」と言うのをやめるように教えることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。