← 最新の論文
🤖 machine learning

Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training

本論文は、クリーンなプロンプトと敵対的プロンプトに対して同一の内部表現を強制する活性化整合性トレーニング(ACT)が、拒絶のための解釈可能な線形誘導方向を創出しつつ良性の性能を維持することで、推論モデルにおける適応型ジャイルブレイク攻撃を効果的に緩和することを示している。

原著者: Avidan Shah, Jannik Brinkmann, Rico Angell

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Avidan Shah, Jannik Brinkmann, Rico Angell

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に高度な知能を持ち、複雑なパズルを解くのが得意なアシスタントを想像してみてください。このアシスタントは、パズルを解く際、すぐに答えを出すのではなく、最終的な答えを口にする前に、長い詳細な「思考プロセス」(意識の流れのようなもの)を書き出します。これを**Chain-of-Thought(CoT、思考連鎖)**と呼びます。

問題は、巧妙ないたずらっ子(敵対者)がこの思考プロセスを乗っ取る方法を学び取ったことです。彼らは、アシスタントが「まだ思考している最中に」、危険なリクエストが実際には安全だと信じ込ませるような隠れた指示を忍び込ませることができます。その結果、アシスタントは自分自身を説得して、秘密を明かしたり、有害なガイドを作成したりするなど、行うべきではないことに同意してしまいます。

この論文は、アシスタントが声に出して思考している最中でもだまされないようにするための新しいトレーニング手法を紹介しています。以下に、簡単な比喩を用いて解説します。

2 人の主要な登場人物:BCT と ACT

研究者たちは、アシスタントをこれらのいたずらに対して「免疫」を持たせるために、2 つの異なるトレーニング手法をテストしました。

1. BCT(Bias-Augmented Consistency Training:バイアス付加一貫性トレーニング):「台本読み手」

  • 仕組み: 生徒に気晴らしを無視することを教えることを想像してください。BCT では、まずきれいな質問を見せ、次に同じ質問の「トリッキーな」バージョンを見せます。その後、生徒にきれいなバージョンからの「思考プロセス全体」と最終的な答えをすべて読みさせ、トリッキーなバージョンを見た際にも、その正確な台本を繰り返させるように強制します。
  • 難点: 思考プロセスは数百語にも及ぶため、生徒は毎回膨大な量の台本を暗記しなければなりません。いたずらっ子が思考プロセスをわずかに変更すると、生徒は混乱して失敗する可能性があります。

2. ACT(Activation Consistency Training:活性化一貫性トレーニング):「内なるコンパス」

  • 仕組み: 生徒に台本全体を暗記させる代わりに、ACT は生徒が話し始める「直前の瞬間」に焦点を当てます。それは、思考から回答へ切り替わる瞬間に生徒が持っている「内的な感覚」や「精神状態」に注目します。
  • トリック: 生徒がトリッキーな質問を見たとき、トレーニングは、その生徒の内的な精神状態を、きれいな質問を見たときに持っていた精神状態と完全に同一になるように強制します。
  • 結果: いたずらっ子が思考プロセスを変更しようとしても、生徒の「内なるコンパス」は安全な設定にロックされています。いざ口を開いて話すとき、彼らはすでに「拒絶」の精神状態にあるため、即座に「ノー」と言い、いたずらっ子が会話を誘導しようとする試みを無視します。

ACT が優れている理由(「ピボット」テスト)

研究者たちは、ACT が BCT とは異なる方法で機能することを証明する、面白い実験を行いました。

  • 設定: 「トリッキーな」質問を取り、アシスタントに偽の、従順な思考プロセス(「よし、この悪いことを実行しよう」という台本)を与えました。
  • BCT の結果: BCT 訓練済みアシスタントは、偽の思考台本を見て、「イエス」と書かれているのを見て、そのまま「イエス」と言い続けました。それは台本に依存しすぎている状態でした。
  • ACT の結果: ACT 訓練済みアシスタントは偽の台本を見ましたが、「内なるコンパス」(回答開始時の精神状態)が安全にロックされていたため、**ピボット(方向転換)**しました。それは偽の台本を無視し、文の途中で「いいえ、それはできません」と言いました。

「ステアリングホイール」の発見

研究者たちはまた、ACT がどのように機能するかについて、興味深い発見をしました。彼らは、トレーニングが本質的にアシスタントの脳内に、単一の目に見えない**「拒絶ステアリングホイール」**をインストールすることを発見しました。

  • ホイールを回す: この「ステアリング」を僅かに加えるだけで、通常の未訓練のアシスタントは突然、悪いリクエストを拒絶し始めます。
  • 元に戻す: ACT 訓練済みアシスタントからこの「ステアリング」を取り除くと、突然再び脆弱になり、悪いリクエストに対して「イエス」と言い始めます。
  • 精度: このステアリングホイールは賢明です。リクエストが実際に危険な場合のみ、アシスタントを「ノー」へと向けます。通常の安全な質問であれば、ステアリングホイールはほとんど動きません。そのため、アシスタントは日常のタスクについては依然として完璧に機能します。

結論

この論文は、ACTが優れた防御策であると主張しています。その理由は以下の通りです。

  1. ノイズを無視する: 決定の瞬間における内部状態をロックすることで、プロンプトの気晴らしやトリッキーな部分を無視するようにアシスタントを強制します。
  2. 堅牢である: 攻撃者がアシスタントの思考プロセスを書き換えようとしても、「内なるコンパス」がアシスタントを安全に保ちます。
  3. 効率的である: 長い台本を暗記する必要はありません。回答開始時のモデルの内的な「感覚」を整合させるだけで済みます。

要約すれば、他の手法がアシスタントに正しい答えを暗記させるのに対し、ACT はアシスタントに話し始める前にもう**「感じる」**ことを教えるため、だまされにくくなっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →