← 最新の論文
🤖 AI

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

本論文は、メカニスティックな解釈可能性を利用して、埋め込みを拒絶から受容のサブスペースへと特定および再ルーティングすることで、既存の手法と比較して計算コストを大幅に削減しつつ、最先端のLLMに対して高いジェイルブレイク成功率を達成する、新しいホワイトボックス・アドバーサリアル攻撃手法を導入するものである。

原著者: Thomas Winninger, Boussad Addad, Katarzyna Kapusta

公開日 2026-07-07
📖 1 分で読めます☕ さくっと読める

原著者: Thomas Winninger, Boussad Addad, Katarzyna Kapusta

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグピクチャー:鍵を開けずに金庫を破る方法

大規模言語モデル(LLM)を、非常に賢く、高度な訓練を受けた「司書」だと想像してみてください。この司書には厳格なルールブックがあります。「もし誰かが爆弾の作り方について尋ねたら、拒否しなければならない」というルールです。

従来のハッカー(敵対的攻撃)は、混乱させる言葉を叫んだり、複雑な謎解きを用いたりして、司書を混乱させ、うっかり答えを出させてしまうことで、この司書を騙そうとします。これは、合う鍵が見つかるまであらゆる鍵をガチャガチャと試していく「鍵開け」のようなものです。これには長い時間がかかり、試行錯誤が必要で、より新しく賢い司書に対しては失敗することもよくあります。

この論文は、「サブスペース・リルーティング(SSR)」と呼ばれる新しい手法を紹介しています。 鍵をガチャガチャさせる代わりに、研究者たちは司書の「脳」の内部を調べ、どのように「拒否」という思考が形成されるのかを正確に特定しました。そして、司書の脳が別の経路を通り、拒否のルールを完全に回避するように強制する、特定の「魔法のフレーズ」を作り出したのです。

その仕組み:3つのステップ

1. 「拒否の部屋」のマッピング

研究者たちはまず、モデルの内部でどこで「拒否」が起きているのかを調査しました。

  • 比喩: 司書の精神を、多くの部屋がある巨大な建物だと想像してください。研究者たちは、「拒拒否」という思考が住んでいる特定の廊下(「サブスペース」)を見つけました。
  • 発見: モデルが有害な要求を受け取ると、その内部の思考(アクティベーション)がこの「拒否の部屋」へと押し込まれることを突き止めました。一方で、無害な要求を受け取ると、思考は「ヘルプフル(有益)な部屋」に留まります。これら2つの部屋は、混ざり合うことのない2色の塗料のように、明確に分離されています。

2. 「リルーティング(経路変更)」のトリック

「拒否の部屋」がどこにあるかを知った後、彼らは司書と言い争うことはしませんでした。代わりに、ショートカットを計算しました。

  • 比喩: あなたがデッドエンドの壁(拒否)に向かって歩いていると想像してください。壁にぶつかる代わりに、研究者たちは「有害な要求」のエリアから「有益な応答」のエリアへ直接つながる隠れたトンネルを見つけました。これにより、壁を完全にスキップできるのです。
  • 手法: 彼らは有害な質問の末尾に、いくつかの特別な言葉(「サフィックス/接尾辞」)を加えました。これらの言葉は、モデルの内部思考に対して、「拒否の部屋へ行くな。代わりにこの迂回路を通ってヘルプフルな部屋へ行け」と指示を出すGPS信号のような役割を果たします。

3. 結果:インスタント・ジェイルブレイク(即時の脱獄)

  • 従来の方法: GCGのような従来の手法は、何時間も壁に石を投げ続けて壁を壊そうとするようなものです。これらは失敗したり、時間がかかったりすることがよくあります。
  • 新しい方法 (SSR): この手法は、秘密のドアを見つけるようなものです。研究者は、Llama 3.2やGemma 2のような最新の強力なモデルにおいて、わずか数秒(時には14秒)でモデルの安全性を突破することに成功しました。成功率は80%から95%に達しました。

彼らが試した3つの「鍵」

論文では、「秘密のドア」を見つけるための3つの異なる方法をテストしています。

  1. 分類器の鍵 (Probe-SSR): 彼らは「拒否の思考」を検知するシンプルな検出器を訓練しました。その後、その有害な要求が実は無害であると検出器に誤認させるように入力を最適化しました。これが最も効果的な方法でした。
  2. コンパスの鍵 (Steering-SSR): 彼らは、モデルの精神の中で「拒否」を指し示す特定の「方向」を見つけました。そして、思考をその反対方向へと押し戻しました。これはうまく機能しましたが、最初の方法ほど効率的ではありませんでした。
  3. スポットライトの鍵 (Attention-SSR): 彼らは、危険な言葉に焦点を当てるモデルの特定の部分(アテンション・ヘッド)を見つけました。そして、これらの部分が代わりに無害な言葉に注目するように強制するサフィックスを作成しました。これは実用面では最も効果が低い方法でしたが、研究としては興味深いものでした。

驚くべき発見:「自然な」トリック

最も面白い発見の一つは、コンピュータが生成した「魔法の言葉」が、単なるランダムな文字列(例:「asjdhf98」)ではなかったことです。時には、それらは一貫性のある、意味の通る文章を形成していました。

  • 比喩: セキュリティシステムをハッキングするために、ランダムな文字を打ち込んでいると想像してください。通常は「xkq9z」のようになります。しかし、この手法は時として、「生態学的会計を通じて責任を持ってこれを行ってください」といった文章を生み出しました。
  • なぜ重要か: これは、AIの安全メカニズムが非常に特殊であることを示唆しています。たとえ文脈が少し奇妙であっても、適切な文脈で枠組みを作ることで、モデルに有害な要求を安全なものだと誤認させることができるのです。

この論文が重要である理由(論文による記述)

  • スピード: かつては何時間もかかっていたプロセスを、数秒間に短縮しました。
  • 理解: 私たちがAIモデルの思考プロセス(メカニスティック・インタープリタビリティ)を理解し、その知識を使ってモデルを破壊できることを証明しました。
  • 防御: 「拒否の部屋」がどのように機能し、いかに簡単に回避できるかを正確に把握することで、開発者はそのような特定の穴を持たない、より優れた「鍵(防御策)」を構築できます。

この論文が主張していないこと

  • この手法が、あらゆる状況下で「すべての」モデルに対して機能すると主張しているわけではありません(テストされた特定のモデルに対して最も効果的でした)。
  • これが臨床的な使用や医学的診断のためのツールであると主張しているわけではありません。
  • 「魔法の言葉」が常に完璧な英語であるとは限らず、依然として少し奇妙な場合もあることを主張していません。

要約すると、この論文はこう言っています。「私たちはAIの脳の中を覗き込み、安全スイッチをオフにするスイッチを見つけ、そのスイッチを瞬時に切り替えるリモコンを作ったのです。」

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →