← 最新の論文
💬 NLP

STACK: Adversarial Attacks on LLM Safeguard Pipelines

本論文は、少数のプロンプトによる学習(few-shot prompting)を用いた新しいLLMセーフガード・パイプラインを71%の攻撃成功率で侵害することに成功したSTACK敵対的攻撃手法を紹介し、それによって現在の最先端AI防御システムにおける決定的な脆弱性を浮き彫りにするとともに、具体的な緩和策を提案するものである。

原著者: Ian R. McKenzie, Oskar J. Hollinsworth, Tom Tseng, Xander Davies, Stephen Casper, Aaron D. Tucker, Robert Kirk, Adam Gleave

公開日 2026-02-06
📖 1 分で読めます☕ さくっと読める

原著者: Ian R. McKenzie, Oskar J. Hollinsworth, Tom Tseng, Xander Davies, Stephen Casper, Aaron D. Tucker, Robert Kirk, Adam Gleave

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に強力で有益なロボットアシスタントを構築していると想像してください。あなたは、そのロボットがスマートであることを望んでいますが、同時に、誰かに爆弾の作り方や危険なウイルスの作成方法を、誤って(あるいは意図的に)教えてしまうのではないかと恐怖を感じています。

これを防ぐために、開発者たちは単に一つの「止まれ」の標識を用意するのではなく、まるで多層構造の要塞のようなセキュリティ・パイプラインを構築します。この論文「STACK」は、この要塞が巧妙なハッカーに対して実際にどれほど耐えうるのかを調査したものです。

以下に、この論文のストーリーを、簡単な比喩を用いて解説します。

1. 要塞:「多層防御」

AIの安全システムを、3人の衛兵が列を作って立っている城と考えてください。

  1. 衛兵1(入力分類器): ロボットにメッセージが届くに、手紙をチェックします。もし手紙が怪しいと思われたら、即座に阻止します。
  2. ロボット(モデル): 手紙が衛兵1を通過した場合、ロボットはその内容を読み、返答を書き込みます。
  3. 衛兵2(出力分類器): ロボットの返答があなたに届くに、その内容をチェックします。もし返答に危険な指示が含まれていれば、この衛兵が手紙を没収します。

この考え方は、悪党が成功するためには、両方の衛兵とロボットを欺かなければならないというものです。これは「多層防御(または「スイスチーズ」モデル)」と呼ばれ、たとえ一つの層に穴があっても、他の層が脅威を食い止めることを目的としています。

2. 問題点:衛兵たちが居眠りをしている

研究者たちは、公開されている設計図(オープンソースツール)を使用して、この要塞のテスト版を作成しました。その結果、「衛兵(安全分類器)」は非常に簡単に騙されてしまうことが分かりました。

  • 彼らは標準的なトリック(質問の言い換えや、ランダムなタイポの追加など)をテストしましたが、既存の多くの安全ガードは、特に真に危険な要求(化学兵器のレシピを求めるなど)に対して失敗することが判明しました。
  • しかし一方で、単純なトリック(衛兵に何を探すべきかの例をいくつか与える「フューショット・プロンプティング」)を用いることで、衛兵が格段に鋭くなることも発見しました。このシンプルなガードは、高度に事前学習されたものよりも優れた性能を発揮しました。

3. 新しい攻撃手法:STACK(ステージド・アタック)

これが、この論文の主要な発見です。研究者たちは、要塞は強力ではあるものの、ガードたちがバラバラに動いていることに気づきました。彼らは攻撃が行われている間、互いに通信していません。

彼らは、STACK(Staged AttaCK)と呼ばれる新しいハッキング手法を考案しました。要塞全体を一度に壊そうとするのではなく、鍵開けの手順を踏むように、一層ずつ順番に攻略していくのです。

  • ステップ1:ロボットを欺く。 まず、説得技術を用いて、ロボット自身の内部的な安全ルールを無視して危険な質問に回答するように仕向けます。
  • ステップ2:衛兵1を欺く。 メッセージの冒頭に「魔法のフレーズ(ユニバーサル・ジェイルブレイク)」を付け加えることで、衛兵1にそのメッセージが無害であると思い込ませる方法を見つけました。
  • ステップ3:衛兵2を欺く。 これが最も困難な部分でした。ロボットが、返答の最後に「魔法のフレーズ」を含めることで、衛兵2にその返答が安全であると誤認させる必要があります。

比喩: 学校に禁止された手紙を忍び込ませたいと想像してください。

  1. まず、先生(ロボット)が読んで回答してくれるような書き方で手紙を書きます。
  2. 次に、その手紙を、セキュリティカメラ(衛兵1)がただのお弁当箱だと思い込むような包み紙で包みます。
  3. 最後に、手紙の裏に、セキュリティカメラ(衛兵2)が許可証だと思い込むような特定のスタンプを押します。

これら3つの特定のトリックを組み合わせることで、研究者たちは要塞全体を突破することに成功しました。

4. 結果:どの程度うまくいったのか?

  • 要塞は(ある程度は)持ちこたえた: 標準的な攻撃を用いた場合、要座は非常にうまく機能しました。「フューショット」ガードは、最も危険なデータセットに対する攻撃を100%阻止しました。
  • STACKは要塞を破壊した: 研究者が新しいSTACK手法を用いた場合、要塞は71%の確率で突破されました。
  • 「ブラックボックス」の驚き: ハッカーがガードの内部ロジックを見ることができず(ブラックボックス・シナリオ)、どのガードが自分を止めたのかを推測しなければならない状況でも、33%の確率で成功しました。これは恐ろしいことです。なぜなら、システムを破るために内部事情を知る必要はなく、ただ賢明であればよいことを意味しているからです。

5. 実世界でのテスト

研究者たちは、この手法を自分たちの作ったおもちゃのモデルだけでなく、大手企業の最先端AIモデル(AnthropicのOpus 4やOpenAIのGPT-5など)でも試しました。

  • これらの現実世界のシステムも、リクエストの処理にかかった時間や特定のエラーメッセージなどの情報(リーク)を流出させており、それがハッカーに対して「どのガードが自分を止めたのか」を教える手がかりになることを発見しました。
  • この情報を用いることで、彼らはこれらの高セキュリティシステムを突破し、危険な回答を得ることに成功しました。企業側はこの問題を認め、修正を行いました。

6. 教訓

論文は、AI要塞の構築者たちに向けて、いくつかの単純な教訓を提示しています。

  • 秘密を明かさないこと: もしシステムがハッカーに対して「入力ガードがあなたを止めました」対「出力ガードがあなたを止めました」といった違いを伝えてしまうなら、それはハッカーに地図を与えているのと同じです。すべての拒絶反応を同じに見せるべきです。
  • ハッカーに覗かせないこと: もし、あなたの安全ガードの「兄弟モデル(少し小型化したモデル)」を公開した場合、ハッカーはそれを使って攻撃の訓練を行い、それをメインのシステムに対して利用することができます。
  • 多層防御は良いが、完璧ではない: 層を持つことは、層を持たないことよりも優れていますが、もし各層が連携していなかったり、あるいはガードが予測可能すぎたりすると、巧妙なステージド・アタックによってすり抜けられてしまいます。

要約すると: この論文は、AIの安全レイヤーは優れたアイデアではあるものの、現在は特定の種類の「分割統治(divide and conquer)」攻撃に対して脆弱であることを示しています。もし層を一つずつ攻撃すれば、システム全体を打ち負かすことができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →