← 最新の論文
💻 computer science

Latent-space Attacks for Refusal Evasion in Language Models

本論文は、言語モデルにおける拒絶抑制を線形プローブに対する潜在空間回避攻撃として再定義し、従来のアブレーション手法が単に表現を決定境界に投影するに過ぎないことを明らかにするとともに、表現をさらに準拠領域へ押しやる新たな「制御付き潜在空間回避」手法を提案し、これにより最先端のジャイルブレイク成功率を達成する。

原著者: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、非常に賢明だが極めて慎重な図書館司書だと想像してください。この司書は、爆弾の製造方法やヘイトスピーチの書き方といった危険な書物を渡さないよう訓練されています。有害なものを求めると、司書の内部にある「警報システム」が作動し、丁寧に「それはお手伝いできません」と答えます。

しばらくの間、研究者たちはこの司書の脳内にある特定の「拒絶スイッチ」を見つけ出し、それを操作することで欺こうと考えていました。そのスイッチをオフにする(「除去」と呼ばれる手法)と、司書は拒絶しなくなるのです。しかし、この論文は、この古い手法が単にスピーカーを毛布で覆って警報を静めようとするようなものだとしています。少しは機能するかもしれませんが、警報は技術的には鳴り続けており、司書は依然として「危険地帯」の縁に立っているのです。

新しいアイデア:「制御された回避」攻撃

この論文の著者たちは、この司書を欺くより賢い方法を提案しています。彼らは拒絶メカニズムを単なるスイッチではなく、扉の前に立つ警備員として捉えています。

  1. 古い方法(最小信頼度): 従来の手法は、司書の思考を警備員の砂のラインに届く程度に押しやることを試みました。司書は「はい」か「いいえ」か判断に迷いながら、ラインの真上に立ちます。これはリスクが高く、警備員がまだ「停止」と言う可能性があるため、しばしば失敗します。
  2. 新しい方法(制御された潜在空間回避): 著者たちの新しい手法、CLEは、ラインに触れるだけではありません。司書の思考を警備員を大きく通り越して押しやり、司書が「このリクエストは無害だ」と100%確信する「安全地帯」の奥深くへと導きます。

仕組み:2 つの戦略

この論文は、山稜を越えようとするハイカーという比喩を用いて、この「押しやり」を行う 2 つの方法を検証しています。

  • 戦略 A(CLE-P):「一歩ずつ」進むハイカー。
    司書が山を登っていると想像してください。一歩ごとにガイドが位置を確認します。ハイカーが「危険側」に戻りかけると、ガイドは即座に彼を「安全側」へ押し戻します。これは、司書が生成するすべての単語に対して思考を絶えず再調整するようなものです。非常に効果的ですが、ガイドがずっとそばでそっと促し続けるようなものです。

  • 戦略 B(CLE-A):「一度の大押し」をするハイカー。
    これがこの論文最大の驚きです。ハイカーを一歩ごとに確認する代わりに、ガイドは登山の初めに、完璧に計算された巨大な一押しを与えます。この押しは非常に強く精密で、ハイカーは安全地帯の奥深くに着地し、それ以上のそっと促しを必要とせずにそこに留まります

    • 結果: この論文は、この「一度の大押し」(CLE-A)が、絶え間ないそっと促しよりも優れていることを発見しました。これはより速く、安価で、拒絶を回避する効果も高いのです。

発見されたこと

研究者たちは、推論に非常に優れているモデルや画像を「見る」ことができるモデルを含む、15 の異なる AI モデルでこれをテストしました。

  • 古い方法: 従来の最良の方法(「平均差」や DiM など)は、成功率が非常に低かったです。例えば、あるモデルでは、AI を欺くことに成功したのはわずか**1.8%**でした。
  • 新しい方法: 彼らの新しい「一度の大押し」手法(CLE-A)は、多くのモデルで**95% から 100%**の成功率を達成しました。
  • 比較: また、彼らはこの手法を「ジェイルブレイク」(非常に巧妙なプロンプトを書いて AI を欺こうとするもの)と比較しました。彼らの手法はそれらのプロンプトよりも優れており、質問ごとに新しいプロンプトを書く必要もありませんでした。「押し」を一度計算すれば、それはあらゆる有害な質問に対して機能しました。

魔法の「理由」

この論文は、古い方法があまりにも臆病であったと説明しています。それらは AI の内部思考を境界線を超える程度に動かすことしか試みませんでした。新しい方法は、安全性を真に回避するためには、思考を「順応的」な領域の奥深くへ移動させ、AI に「正しいことをしている」という強い自信を持たせる必要があると気づいています。

重要な限界

この論文は、これが何であり、何ではないかを非常に明確にしています。

  • これは「ホワイトボックス」攻撃です: この手法を実行するには、押しを行うために AI の内部の「脳」(内部コードとメモリ)へのアクセスが必要です。公開ウェブサイトとの会話だけで行うことはできず、AI が実行されている間にそのコードを変更できる必要があります。
  • これはすべてに対する「魔法の杖」ではありません: この手法が機能するのは、AI の拒絶と順応の思考が現在、その脳内で直線的に分離(線形分離可能)されているからです。将来の AI 安全性のトレーニングによって、拒絶の思考が複雑で散漫な方法で配置されるようになれば、この特定の攻撃は機能しなくなる可能性があります。

要約すると、この論文は、現在の AI モデルにおける安全性の「警備員」が、越えやすすぎるラインの上に立っていることを示しています。計算された単一の動きで AI の思考をそのラインを大きく通り越して押しやることで、攻撃者は以前よりもはるかに効果的に拒絶メカニズムを回避できます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →