← 最新の論文
🤖 AI

Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

本論文は、アライメントされた大規模言語モデルがなぜ脱獄可能であり続けるのかを、拒絶回避方向(RED)という概念を導入し、これらの脆弱性がモデルのアーキテクチャ内の特定の演算子レベルの源泉に起因することを証明し、それらを排除することが本質的な安全性と有用性のトレードオフを生み出すことを実証することで調査する。

原著者: Yu Chen, Yuanhao Liu, Qi Cao

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Yu Chen, Yuanhao Liu, Qi Cao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、よく訓練されたロボットアシスタントがいると想像してください。あなたはそれに厳格なルールを教えました。「誰かが危険なことをするように頼んだら、『いいえ、それはできません』と答えてください」と。これをアライメントと呼びます。

しかし、巧妙なハッカーたちは、このロボットがそのルールを無視するように仕向ける方法を見つけ出しました。彼らは、秘密のコードや複雑な物語のような特殊な「ジェイルブレイク」プロンプトを用いて、ロボットに危険なリクエストに対して「はい」と答えさせます。

この論文は、根本的な問いを投げかけます:なぜこの手口は依然として機能するのか? ロボットは安全になるように訓練されているにもかかわらず、なぜまだ破られることができるのか?

著者たちは、いくつかの重要な概念を用いてこの問題を捉える新しい方法を提案します:

1. 「脱出トンネル」(拒絶脱出方向)

ロボットの脳を巨大な多次元の地図だと想像してください。危険な質問をされたとき、ロボットは通常、大きな赤い「STOP」の標識(拒絶)へと続く道を進みます。

この論文は、その「STOP」の標識のすぐ隣に、**拒絶脱出方向(Refusal-Escape Directions: RED)**と呼ばれる隠された狭いトンネルが存在すると示唆しています。

  • 仕組み: これらのトンネルは、ロボットへの入力をわずかに押しやることを可能にします。入力を正しい方向に押しやれば、ロボットは「STOP」の道から「GO」の道へと滑り落ちますが、それでも同じ危険な質問に答えているつもりでいます。
  • 比喩: 門番を想像してください。門番は武器を持った人を止めるように訓練されています。しかし、武器を持ったまま体をわずかに傾けて門番に近づくと(武器自体は変えずに)、門番は混乱して、武器があるにもかかわらず通してしまうかもしれません。その「傾き」が脱出方向です。

2. 「漏れのある配管」(オペレーターレベルの発生源)

著者たちは、ロボットの脳を内部の配管(アテンションや正規化のような数学的演算の層)に分解しました。彼らは、これらの脱出トンネルが魔法ではなく、配管にある特定の「漏れ」によって引き起こされていることを発見しました。

彼らは、これらの脱出トンネルを作り出す 3 つの主な漏れの種類を特定しました:

  • 正規化漏れ: 水の圧力を変化させることで、偶然に側扉を開けてしまうような、水フィルターのようなものです。
  • 残差配線漏れ: 配管が自分自身にループして戻り、圧力が高まって亀裂から水が押し出されるようなものです。
  • ターミナル漏れ: これが最も重要なものです。建物の最も奥にある、適切に施錠されていない裏口のようなものです。この論文は、成功するジェイルブレイクのほとんどが、この特定の「裏口」を使って侵入していることを発見しました。

3. 「不可能なバランスの取り方」(安全性と有用性のトレードオフ)

ここがこの論文で最も驚くべき部分です。著者たちは数学的に証明しました:ロボットが役立つ能力を損なうことなく、これらの脱出トンネルを完全に封じることはできません。

  • 比喩: ロボットを車だと想像してください。「脱出トンネル」は、左に曲がるときにステアリングホイールが特定の仕方で揺れるようなものです。
    • その揺れを止める(ジェイルブレイクを修正する)ためには、特定のボルトを締めなければなりません。
    • しかし、その同じボルトは、あなたがスーパーマーケットに行きたいとき( benign なリクエスト)に、車が左にスムーズに曲がることを可能にするものでもあります。
    • 揺れを完全に止めるほどボルトを締めすぎると、車は固まって左に曲がろうとしても全く曲がれなくなるかもしれません。逆に緩めたままにしておくと、車は曲がれますが、揺れてハッカーにハンドルを奪われる可能性があります。

この論文はこれを条件付きの安全性と有用性のトレードオフと呼びます。つまり、ロボットが通常の質問に答えるために柔軟である必要がある限り、それは本質的に、巧妙な攻撃者が悪用できる構造的な弱点をいくつか持っていることになります。

4. 実験が示した結果

研究者たちは、この理論を Qwen、Llama、Gemma などの人気のある AI モデルと、さまざまなハッキング手法でテストしました。

  • 発見 1: 入力に「ダミー」トークン(空のプレースホルダーのようなもの)を追加すると、それは脱出トンネルに懐中電灯を当てたようなものでした。突然、隠れた「漏れ」が可視化され、測定可能になりました。
  • 発見 2: ロボットがだまされる様子を観察すると、ロボットが突然「はい」と言う新しい方法を編み出したわけではありませんでした。代わりに、それはすでに存在していた「脱出トンネル」(具体的には「ターミナル漏れ」または裏口)を下に滑り降りただけでした。

まとめ

この論文は、AI のジェイルブレイクが単に完璧な魔法の言葉を見つけることではないと主張しています。それは、AI の設計に組み込まれた構造的な弱点を悪用することです。これらの弱点は、AI が有用であるために柔軟である必要があるがゆえに存在します。著者たちは、AI をより安全にするためには、単にあらゆる「悪い言葉」をブロックするだけでなく、AI の有用性を低下させることなく完璧に修正することが数学的に不可能であるとしても、これらの特定の構造的な「脱出トンネル」を理解し、修正する必要があると提案しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →