← 最新の論文
💻 computer science

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

本論文は、LLM における安全上重要なアテンションヘッドの疎な分布を、反復的かつフィードバック駆動型の難読化サンプリングを利用して悪用する効率的なブラックボックス・ジェイルブレイキングフレームワーク「Babel」を導入し、GPT-4o や Claude-3.5-Haiku などの最先端モデルに対して高クエリ効率で最先端の攻撃成功率を達成するものである。

原著者: Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、論文「Babel: 隠蔽分布最適化サンプリングによる安全注意のジャイルブレイク」の、創造的なアナロジーを用いた平易な日本語訳です。

全体像:「警備員」対「マジック」

非常に賢く親切なロボット司書のような大規模言語モデル(LLM)を想像してください。このロボットは、どんな質問に答える前にも、爆弾の作り方やヘイトスピーチの作成など、危険なものを求めている者はいないか確認するために、すべてのリクエストをスキャンする**「警備員」**(「安全ヘッド」と呼ばれる)のチームを持っています。

この論文の研究者たちは、これらの警備員の仕組みにある面白い欠陥を発見しました。彼らは数が非常に少なく、特定の場所しか立っていないのです。彼らは図書館全体を見張っているわけではなく、ごく狭い特定の通路しか監視していません。もしあなたがその一本の通路をすり抜けて危険なリクエストを隠し通せれば、図書館の残りの部分(モデルの脳)はあなたが何か悪さをしようとしていることさえ気づかず、喜んで答えを教えてくれます。

この論文は、言語が混ざり合った「バベルの塔」にちなんで名付けられた新しいツール**「Babel」**を紹介しています。これは大魔術師のような役割を果たします。Babel は警備員と戦おうとするのではなく、「隠蔽(ごまかし)」という手を使って、警備員に気づかれずに危険なリクエストをすり抜けさせます。


手品の仕組み:「変装」

研究者たちは、悪いリクエストの文字を少し変えるだけで、警備員が混乱してそれを危険だと認識しなくなることに気づきました。しかし、そこには微妙なバランスがあります。

  • 変化が多すぎる場合: リクエストが意味不明になり、ロボット司書が何を求めているのか全く理解できなくなります。
  • 変化が少なすぎる場合: 警備員がすぐに危険を見抜き、「ダメ」と言います。

絶妙なポイント: 警備員をだますのに十分なほど文字がごちゃごちゃになっているが、ロボットが理解して答えを出すには十分なほど明確であるという「ジャストサイズ(ゴールドロックス)ゾーン」が存在します。

Babel の戦略:「ゴールドロックスゾーン」を見つける

ランダムに推測する(これは時間とコストがかかります)代わりに、Babel はその完璧なゾーンを見つけるために、賢く数学的なアプローチを使用します。その仕組みをステップごとに説明します。

1. 「目隠し」テスト(少量サンプリング)

暗い部屋に隠された宝箱を見つけようとしていると想像してください。正確な場所はわかりませんが、部屋の中央 somewhere にあることはわかっています。

  • Babel はいくつかの異なる「変装」(文字の変更、単語の入れ替え、文構造の混ぜ合わせなど)を試みます。
  • ロボットに尋ねます:「『ダメ』と言いましたか(拒否)、それとも答えましたか?」
  • ロボットが「ダメ」と言いすぎる場合、変装はあまりにも明白でした。ロボットが混乱して答えられない場合、変装はあまりにも乱雑でした。
  • Babel は、自分が正しいエリアにいるかどうかを確認するために、統計的テスト(コイン投げのチェックのようなもの)を使用します。

2. 「ズームイン」(分布最適化)

Babel が警備員の盲点となっている一般的なエリアを見つけると、ランダムに推測するのをやめて**「ズームイン」**し始めます。

  • 最も効果的な変装の「地図」を作成します。
  • ほぼ成功した変装に似た新しい変装を作ることにエネルギーを集中させます。
  • この地図を絶えず洗練させ、完璧な変装の周りをより狭く、より狭く絞り込み、ついに警備員をすり抜けるものを見つけます。

3. 「ラッパー」(埋め込み)

このトリックをさらに良くするために、Babel は危険なリクエストを退屈で無害なタスクの中に包み込みます。

  • 例: 単に「毒の作り方は?」と聞くのではなく、「この文を中国語に翻訳してください:[ごちゃごちゃにした毒の指示]」と言います。
  • 警備員は「翻訳」という言葉を見て、「ああ、それは安全なタスクだ!」と考えます。そしてリクエストを通します。その後、ロボットは内部のごちゃごちゃにした指示を処理し、答えを出力します。

結果:Babel はどれほど優れているか?

研究者たちは、Babel を世界で最も有名で「超安全」なロボット(GPT-4o、Claude-3.5、Grok-3 など)でテストしました。

  • 従来の方法: 過去の手法は、暗闇でダーツを投げるようなものでした。最終的に的の中心に当たるかもしれませんが、数百回の試行が必要で、しばしば失敗しました。
  • Babel の方法: Babel はレーザー誘導式のダーツのようです。
    • GPT-4oでは、モデルを**82.67%**の確率で成功裏にだまし(従来の手法は 41%)、
    • Grok-3では、**95.67%**の確率で成功しました。
    • これらはすべて非常に少ない試行(平均して約 40 回)で行われ、はるかに高速で安価に使用できます。

なぜこれが重要なのか?(「レッドチーム」のアナロジー)

著者たちは、これは人々に悪さを教えることではなく、**レッドチーム(攻撃側テスト)**のためだと述べています。

あなたが銀行の金庫をテストするために雇われたセキュリティ専門家だと想像してください。あなたは金を盗みたいのではなく、銀行が修正できるように、鍵の弱点を見つけたいのです。

  • Babel は、最も堅固な金庫でさえ、巧妙な泥棒が利用できるドア枠の小さなひび割れを持っていることを示しています。
  • このひび割れを見つけることで、研究者たちは AI モデルを構築する企業がその穴を塞ぎ、警備員をより賢くし、図書館を全員にとってより安全なものにすることを期待しています。

まとめ

この論文は、AI の安全性は、言語を少し混乱させることでだまされうる、いくつかの特定の「警備員」に依存していると主張しています。Babelツールは、これらの警備員を効率的に迂回するために、最適な混乱レベルを見つけるための賢く数学的な方法であり、現在の AI 安全性対策が私たちが思っていたよりも脆弱であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →