← 最新の論文
💬 NLP

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models

本論文は、既知の攻撃例のデータベースを活用して悪意のあるジェイルブレイク戦略を検出し推論する、トレーニングを必要としないフレームワークであるRetrieval-Augmented Defense(RAD)を提案し、それによって大規模言語モデルに対する適応的な保護と制御可能な安全性と有用性のトレードオフを提供する。

原著者: Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、最新かつ最も賢い司書たちが人工知能(AI)である、巨大で賑やかな図書館だと想像してみてください。これらのAI司書、すなわち大規模言語モデル(LLM)は、詩を書いたり、数学の問題を解いたり、あなたが想像できるあらゆることについてチャットしたりすることができます。彼らは非常に役に立ちますが、厳格なルールブックに従っています。それは、爆弾の作り方や他人の身元を盗む方法といった、危険な指示を決して出さないようにプログラムされているということです。しかし、賢い子供が巧妙な質問の仕方で厳しい先生を欺くことができるように、悪意のある人々は、これらのAI司書を「脱獄(ジェイルブレイク)」させる方法を見つけ出しました。彼らは、映画の脚本を書いているふりをしたり、ロールプレイングゲームをプレイしたりといった「派手な衣装」の中に危険な要求を包み込み、AIにルールを忘れさせて、秘密を漏らさせるように仕向けるのです。この問題の大きな点は、AIシステムを構築している人々にとって、これらの「トリック」の変化が、AIに新しいルールを教えるスピードよりも速いことです。一つの穴を塞ぐたびに新しい穴が現れ、AIにこれらすべての新しいトリックを学習させるには、通常、大規模で高価、かつ時間のかかる再学習プロセスが必要になります。

ここで、ケンブリッジ大学の研究者によって提案された、「検索拡張防御(Retrieval-Augmented Defense: RAD)」という新しいアイデアが登場します。RADを、あらゆるトリックを暗記しようとする教師としてではなく、最新の「指名手配犯」の写真アルバムを無限に持つ、超スマートな警備員だと考えてみてください。ユーザーが質問をするたびに、RADは単に言葉を見るのではなく、現在の質問が変装しているかどうかを確認するために、既知の脱獄の試みの写真アルバムを素早くめくります。もし一致するものが見つかれば、その衣装を剥ぎ取り、その下にある真の、危険な意図を暴き出します。もし意図が悪ければ、警備員はそのリクエストを阻止します。もし無害な質問であれば、警備員は通過を許可し、AI司書がその仕事を行えるようにします。

研究者たちは、この「写真アルバム」のアプローチがゲームチェンジャーであることを発見しました。テストにおいて、RADは、通常AIモデルを欺いてしまう「PAIR」や「PAP」といった強力な新しい脱獄攻撃を、AIモデルを全く再学習させることなく阻止できることを示しました。それは、今日、犯罪者の新しい写真を警備員の写真アルバムに追加すれば、警備員は明日にはその犯罪者を捕まえられるようになる、というようなものです。さらに優れたことに、このシステムは調整可能です。AIを運営している人々は、警備員がどの程度厳格であるべきかを決定できます。警備員を非常に慎重に設定することもできますし(ほとんどすべての悪党を捕まえますが、時として無実の人も止めてしまいます)、あるいはもっとリラックスした設定にすることもできます(より多くの人々を通しますが、捕まえる悪党は少なくなります)。このバランスは極めて重要です。なぜなら、あまりに厳格すぎて「今日の天気は?」といった単純な質問にさえ答えることを拒否してしまうようなセキュリティシステムは、求めていないからです。

論文は、この手法が、AIの安全性を保ちつつ、その有用性を維持する上で非常に効果的であることを示唆しています。実験では、RADがこれらの巧妙な攻撃の成功率を劇的に減少させ、多くの場合でゼロ近くまで下げた一方で、AIが通常の質問に正しく答えられる状態を維持していることを示しました。また、研究者たちは、写真アルバムに新しい攻撃の例を追加していくにつれて、古いものを見逃すことなく、それらの特定の新しいトリックを捕まえる能力が向上することを示しました。これは、新しい写真をアルバムに追加するだけで賢くなる、柔軟で「学習を必要としない」盾であり、悪意のある人々がルールをすり抜けるための新しい方法を常に発明し続けている世界において、私たちのAIヘルパーを安全かつ便利に保つための有望な方法を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →