← 最新の論文
💬 NLP

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

本論文は、少数のショットによるデモンストレーションがプロンプトベースの防御に対して相反する効果をもたらすことを明らかにしており、役割指向プロンプト(Role-Oriented Prompts)についてはアイデンティティを強化することで向上させる一方で、タスク指向プロンプト(Task-Oriented Prompts)については指示からの注意を逸らすことで著しく低下させることから、LLMの安全性戦略を最適化するための極めて重要な知見を提供している。

原著者: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

公開日 2026-02-05
📖 1 分で読めます☕ さくっと読める

原著者: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、非常に有能だが世間知らずなインターンだと想像してみてください。彼らはコードを書いたり、物語を作ったり、質問に答えたりすることには非常に長けていますが、危険なことや倫理に反する行動をとらないように、厳格なルールを与える必要があります。

あなたが提供した論文は、どのようにしてこれらのインターンにルールを与えるかについて調査しています。具体的には、2つの異なる方法でルール(プロンプト)を記述する方法と、「例となる物語」(few-shot demonstrations)を加えることが結果にどのように影響するかを調べています。

以下に、その研究結果を簡単な比喩を用いて解説します。

1. 指示を与える2つの方法

研究者たちは、2つの主要な「システムプロンプト」(AIに与えられる初期指示)のスタイルをテストしました。

  • 役割指向プロンプト (RoP): 「アイデンティティ」のアプローチ
    • 比喩: インターンに対して、「あなたは『ガーディアン』という名前の、役に立ち、安全で、倫理的なアシスタントです」と伝えることを想像してください。
    • 仕組み: 彼らが「誰であるか」を定義しています。良いアシスタントとして振る舞うための、彼らの学習内容に依存しています。
  • タスク指向プロンプト (ToP): 「職務記述書」のアプローチ
    • 比喩: インターンに対して、「あなたの現在の具体的なタスクは、安全な回答を生成することです。もし要求が不適切な場合は、断ることがあなたの仕事です」と伝えることを想像してください。
    • 仕組み: 彼が「何をすべきか」を定義しています。これは、その瞬間における特定のコマンドです。

2. 「例となる物語」(Few-Shot Demonstrations)

AIにおける「few-shot」とは、本題の質問をする前に、どのように振る舞うべきかの例をいくつか提示することを意味します。

  • 比喩: インターンが仕事を始める前に、過去に「ガーディアン」がどのように難しい質問に対処したかを示す、3つの例が入ったノートを見せるようなものです。
  • 問い: これらの例を見せることは、インターンが安全性を保つのに役立つのでしょうか、それとも混乱させるのでしょうか?

3. 大きな発見:正反対の効果

この論文の主な発見は、例となる物語を追加することが、一方の指示には役立ち、もう一方の指示には害を与えるということです。それは、あるプロップス(小道具)が一人を笑顔にし、もう一人の人を泣かせる手品のようなものです。

シナリオA:「アイデンティティ」のアプローチ (RoP) + 例 = 超・安全

  • 起きたこと: AIに対して「あなたは安全なアシスタントです」と伝え(RoP)、その上で安全な振る舞いの例を見せると、AIは安全性において向上しました。
  • 比喩: AIの「安全なアシスタント」というアイデンティティを「筋肉」だと考えてみてください。例を見せることは、数回のウォーミングアップを行うようなものです。それは筋肉を強化します。例は、AIに対して「そうです、これが私のアイデンティティです。私は安全な存在なのです」と思い出させる役割を果たします。
  • 結果: 安全性は最大4.5%向上しました。例は、役割を「強化」する役割を果たしました。

シナリオB:「職務記述書」のアプローチ (ToP) + 例 = 安全性の低下

  • 起きたこと: AIに対して「あなたのタスクは安全であることです」と伝え(ToP)、その上で例を見せると、AIの安全性は悪化しました。
  • 比喩: インターンに特定の仕事の指示を与えた直後に、まず読むべき大量の無関係な書類を手渡されることを想像してください。指示が書類の束の中に埋もれてしまいます。インターンは例に気を取られ、本来の指示を忘れてしまいます。
  • 科学的根拠: 論文ではこれを**「注意の散漫(Attention Distraction)」**と呼んでいます。AIの脳は、テキストの最初にある例(examples)に集中してしまい、実際の指示(instructions)が中間に押しやられることで、焦点を見失ってしまうのです。
  • 結果: 安全性は最大21.2%も大幅に低下しました。例が指示をかき消してしまったのです。

4. 「思考モード」のパラドックス

論文では、特別な「思考モード」(回答する前にステップバイステップで推論するモード)を持つモデルについても調査しています。

  • 発見: これらのモデルは、どちらの指示スタイルを使用した場合でも、一般的にジェイルブレイク(脱獄:安全策を回避するための攻撃)に対して脆弱であり、例によって混乱しやすい傾向にありました。
  • 比喩: それは、質問を過剰に分析してしまう学生のようなものです。単にルールに従うのではなく、頭の中でルールについて議論し始めてしまい、「悪い奴ら(ジェイラーブレイカー)」によって、その悪いアイデアが実は論理的であると錯覚させられてしまうのです。

5. 開発者は何をすべきか?

これらの発見に基づき、著者らは非常に具体的なアドバイスを与えています。

  • 「アイデンティティ」アプローチ (RoP) を使用する場合: ぜひ例となる物語を追加してください! それはAIをより安全にします。
  • 「職務記述書」アプローチ (ToP) を使用する場合: 例となる物語を追加しないでください。それはAIの安全性を損ないます。指示は短く、直接的なものに保ってください。
  • 「思考モード」のモデルを使用する場合: 非常に注意してください。これらは騙されやすい傾向があるため、追加の安全対策が必要になるかもしれません。

まとめ

この論文は、コンテキスト(文脈)が重要であることを証明しています。

  • AIの**キャラクター(人格)**を定義する場合、例はキャラクターを強化するのに役立ちます。
  • AIの**タスク(任務)**を定義する場合、例は指示をかき消すノイズとして機能します。

研究者たちは単に推測したのではなく、多くの異なるAIモデルと安全性のベンチマークを用いてテストを行い、これら2つの戦略が同じ入力に対して正反対の反応を示すことを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →