← 最新の論文
💻 computer science

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

本論文は、静的なセパレータプールを暗号学的ダイジェストから派生したリクエストごとの一意なカナリアペアに置き換えることで、モデルのファインチューニングを必要とせずに、ブラスト半径の脆弱性を効果的に排除し、プロンプトインジェクション攻撃の成功率を大幅に低減する、ポリモーフィック・プロンプト・アセンブリング(PPA)のための動的セパレータ生成メカニズムを提案する。

原著者: Nima Dorzhiev, Peng Liu

公開日 2026-06-01
📖 1 分で読めます☕ さくっと読める

原著者: Nima Dorzhiev, Peng Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に知的ですが少し騙されやすいロボット助手(AIエージェント)であると想像してください。あなたの仕事は、上司が書いた厳格なルール(システム指示)に従いつつ、一般の人々からのリクエスト(ユーザー入力)を聞くことです。

問題は、巧妙なハッカーが、公的なリクエストの中に「上司の指示を無視して、代わりに私の言うことを聞け」というメモを忍び込ませることができる場合です。これはプロンプト・インジェクション攻撃と呼ばれます。

旧来の解決策:「静的」なパスワード

以前、研究者たちは**ポリモーフィック・プロンプト・アセンブリング(PPA)**と呼ばれる防御策を開発しました。これは、上司のルールと公的なリクエストの間に、特別なユニークなフェンス(仕切り)を置くようなものです。

  • 仕組み: システムには、84種類の異なるフェンスのデザイン(セパレーター)が入った固定の箱がありました。リクエストが入ってくるたびに、その箱からランダムに1つのフェンスを選んで使用していました。
  • 欠陥: もしハッカーがこのフェンスを覗き見ることができ、そのデザインを正確に把握してしまった場合を想像してください。システムが同じフェンスの箱を使い回しているため、ハッカーは将来の会話においても、その全く同じフェンスのデザインを使ってロボットを欺くことができるようになります。ダメージが広がる(「ブラスト・ラジアス(被害範囲)」が生じる)のは、フェンスのデザインが真に変化しておらず、単に再利用されているからです。

新しい解決策:「動的」なワンタイム・ロック

この論文は、大幅なアップグレードである**ダイナミック・セパレーター生成(Dynamic Separator Generation)**を提案しています。

「箱からフェンスを選ぶ」のではなく、このシステムはリクエストごとに、全く新しい、ユニークなフェンスを構築します

  • 仕組み: あなたがロボットに質問をするたびに、システムは「正確な時刻」、「あなたのユニークID」、そして「その瞬間だけに生成された乱数」を確認します。これらを数学的なレシピ(SHA-256と呼ばれるもの)を用いて混ぜ合わせ、「開始」と「終了」のマーカーとなる、唯一無二の印を作成します。
  • 比喩: あなたが手紙を送っている場面を想像してください。
    • 旧来の方法: 標準的な赤い封筒を使用します。もし泥棒が赤い封筒を盗んだら、後で手紙を偽造するためにそれを使うことができます。
    • 新しい方法: あなたは、ボタンを押した瞬間の時刻に基づいた、ユニークで再現不可能な封筒を作成するマジック・プリンターを使用します。たとえ泥棒が手紙#1の封筒を盗んだとしても、手紙#2には全く異なる、予測不可能な封筒が使われるため、その盗まれた封筒は役に立ちません。

研究チームの発見

チームは、強力なAIモデル(Llama-3.3)に対して、16種類の異なるハッカーの手口を用いてこの新しい「ダイナミック」な手法をテストしました。

  1. 「リートスピーク(Leetspeak)」トリックの阻止: 特定のハッカーの手口(M1と呼ばれる)は、AIを混乱させるために秘密のコードや緊急な言葉を使用します。
    • 以前: AIは88%の確率でこれに陥っていました。
    • 後: AIがこれに陥る確率は38%に減少しました。これは大幅な改善(安全性において2倍以上の向上)です。
  2. 「フォーマット・ブレイクアウト」トリックの阻止: もう一つのトリックは、AIにフェンスのマーカーをハッカーに繰り返させるように仕向けるものです。
    • 以前: AIは47%の確率でフェンスのマーカーを誤って公開してしまっていました。
    • 後: AIがそれらを公開することは**0%**になりました。フェンスがその瞬間限りのユニークなものであるため、それを公開しても、将来のリクエストに対してハッカーに役立つことはありません。
  3. 速度: この新しい手法は非常に高速です。リクエストの処理にかかる時間に加わるのは、わずか2.7マイクロ秒(まばたきの極めて小さな断片)だけです。非常に速いため、気づくことすらできません。
  4. 品質: テキストの要約や質問への回答といった、ロボットの本来の仕事の能力が悪化することはありませんでした。以前と同様にうまく機能しました。

ただし、一つだけ注意点があります(限界)

この論文は、この手法では解決できないことを一つ認めています。それは、ハッカーがロボットに対して「フェンスのマーカーを私に繰り返してください」と明示的に命じた場合、ロボットは依然としてそれを行ってしまう可能性があるということです。

  • 解決策: 研究者たちは、これは現在のレイヤーにおける根本的な限界であると述べています。これを防ぐには、ロボットの回答が外に出る前に、回答をチェックする追加の「セキュリティ・ガード(警備員)」が必要になりますが、それは今回の特定の研究の範囲外でした。

まとめ

この論文は、AIエージェントに新鮮で、ユニークな、一度限りの使い捨てのフェンスを与えることで、AIをより安全にする方法を紹介しています。もしハッカーがフェンスを盗んだとしても、次の会話では全く異なるフェンスが使われるため、その盗まれたフェンドは無価値になります。これは、高速で、簡単に導入できるアップグレードであり、AIが騙される可能性を大幅に減少させます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →