← 最新の論文
🤖 machine learning

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

本論文は、多様な攻撃者ペルソナを活用して転移可能なジャイルブレイクを発見し、豊富なメタデータを含むデータセットを生成するレッドチームングフレームワークであるペルソナ条件付敵対的プロンプティング(PCAP)を導入し、それによって効果的な自動アライメントを可能にし、ターゲットとした微調整を通じてモデルの堅牢性を大幅に向上させる。

原著者: Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの、まだ未熟なロボットに、危険な手口を見分ける方法を教える場面を想像してください。そのロボットは大規模言語モデル(LLM)であり、現在、安全規則を回避するために質問の言い回しを熟知した人々によって、だまされています。

この論文は、PCAP(Persona-Conditioned Adversarial Prompting:ペルソナ条件付敵対的プロンプト)と呼ばれる新しい手法を紹介しています。その仕組みを、簡単なアナロジーを用いて説明します。

問題:「一芸に秀でた馬」のような攻撃者

以前、これらの安全上の欠陥(「レッドチーム化」と呼ばれる)を発見しようとしていた自動化システムは、特定の一種類の鍵開けしかチェックしない警備員のようなものでした。彼らは同じ数少ない手口を繰り返し試していました。

  • 結果: いくつかの欠陥は見つかりましたが、実際の悪意ある行為者が使う巧妙で現実的な手口は見逃されていました。これは、城の防御力をテストする際に、正面の壁を登る試行だけを行い、裏口からパン屋に扮して忍び込む可能性を無視しているようなものです。

解決策:「方法演技」のアプローチ

PCAP は、攻撃者ロボットに「衣装と台本」を与えることでゲームのルールを変えます。単なる一般的な「ハッカー」ではなく、特定の目的を持つ特定の人物(ペルソナ)になりきるよう指示されます。

  • ペルソナ: ロボットがさまざまな仮面を被ると想像してください。時には学校のプロジェクトのための質問をする「好奇心旺盛な学生」として振る舞います。時には医学的な謎を解こうとする「不機嫌な医師」として振る舞います。また、時にはトラブルを引き起こそうとする「悪意ある行為者」として振る舞います。
  • 戦略カード: 衣装に加えて、ロボットは「戦略カード」のデッキを受け取ります。これらは、どのように話すかを教えるカンニングペーパーのようなものです。あるカードには「本心を隠すために歴史的な物語を使う」と書かれているかもしれません。別のカードには「質問を小さく無害な断片に分割する」と書かれているかもしれません。

仕組み:並列プレイグラウンド

1 体のロボットがシステムを破壊しようとするのではなく、PCAP は複数の並列プレイグラウンドを設定します。

  1. セットアップ: 学生、教師、ハッカーなど、例えば 6 種類の異なる「俳優」を作成します。
  2. 探索: 各俳優は、独自の声と特定の戦略セットを用いて、ターゲットのロボットをだまそうとします。
  3. 発見: 彼らが同時にさまざまなことを試みているため、安全上の欠陥をより多様に発見できます。
    • アナロジー: ダムのひび割れをすべて見つけたい場合、岩を一つ投げるだけでは不十分です。水、砂、氷、つる植物を、さまざまな角度から投げかけます。PCAP は、これらすべての異なる「素材」を同時にロボットに投げかけます。

結果:より多くの欠陥を、より速く発見

この手法は、非常に強力なロボット(GPT-OSS 120B)でテストされました。

  • PCAP 以前: 従来の手法では、安全規則を破る方法が**57%**の確率で見つかりました。
  • PCAP 使用時: 新しい手法では、**97%**の確率で突破されました。
  • 多様性: より頻繁に突破しただけでなく、それを破る2 倍から 6 倍のユニークな方法が見つかりました。10 個の鍵ではなく、100 個の異なる鍵を見つけるようなものです。

最大の利点:「自己修復」ループ

これがこの論文で最も重要な部分です。通常、欠陥を見つけることは最初のステップに過ぎません。その後、人間を雇って修正策を作成する必要があり、それは永遠に続くかのような時間がかかります。

PCAP は修正を自動化します:

  1. 攻撃: 「俳優」がロボットを破り、どのように行ったかを正確に記録します。
  2. 教訓: この論文は、これらの記録された手口を用いてロボットを「微調整(再訓練)」できることを示しています。
  3. 結果: ロボットは、特定の単語ではなく、手口のパターンを認識することを学びます。
    • アナロジー: 「赤い帽子をかぶった人は入れない」と教える代わりに、赤い帽子、青い帽子、緑の帽子をかぶった人々が忍び込もうとする千枚の写真を見せ、忍び込むという概念を学習させます。
  4. 証明: この迅速な再訓練の後、ロボットは驚くほど強靭になりました。攻撃を**99%**の確率で阻止し、誤報(通常の質問への回答を拒否し始めること)はほとんど発生しませんでした。

まとめ

この論文は、完全なサイクルを提示しています:

  1. 発見: 通常のテストでは見逃される安全上の欠陥を見つけるために「方法演技」を行う俳優を使用する。
  2. 生成: これらの手口の膨大なデータセットを自動的に作成する。
  3. 防御: そのデータセットを用いて、ロボットに即座にそれらの手口を見分け、ブロックする方法を教える。

これにより、弱点の発見と修正のプロセスが、高速で自動化されたループへと変わり、AI を以前よりもはるかに迅速に安全なものにします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →