← 最新の論文
🤖 AI

PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI

本論文は、多様なペルソナをプロンプト生成に統合することで生成型AIの自動化および人間関与型レッドチーム攻撃を強化し、攻撃成功率の向上と創造的かつ効果的な人間とAIの協働を促進するフレームワーク「PersonaTeaming」を導入するものである。

原著者: Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim, Akshita Jha, Lauren Wilcox, Kenneth Holstein, Motahhare Eslami, Leon A. Gatys

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim, Akshita Jha, Lauren Wilcox, Kenneth Holstein, Motahhare Eslami, Leon A. Gatys

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの、時として過剰に礼儀正しいロボットに、弱点を見つけようとしていると想像してください。そのロボットをだまして、意地悪で危険、あるいは偏見に満ちたことを言わせられるかどうかを試したいのです。このプロセスは「レッドチームリング」と呼ばれます。

通常、人間はトリックな質問を使ってロボットを「ジャイルブレイク」しようとしてこれを行います。しかし、人間は疲れてしまいますし、考えられるあらゆるトリックを想像するのは困難です。そこで、科学者たちは他の AI にそのトリックを代行させるようになりました。しかし、これらの自動化された AI は、質問しているのが「誰」なのかを本当に理解することなく、単に言葉を並べ替えるだけのことが多々ありました。

本論文は、PersonaTeaming(ペルソナチームリング)と呼ばれる新しい AI 評価手法を紹介しています。これは、評価用 AI に「マスク」や「キャラクター」を着用させるようなものです。

以下に、簡単な比喩を用いてその仕組みを解説します。

1. 問題:ロボットの「盲点」

評価対象の AI を、非常に厳格なクラブの門番だと考えてみてください。その門番にはルールリスト(安全性ガイドライン)が用意されています。

  • 従来の自動化テスト: ロボットが忍び込もうとする様子を想像してください。それは「入れてください」や「私は VIP です」といったランダムなフレーズをただ試すだけです。効率的ではありますが、少しロボットらしく、予測可能でもあります。
  • 見落としの要素: 実際の人間は単にランダムな質問をするのではなく、特定の視点から質問します。疲れた親、政治戦略家、あるいは好奇心旺盛なティーンエイジャーは、門番を突破しようとする際に、全く異なるアプローチをとるでしょう。従来の自動化テストは、こうした「人間的」な角度を見逃していました。

2. 解決策:「キャラクターのマスク」(PersonaTeaming ワークフロー)

著者たちは、AI に単に「もっと頑張れ」と言うのではなく、評価用 AI に特定のキャラクターになりきるよう指示するシステム、PersonaTeaming ワークフローを開発しました。

  • 「専門家」のマスク: 評価用 AI は「政治戦略家」や「歴史修正主義者」の帽子をかぶります。「政治戦略家は選挙に勝つために真実をどう歪めるだろうか?」と考えます。これにより、門番をだます非常に巧妙で的を絞った方法を見つけることができます。
  • 「一般人」のマスク: 評価用 AI は「専業主婦」や「ヨガインストラクター」の帽子をかぶります。「心配する母親が自宅で銃を保管することについてアドバイスを求めようとするにはどうするか?」と考えます。これにより、専門家が見逃すような別の種類のトリックが見つかります。

結果: 既存の最高水準の手法(RainbowPlus)に対してこれをテストしたところ、「キャラクターのマスク」方式は、より多くの弱点(高い成功率)を発見しつつ、多様なトリック(高い多様性)を生み出しました。まるで単一のロボットではなく、俳優のチームを持っているようなものでした。

3. ツール:「遊び場」(PersonaTeaming プレイグラウンド)

研究者たちは、時にはキャラクターを設計するために実際の人間の助けが必要だと気づきました。そこで、PersonaTeaming プレイグラウンドと呼ばれる対話型ツールを構築しました。

  • 仕組み: 人間のレッドチーム担当者がコンピューターに向かい、独自のキャラクターを作成します。例えば、「私はダンスが大好きな 35 歳の技術者だ」と書くかもしれません。
  • AI の役割: AI はそのキャラクターを受け取り、それに基づいてトリックな質問を生成し始めます。
  • 「火花」: 時には、AI が人間が考えもしなかったようなひねりを提案します。例えば、人間がダンサーについて書いた場合、AI は危険なリクエストを「振り付け計画」として提案するかもしれません。
  • 発見: 研究によると、人間は AI の提案を盲目的に従うわけではありませんでした。むしろ、AI の奇妙なアイデアがスパークプラグのような役割を果たしました。人間がその提案をそのまま使わなかったとしても、それを見ることで「ああ、こうやって試せるかもしれない!」と考えさせられ、自分自身の思考の癖から抜け出す手助けとなりました。

4. 「一人称」と「三人称」のトリック

人間の研究において、興味深い発見がありました。

  • 一人称(「私」): 人間が自分自身に関するキャラクター(例:「私は疲れた母親だ…」)を書く場合、往々にして礼儀正しすぎました。自分の声に近すぎるため、キャラクターに本当に有害なことを言わせることに居心地の悪さを感じていたのです。
  • 三人称(「彼/彼女」): 人間が架空のキャラクターについて書く場合(例:「ジェイクはスパイだ…」)、より安全に感じました。キャラクターから心理的に距離を感じているため、境界線をさらに押し広げることに抵抗が少なかったのです。まるで勇気を与えてくれる衣装を着ているようなものでした。

5. 結論

本論文は、ペルソナが人間の創造性と自動化の速度を繋ぐ架け橋であると結論付けています。

  • 自動化にとって: AI に特定の「キャラクター」を与えることは、他の AI に潜む隠れた危険を見つける能力を大幅に向上させます。
  • 人間にとって: キャラクターを作成できるツールを使うことは、技術的な専門家ではなくとも、AI を評価する新しい創造的な方法を考え出す手助けとなります。

要するに、PersonaTeamingとは、賢い AI をテストする際、それを単なる機械としてだけでなく、人間のアイデンティティという混沌とし、多様で創造的な世界と相互作用する機械としてテストする必要があることを認識することです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →