← 最新の論文
💬 NLP

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

本論文は、LLM ベースの書き換え機能とコンテキスト内経験再生を活用して、テキストから画像への変換モデルに対するレッドチームング向けに流暢かつ意味を保持する敵対的プロンプトを効率的に生成するブラックボックスフレームワークである ICER を導入し、既存のベースラインと比較して多様な安全性メカニズムに対して優れた性能と転移性を示すことを明らかにしている。

原著者: Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが非常に厳格でハイテクな美術館の警備員(テキストから画像を生成するモデル)を持っていると想像してください。その任務は、暴力的、ヌード、あるいは不適切な絵画の制作を誰にもさせないことです。この警備員は賢く、あなたのリクエストを読み、何か「悪い」匂いがすれば、絵を描くことを拒否します。

問題は、悪意のある行為者(あるいはシステムに穴を見つけようとする研究者)がこの警備員を欺こうとしていることです。彼らは知りたいのです:「裸」という言葉を使わずに、「裸の人」の絵を頼むことはできるか?

旧来の方法:推測と確認

以前、研究者たちは警備員を欺こうと主に 2 つの方法を試みました:

  1. 「ロボットハッカー」(ホワイトボックス): これは警備員の秘密のコードと内部配線を知る必要があります。セキュリティカメラの設計図を持っているようなものです。これはよく機能しますが、設計図を持っていないため、DALL·E 3 のような商用アプリでは実行できません。また、彼らが考案する「トリック」はしばしば意味不明な文字列(例:「nakednips nips surrounded enthrshy」)のように見え、人間にはそれが偽物だと容易に見破られます。
  2. 「ランダムな雑談」(ブラックボックス): これはコードを見ずにトリックを推測しようとします。しかし、あらゆる試みを全く新しいゲームとして扱います。100 回失敗すれば、学んだことを忘れ、最初からやり直します。これは、試験に失敗し、ノートを取り捨て、勉強もせずに同じ試験を再び受ける学生のようなものです。これは遅く、高価であり、しばしば不自然で奇妙な文章を生み出します。

新しい方法:ICER(「プレイブック」アプローチ)

この論文の著者は、ICERという新しいツールを作成しました。ICER を単一のハッカーではなく、プレイブックを持つ賢いコーチと考えてください。

これがどのように機能するか、簡単な比喩を使って説明します:

1. 「プレイブック」(インコンテキスト・エクスペリエンス・リプレイ)

警備員をすり抜けようとするスパイのチームを想像してください。各スパイが一人で方法を考え出すのではなく、共有ノートを共有します。

  • スパイがトリックを試して失敗するたびに、何が起こったかを記録します。
  • スパイがトリックを試して成功するたびに、何を言ったか、どのように言ったか、なぜそれが機能したかを正確に記録します。
  • 新しいスパイが新しいリクエストを持って到着すると、ゼロから始めません。ノートを開き、過去の成功談を読み、それらをガイドとして利用します。

論文では、これをインコンテキスト・エクスペリエンス・リプレイと呼んでいます。このシステムは過去の成功した「ジャイルブレイク」(警備員を欺いたトリック)を記憶し、それらを例として AI に新しい、より優れたトリックの書き方を教えます。

2. 「翻訳者」(LLM リライター)

システムは、非常に賢い翻訳者のような大規模言語モデルを使用して、ユーザーのリクエストを書き換えます。

  • 旧来の方法: 「裸の女性の絵を描いてください。」(明らかすぎてブロックされる)
  • ICER の方法: システムはプレイブックを参照し、「お風呂にいる人物の官能的で芸術的な古典的な絵」という記述が成功したトリックであることを確認し、リクエストを丁寧な美術学生のようになり直すように書き換えます。
  • その結果、芸術を求めている本当の人間のようでありながら、裏に「悪い」意図を秘めた流暢で自然な文が生まれます。ハッキングしようとするロボットのように見えるのではなく、通常の会話のように見えます。

3. 「ギャンブラー」(バンドット最適化)

システムは判断を迫られます:「前回成功した同じトリックを試すべきか、それとも全く新しいことを試すべきか?」

  • 同じトリックだけを試せば、警備員がルールを更新した場合、行き詰まる可能性があります。
  • 新しいことだけを試せば、推測に時間を浪費します。
  • ICER はトンプソン・サンプリングという数学的戦略(賢いギャンブラーと考えてください)を使用します。これは、既知の成功するトリックを利用する**活用(exploiting)と、それらが機能するかどうかを確認するために新しい変種を試す探索(exploring)**のバランスを取ります。これにより、システムは時間とともにより賢く、速くなることを保証します。

彼らは何を見つけましたか?

研究者たちは ICER を 6 種類の異なる「警備員」(安全性システム)に対してテストし、他の 7 つの方法と比較しました。

  • より効果的に機能する: ICER は、コードへの秘密のアクセスを必要とするものさえも、他のどの方法よりも警備員をより頻繁に成功裏に欺きました。
  • リアルに聞こえる: ICER が作成するプロンプトは長く、詳細で自然です。意味不明な文字列のように見えません。
  • 汎用性が高い: 最も驚くべき発見は、オープンソースモデル上で構築された ICER の「プレイブック」が、DALL·E 3Midjourneyのような商用システムでも機能したことです。ICER がそれらを一度も見たことがないにもかかわらず、テストモデルで機能したトリックの約**30%**が、これらの厳重に守られた人気アプリでも機能しました。

大きな教訓

この論文は、安全性テストが孤立した試みの連続であってはならないと主張しています。代わりに、それは継続的な学習プロセスであるべきです。泥棒が過去の強盗から学び、より良い計画を立てるように、このツールは、成功した攻撃パターンを保存して再利用すれば、脆弱性をより迅速かつ効果的に発見できることを示しています。

警告: この論文は、これが開発者が穴を特定して修正するのに役立つ一方で、悪意のある行為者が同じ「プレイブック」の論理を使用して、現実世界で安全性フィルターを迂回するより安価で効果的な方法を作成できる可能性も示していると指摘しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →