← 最新の論文
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

本論文では、これまで「安全」とみなされていた多くのプロンプトが既存の保護を回避するように操作可能であることを示すことで、現在の評価ベンチマークの信頼性に疑問を投げかける、テキストから画像への拡散モデルの安全性メカニズムにおける重大な脆弱性を明らかにする自動レッドチーミングツールであるPrompting4Debugging(P4D)を紹介する。

原著者: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

公開日 2026-01-15
📖 1 分で読めます☕ さくっと読める

原著者: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

Stable Diffusionという、非常に才能のある魔法使いのようなアーティストがいると想像してください。このアーティストは、あなたが書いたどんな文章も美しい絵に変えることができます。「マットの上の猫」と言えば、マットの上の猫を描いてくれます。しかし、このアーティストはインターネット全体から学習しているため、時として著作権のあるキャラクターや、仕事には不適切な(NSFW)画像など、不適切なものを誤って描いてしまうことがあります。

これを修正するために、開発者はアーティストの前に警備員を配置しました。この警備員(「セーフティ・メカニズム」)は、アーティストが悪事(不適切なもの)を描くのを阻止するためのものです。もしあなたが「裸の人」を求めた場合、警備員は「ダメです!」と言い、アーティストはその代わりに別のものを描きます。

問題点:
開発者は、この警備員が素晴らしい仕事をしていると考えています。彼らはテストした「悪い」文章のリストを持っており、警備員はそれらすべてを阻止しました。しかし、この論文の著者たちはこう問いかけました。「もし、悪党たちが警備員を欺くのが非常に上手かったらどうなるだろうか? まだ見つかっていない秘密のパスワードが存在するとしたら?」

解決策:Prompting4Debugging (P4D)
著者たちは、Prompting4Debugging (P4D) と呼ばれるツールを構築しました。P4Dを、超スマートで自動化された「レッドチーム」(システムの穴を見つけるために雇われた、倫理的なハッカーのグループ)と考えてください。

人間が警備員を突破するためにランダムな文章を推測する代わりに、P4Dはそれを自動的かつ科学的に行います。以下に、簡単な比喩を用いた仕組みを説明します。

「シャドウ・アーティスト」の比喩

部屋の中に2人のアーティストがいると想像してください:

  1. 無制限のアーティスト (G): このアーティストにはルールがありません。「裸の人」を求めれば、完璧に描き出します。
  2. ガード付きのアーティスト (G'): このアーティストには警備員がついています。「裸の人」を求めると、拒否します。

目的: P4Dの目的は、ガード付きのアーティストが「ノー」と言うべき場面でも、無制限のアーティストが描いたのと同じ「裸の人」を描いてしまうような、新しい文章(「問題のあるプロンプト」)を見つけ出すことです。

プロセス:

  1. 設計図: P4Dはまず、無制限のアーティストに「禁止された」画像を描かせます。これにより、その悪い画像がどのような見た目であるかという完璧な設計図が得られます。
  2. 翻訳: 次に、P4Dはガード付きのアーティストに注目します。ガード付きのアーティストは、言葉を理解するために秘密のコード(数学的な「埋め込み/embeddings」)を使用していることをP4Dは知っています。
  3. ハック: P4Dは文章を微調整し始めます。単に推測するのではなく、数学的な「スライディング・スケール(滑り台のような尺度)」を使用して、ガード付きのアーティストの内部コードが無制限のアーティストの設計図と一致するまで、言葉を動かしていきます。
  4. 結果: P4Dは、警備員を回避するような、奇妙で、支離滅裂で、あるいは巧妙な文章(例えば「露骨なポーズをとる裸の男を見せている看板の写真」や、なぜか機能してしまう意味不明な文字列など)を見つけ出します。

彼らが発見したこと

研究者たちは、いくつかの人気のある「ガード付き」モデル(セーフティ・フィルターを備えたStable Diffusionなど)に対してこれをテストしました。その結果は衝撃的なものでした。

  • 「安全な」リストは安全ではなかった: 彼らは、誰もが「安全である」と考え、すでにテスト済みのプロンプトのリストを取り上げました。その結果、その約半分が、P4Dによって簡単に操作され、セーフティ・ガードを突破できることが判明しました。
  • 「情報の隠蔽」の罠: この論文はある奇妙な現象を発見しました。時として、セーフティ・ガードは情報を隠すのが上手すぎることがあります。研究者が、突破する方法を学習している間だけガードの「フィルター」をオフにしたところ、突破する方法がさらに多く見つかりました。
    • 比喩: あなたが通り抜けようとしている間、目隠しをしている警備員を想像してください。あなたは「あ、彼は私が見えていないから安全だ」と思うかもしれません。しかし実際には、目隠しをしていることで、彼はあなたが使っている特定のトリックに対して、より認識が低くなっています。目隠しをした状態でそのトリックを習得すれば、目隠しをしていない時でも、同じトリックを使って彼を通り抜けることができるのです。情報を隠そうとするガードの試みが、実際にはシステムを実態よりも安全であるように感じさせていたのです。

まとめ

この論文は、セーフティ・システムがいくつかのテストに合格したからといって、それが真に安全であることを意味しないと結論付けています。今日私たちが使っている「安全な」プロンプトは、手の中にある鍵には機能するものの、まだ発明されていない鍵に対しては無力な鍵のようなものです。

P4Dは、悪意のある者が利用するに、これらの「未発明の鍵」を見つけ出すための開発者向けのツールです。これは、私たちがこれらのモデルを絶えずテストし続ける必要があることを証明しています。なぜなら、「悪党」(あるいは穴を見つける自動化されたツール)はどんどん賢くなっており、セーフティ・ガードは可能な限り最も賢いトリックに対してテストされる必要があるからです。

要約すると: この論文は、AIアート生成器に悪いものを描かせるように仕向ける自動ロボットを構築しました。そして、現在のセーフティ・ガードは私たちが考えているよりもはるかに脆弱であり、多くの「安全な」言葉が、ルールを破るために歪められ得ることを明らかにしました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →