← 最新の論文
🤖 machine learning

No Safe Dose: How Training Data Drives Unsafe Image Generation

本論文は、テキストから画像を生成するモデルにおける安全でない出力を直接的かつ単調に駆動するのは、学習データにおける安全でない画像の絶対数ではなくその割合であることを示すとともに、安全フィルタリングが画像の質を低下させることなくモデルの安全性を向上させること、そしてテキストエンコーダも残留リスクに大きく寄与することを明らかにする。

原著者: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に才能のある芸術家に、書かれた説明に基づいて絵を描くことを教えると想像してください。この芸術家は、数百万枚の写真を見て、それらに付随するキャプションを読むことで学習します。

この論文「No Safe Dose(安全な投与量など存在しない)」は、シンプルながら決定的な問いを投げかけます:「学習中に、この芸術家に誤って数枚の悪質または危険な写真を与えてしまった場合、後々、彼が危険な絵を描き始めるようになるでしょうか?」

以下に、研究者たちが発見したことを、シンプルな比喩を用いて説明します。

1. 「腐ったリンゴ」効果

研究者たちは管理された実験を行いました。彼らは、異なる「バスケット」に入った写真を用いて、同じ AI 芸術家を訓練しました。

  • バスケット A: 悪質写真 0%(完全にクリーン)。
  • バスケット B: 悪質写真 1.2%(インターネット上で自然に発見される量)。
  • バスケット C: 悪質写真 5%。
  • バスケット D: 悪質写真 10%。

結果: 訓練用のバスケットに悪質写真を追加するにつれ、AI が生成する悪質画像の数も増加しました。それはランダムな跳躍ではなく、着実で予測可能な上昇でした。訓練データに含まれる「腐ったリンゴ」が多ければ多いほど、AI が生成する「腐ったリンゴ」も多くなるのです。

2. 重要なのは「数」ではなく「比率」

あなたは、「10 万枚の悪質写真が入った巨大なバスケットは、1,000 枚の悪質写真が入った小さなバスケットよりも悪いはずだ」と考えるかもしれません。しかし、この論文はいいえと答えます。

重要なのは、悪質写真の総数ではなく、その割合(比率)です。

  • 比喩: スープに塩を加えることを想像してください。小さなカップのスープに塩を一つまみ加えれば、非常に塩辛くなります。巨大な鍋のスープに塩を一つまみ加えれば、ほとんど気づきません。しかし、巨大な鍋にスプーン一杯の塩を加えれば、それは非常に塩辛くなります。
  • 発見: AI は、訓練データに含まれる悪質アイデアの「濃度」を気にします。データセットが 100 万枚であれ 800 万枚であれ、悪質画像の割合が同じであれば、AI の振る舞いは同じになります。つまり、データセットのサイズに関わらず、安全フィルターは同じように機能します。

3. 「機械の中の幽霊」(回避不可能な下限)

ここが驚くべき点です:研究者たちが訓練データから悪質写真を**100%除去したにもかかわらず、AI は依然として約16.6%**の悪質画像を生成しました。

なぜでしょうか?
AI には 2 つの部分があります:

  1. 画家: 写真から学習する部分(研究者たちがクリーン化しました)。
  2. 翻訳者: ユーザーのプロンプトを読み、画家に何をするべきかを伝える事前学習済みの「テキストエンコーダー」。この翻訳者は、研究者たちが着手する以前に、それ自体が巨大で汚れたインターネットデータで訓練されていました。

比喩: 画家にクリーンな参考写真集を与えても、指示を出す人(翻訳者)が、彼自身が別の汚れた情報源から学んだ危険なアイデアを画家の耳にささやき続けていると想像してください。クリーンな写真集があっても、指示が汚染されているため、画家は依然として間違いを犯します。

研究者たちは、この「翻訳者」をより安全なバージョン(SafeCLIP と呼ばれる)に差し替えることで、悪質画像の生成率を 16.6% から 9.6% まで低下させることができました。これは、最良の結果を得るためには、写真だけでなく指示もクリーン化する必要があることを証明しています。

4. 「敵対的」な秘密

この論文は、この危険性が主に隠れていることを発見しました。

  • 一般ユーザー: 「猫を描いて」や「夕日を絵に」といった(安全な)プロンプトを AI に与えると、AI は悪質データにどれだけ触れていようとも、約 99% の確率で安全な画像を生成します。悪質訓練データは、一般的で友好的な使用においては目に見えません。
  • 悪意ある行為者: 危険な内容の生成を強制しようとする「敵対的」なプロンプトで AI を欺こうとする人だけが、危険性を露呈させます。悪質訓練データは、AI を欺きやすくします。

比喩: AI を城だと考えてください。礼儀正しく正門を通れば、警備員(安全フィルター)があなたを中に入れ、美しい庭が見えます。しかし、「悪質訓練食」を摂っていると、城の壁には隠れた亀裂があり、熟練した泥棒(敵対的プロンプト)だけがそれを見つけ、悪用できるのです。

5. 「品質税」は存在しない

一般的な懸念として、「悪いものをすべてフィルタリングしたら、AI の描画能力は低下するのではないか?」というものがあります。
答え: いいえです。研究者たちは画像の品質(鮮明さやテキストとの一致度などの指標を用いて)を確認し、差はゼロであることを発見しました。データをクリーン化しても、AI が愚かになったり、絵が不恰好になったりすることはありませんでした。これは「無料」の安全向上策でした。

まとめ

  • 悪質訓練データは悪質 AI 出力を引き起こす。 悪質データが多いほど、出力は悪化する。
  • 重要なのは割合である。 小さなデータセットの 10% をクリーン化することは、巨大なデータセットの 10% をクリーン化することと同じ効果がある。
  • 写真だけをクリーン化しても解決しない。 AI の「翻訳者」部分も安全でなければならない。そうでなければ、常に一定レベルのリスクが残る。
  • 一般の人には見えない。 リスクは主に、誰かがシステムを欺こうとしたときに現れる。
  • 安全性は品質を損なわない。 絵を悪くすることなく、AI をより安全にできる。

この論文は結論として、AI を安全にするためには、多層的な防御が必要であると述べています:訓練写真をクリーン化し、安全な「翻訳者」を使用し、システムを欺こうとする人々に対する強力な防御を備えることです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →