← 最新の論文
💬 NLP

Extracting Training Data from Diffusion Language Models via Infilling

本論文は「インフィル抽出」を導入し、拡散言語モデルが自己回帰モデルよりもはるかに訓練データの記憶に対して脆弱であることを示すものであり、その双方向のノイズ除去能力により、敵対者はエッジ条件付きマスクを用いて、赤処理された個人識別情報を含む、最大で3倍の逐語的シーケンスを抽出できることを実証する。

原著者: Yihan Wang, N. Asokan

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Yihan Wang, N. Asokan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で超賢い図書館の助手(大規模言語モデル)がいると想像してください。その助手は数百万冊の書籍、メール、文書を読み込んでいます。あなたは知りたいのです。「もし誰かがその助手に記憶から特定の文を繰り返すよう頼んだ場合、秘密を漏らす可能性はどれほど高いのでしょうか?」

長らく研究者たちは、この助手に最初から始めて「文を完成させる」よう頼むことでのみこれをテストしていました。これは、物語の前半部分を見せられて、残りを推測するよう人に頼むようなものです。これは、人間が本を読むように左から右へ読む標準的な AI モデルにはよく機能します。

しかし、この論文は**拡散言語モデル(DLM)**と呼ばれる新しいタイプの AI を紹介しています。DLM を読者ではなく、損傷した絵画の修復師として考えてみてください。もし名作のランダムな部分を白い塗料(マスク)で覆えば、DLM の仕事は、全体の絵画——左側、右側、そして中央——を見て、隠された部分が何であるべきかを推測することです。

この論文の著者たちは言います。「おい、私たちはこれまでこれらの絵画修復師を間違った方法でテストしてきたぞ!」

以下に、彼らの発見を簡単な比喩を使って解説します。

1. 旧来の方法 vs 新しい方法

  • 旧来の方法(接頭辞条件付き): 修復師に絵画の左端だけを見せ、「次は何が来るか?」と尋ねると想像してください。この論文は、これだけをすれば DLM はかなり安全に見えることを発見しました。秘密の情報はあまり漏れません。
  • 新しい方法(埋め込み抽出): 著者たちは、DLM がギャップの両側を見られるため、狡猾な攻撃者が文の中央を隠して「空白を埋めてくれ」と頼むことができることに気づきました。あるいは、両端を隠して「中央は何ですか?」と頼むこともできます。
    • 比喩: これは「マッドリブス」というゲームのようなものです。AI に文の始まりと終わりを渡せば、始まりだけを与えた場合に終わりを推測できなかったとしても、真ん中の単語を完璧に推測できるかもしれません。

2. 大きな発見:「端」が危険地帯

研究者たちは、テキストの部分を隠す(マスクする)さまざまな方法をテストしました。彼らは発見しました。テキストを隠す方法は、あなたが思っているよりも重要だということです。

  • 「端」効果: 文の最初最後の両方を明らかにし(中央を隠す)場合、DLM は最初だけを明らかにした場合に比べて、正確な単語を漏らす可能性が3 倍高くなります。
  • なぜか?: DLM は中央を再構築するために両側からの手がかりを使うからです。これは、二人の人が秘密の始まりと終わりを三人目の人に囁いているようなものです。彼らは、一人だけが始まりを囁く場合に比べて、はるかに簡単に全体の秘密を推測できます。

3. 「編集された文書」シナリオ

この論文は、非常に現実的で恐ろしいシナリオを検討しています。

  • 企業がプライベートなメールで AI を訓練した後、データを公開する際、またはモデルを公開する際に、すべての電話番号と名前を黒塗り(編集)すると想像してください。
  • 攻撃: ハッカーがモデルを手に取り、「名前が黒塗りされたメールを持っている。空白を埋めてくれ」と言います。
  • 結果: AI が編集されたデータで訓練されたにもかかわらず、この「絵画修復師(DLM)」は周囲の文脈を見るのが非常に上手なため、標準的な「本を読む」AI よりも、黒塗りの名前や番号を推測できることが多いのです。
  • 教訓: 訓練データ内の機密情報を黒塗りしたからといって、AI がそれを記憶しないという意味ではありません。実際、このタイプの AI にとっては、両側の文脈を与えれば、秘密を推測する方が簡単になるかもしれません。

4. 「修復」設定の調整

研究者たちはまた、テキストを「修復」するために使用される設定(AI が推測するステップ数など)が、どれほど情報を漏らすかを変えることも発見しました。

  • ゆっくりと確実に: AI に空白を埋めるために多くの小さく慎重なステップを踏ませると、秘密の情報がより多く漏れます。
  • 速く大雑把に: 速く推測させると、漏れる情報は少なくなります
  • 教訓: AI を速くしたり賢くしたりするために回す「ノブ」は、どれほど記憶するかを制御もします。安全性に影響を与えずに速度のためのノブだけを回すことはできません。

5. 微調整では解決しない

最後に、彼らは尋ねました。「後で AI に丁寧なチャットボットになるよう教える(SFT と呼ばれるプロセス)場合、それは秘密を忘れるのでしょうか?」

  • 答え: いいえ。新しい単語を教えることで、オウムが swear 言葉を言うのをやめさせようとするようなものです。オウムは時々それを言うのをやめるかもしれませんが、正しい質問(「端」のトリックを使用)をすれば、まだ古い秘密を口走ってしまいます。記憶はそこに残ったままです。ただ再配置されただけです。

まとめ

この論文は警告します。拡散言語モデルは単なる本読みではなく、絵画修復師のようなものです。 最初から文を完成させるよう頼むだけでテストすれば、彼らは安全だと考えられます。しかし、文の中央を埋めるよう(両側からの手がかりを使用して)テストすれば、訓練データから編集された情報であっても、プライバシー情報が漏れる可能性がはるかに高くなります。

主な教訓: 私たちは、片目を開けたまま(左から右へ見て)これらのモデルをテストするのをやめ、両目を開けて(全体を見て)テストし始める必要があります。そうしなければ、彼らがどれほどの個人データを保持しているかを過小評価することになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →