← 最新论文
💬 NLP

Extracting Training Data from Diffusion Language Models via Infilling

本文引入“填充提取”方法,以证明扩散语言模型比自回归模型更容易遭受训练数据记忆化攻击,因为其双向去噪能力使攻击者能够利用边缘条件掩码提取出多达三倍的原样序列,其中包括被遮蔽的个人身份信息。

原作者: Yihan Wang, N. Asokan

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihan Wang, N. Asokan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位读过数百万本书籍、电子邮件和文档的巨型、超级智能的图书馆助手(大型语言模型)。你想知道:如果有人要求这位助手从其记忆中复述一个特定的句子,它泄露秘密的可能性有多大?

长期以来,研究人员仅通过让助手“从开头开始补全句子”来测试这一点。这就像向某人展示故事的前半部分,然后让他们猜测后半部分。这种方法对于像人类读书一样从左到右阅读的标准 AI 模型非常有效。

但本文介绍了一种名为扩散语言模型(DLM)的新型 AI。不要把 DLM 想象成读者,而要把它想象成受损画作的修复师。如果你在一幅杰作上随机覆盖白色颜料(即“掩码”),DLM 的任务就是观察整幅画面——左边是什么、右边是什么、中间是什么——并猜测隐藏部分应该是什么。

本文的作者指出:“嘿,我们一直用错误的方式测试这些画作修复师!”

以下是他们研究发现的简要说明,使用了简单的类比:

1. 旧方法与新方法

  • 旧方法(前缀条件): 想象你只向修复师展示画作的左边缘,并问:“接下来是什么?”论文发现,如果只做这种测试,DLM 看起来相当安全。它不会泄露太多秘密信息。
  • 新方法(填充提取): 作者意识到,由于 DLM 可以观察空白处的两侧,狡猾的攻击者可以遮盖句子的中间部分,然后问:“填空。”或者,他们可以遮盖首尾,然后问:“中间是什么?”
    • 类比: 这就像玩“疯狂填词”游戏。如果你给 AI 一个句子的开头和结尾,它可能能够完美地猜出中间的单词,即使你只给它开头时它无法猜出结尾。

2. 重大发现:“边缘”是危险区

研究人员测试了隐藏文本(掩码)的不同方式。他们发现,你如何隐藏文本比你想象的更重要

  • “边缘”效应: 如果你揭示句子的开头结尾(隐藏中间),DLM 泄露确切单词的可能性比只揭示开头时高出三倍
  • 为什么? 因为 DLM 利用来自两侧的线索来重建中间部分。这就像两个人分别向第三个人耳语秘密的开头和结尾;他们比只有一个人耳语开头时更容易推断出整个秘密。

3. “被涂黑的文件”场景

论文探讨了一个非常现实且令人担忧的场景:

  • 想象一家公司在私人电子邮件上训练 AI,但在发布数据或模型之前,将所有的电话号码和姓名都涂黑(遮蔽)。
  • 攻击: 黑客获取该模型并说:“我有一份姓名被涂黑的电子邮件。请填空。”
  • 结果: 即使 AI 是在被遮蔽的数据上训练的,这位“画作修复师”(DLM)在观察周围上下文方面如此出色,以至于它通常能比标准的“读书型”AI 更好地猜出被涂黑的姓名或号码
  • 结论: 仅仅因为在训练数据中涂黑了敏感信息,并不意味着 AI 不会记住它。事实上,对于这种类型的 AI,如果你给它两侧的上下文,它可能更容易猜出秘密。

4. 调整“修复”设置

研究人员还发现,用于“修复”文本的设置(例如 AI 猜测所需的步数)会改变其泄露程度。

  • 慢而稳: 如果你让 AI 采取许多微小、谨慎的步骤来填空,它会泄露更多秘密信息。
  • 快而松: 如果你让它快速猜测,它泄露的更少
  • 教训: 你用来让 AI 变得更快或更聪明的“旋钮”,同时也控制着它记住多少内容。你不能只为了速度而转动一个旋钮,而不影响安全性。

5. 微调无法解决问题

最后,他们问道:“如果我们后来教 AI 成为一个礼貌的聊天机器人(称为 SFT 的过程),它会忘记秘密吗?”

  • 答案: 不会。这就像试图通过教鹦鹉新词来让它停止说脏话。鹦鹉可能有时会停止说那个词,但如果你提出正确的问题(使用“边缘”技巧),它仍然会脱口而出旧秘密。记忆依然存在,只是被重新排列了。

总结

这篇论文警告我们,扩散语言模型就像画作修复师,而不仅仅是读书人。如果你只通过让它们从开头补全句子来测试它们,你会认为它们是安全的。但如果你通过让它们填充句子的中间部分(利用来自两侧的线索)来测试它们,它们泄露私人信息的可能性要大得多,即使这些信息在训练数据中已被遮蔽。

主要结论: 我们需要停止只用一只眼睛(从左到右)测试这些模型,并开始用两只眼睛(观察整幅画面)测试它们,否则我们将严重低估它们所持有的私人数据量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →