← 最新论文
💬 NLP

Unintended Memorization of Sensitive Information in Fine-Tuned Language Models

本文系统地研究了微调大语言模型中模型输入端敏感个人可识别信息(PII)的无意记忆现象,并评估了四种缓解策略的隐私与效用权衡,结果表明,尽管差分隐私在特定设置下具有极强的泄露削减能力,但后训练方法通常能提供更一致的保护。

原作者: Marton Szep, Jorge Marin Ruiz, Georgios Kaissis, Paulina Seidl, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer, Daniel Rueckert

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Marton Szep, Jorge Marin Ruiz, Georgios Kaissis, Paulina Seidl, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer, Daniel Rueckert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:那位“过度专注的学生”

想象一下,你雇佣了一位非常聪明的学生(大语言模型)来学习一项特定的工作,比如编写医疗摘要。你给了他们一叠病历让他们学习。

问题不在于这个学生不擅长这项工作,而在于他们太擅长记忆了。尽管你只要求他们学习“诊断结果”和“治疗方案”,但他们连患者的名字、手术的具体日期以及住址也一并背了下来。

这篇论文研究了一个特定且隐蔽的危险:如果学生记住了那些本不该成为答案的一部分的信息,该怎么办?

在这种情况下,患者的名字(个人身份信息,简称 PII)出现在“问题”(输入)中,但“答案”(输出)理应只是医疗事实。论文提出了一个问题:如果有人诱导这个学生把问题复述出来,学生会不会不小心泄露那个秘密的名字?

实验方法:“真前缀”陷阱

为了测试这一点,研究人员使用了一种叫做**“真前缀攻击”(True-Prefix Attack)**的技巧。

这就像是在玩“接龙游戏”:

  1. 设置: 研究人员拿取一份真实的病历。
  2. 陷阱: 他们在患者名字出现之前的地方切断文件。
  3. 测试: 他们问 AI:“这是目前的故事内容:[患者病史]……接下来是什么?”

如果 AI 处于“记忆状态”,它会自信地说出患者的名字,尽管这个名字并不是它在训练任务中应该学习的内容。研究人员发现,经过微调的模型就像是那些逐字背诵教科书的学生;一旦给出前几个词,他们就会不由自主地背诵剩下的内容,包括那些秘密。

他们的发现

1. 频率并不重要(“罕见姓名”的惊喜)
你可能会想:“如果一个名字在训练数据中出现了 100 次,它就会被记住 100 次。”

  • 现实情况: 论文发现事实并非如此。一个仅出现过一次的名字,其被泄露的可能性可能与出现过 50 次的名字一样高。这不在于学生看到了多少次这个名字,而在于这个名字在句子中的位置,以及学生如何将其与故事联系起来。

2. 语言很重要
研究人员用七种不同的语言测试了这位“学生”。

  • 现实情况: 学生在英语和西班牙语中更容易意外泄露名字,而在德语、意大利语或瑞典语中则较难。这就像是学生在记忆秘密时有自己的“母语偏好”,即使学习的是同样的内容。

3. 更大的学生 = 更大的记忆力
他们测试了不同规模的“学生”(从小型到大型)。

  • 现实情况: 更大的模型(拥有更强的“脑力”)天生就更擅长记忆,即使没有经过专门训练。然而,当你对它们进行“微调”(教它们一项新工作)时,较小的模型有时反而比大的模型更容易对这些秘密产生“痴迷”。这有点难以预测。

“防泄密”补救措施

研究人员尝试了四种不同的方法来阻止学生泄露秘密。你可以把这些看作是不同的教学方法:

  1. 差分隐私(“静态无线电”):

    • 运作方式: 他们在训练数据中加入随机噪声,就像无线电里的静电噪音一样,让学生无法清晰地听到细节。
    • 结果: 它在隐藏秘密方面效果很好(有时能减少 60% 的泄露),但会让学生变得有些“迟钝”,从而影响其完成实际工作的能力。此外,这种方法很难调节;噪声过多,学生就学不到任何东西。
  2. 机器遗忘(“删除键”):

    • 运作方式: 他们明确告诉学生:“你必须忘记这些特定的名字。”
    • 结果: 这种方法在消除秘密方面表现尚可,但不够稳定。有时学生虽然忘记了名字,但也忘记了如何正确完成工作。
  3. 正则化(“严厉的老师”):

    • 运作方式: 在训练期间,每当学生试图专注于那些秘密名字时,老师就会对其进行惩罚。
    • 结果: 这像是一场拉锯战。学生既要努力完成工作,又要试图记住名字。这种方法通常无法完全阻止泄密。
  4. 偏好对齐 / DPO(“伦理教练”):

    • 运作方式: 他们向学生展示“好的答案”(不含名字)和“坏的答案”(含有名字),并说:“我更喜欢没有名字的那一个。”
    • 结果: 这是最一致有效的方法。它在显著降低泄密风险的同时,保持了学生完成工作的能力,尤其是在学生进行“即兴发挥”(采样)而非仅仅是“机械复述”(贪婪解码)的时候。

核心结论

论文得出结论:在敏感数据上对 AI 进行微调是有风险的。 即使你认为你只是在教 AI 医疗事实,它也在偷偷记忆与之相关的姓名和日期。

  • 好消息: 像“伦理教练”(DPO)和“静态无线电”(差分隐私)这样的方法可以帮助降低风险。
  • 坏消息: 没有一种方法是完美的。即使是最好的方法,也只能降低约 40%–60% 的风险。学生仍然会记得一些秘密。

作者警告说,在开发出更好的方法来阻止这种“非预期记忆”之前,我们在将这些 AI 模型用于真实的、私密的个人数据时需要非常谨慎。

他们没有声称的事项

  • 他们没有说这适用于所有类型的 AI 或所有规模的模型(他们主要测试了参数量在 120 亿以下的模型)。
  • 他们没有声称合成(虚构)数据是真实数据的完美替代品,尽管他们使用了合成数据来验证理论。
  • 他们没有提出新的医疗方案或诊断方法;他们的目标纯粹是测试 AI 的“隐私性”,而不是其医疗准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →