← 最新论文
🤖 machine learning

SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion

SHRED 是一种新颖的、无需保留集的大语言模型机器遗忘方法,它通过自蒸馏识别并降低高信息量 token 的权重,从而选择性地移除记忆内容,在无需精心策划的保留集的情况下实现了遗忘效果与模型效用之间的更优权衡。

原作者: Zizhao Hu, Ameya Godbole, Johnny Tian-Zheng Wei, Mohammad Rostami, Jesse Thomason, Robin Jia

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zizhao Hu, Ameya Godbole, Johnny Tian-Zheng Wei, Mohammad Rostami, Jesse Thomason, Robin Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文SHRED的解释。

核心难题:“遗忘”困境

想象大型语言模型(LLM)是一个拥有超摄影般记忆的学生,它读遍了整个互联网。有时,这个学生会记住一些不该记的东西,比如名人的私人地址、受版权保护的书籍,或是制造炸弹的危险指令。

要解决这个问题,我们通常需要“遗忘”这些特定信息。然而,这里有个陷阱:

  • 旧方法:为了阻止学生记住坏信息,同时又不让他们忘记其他一切(比如如何说英语或做数学题),我们通常必须提供一份包含安全、良好示例的“学习指南”,让他们在遗忘坏东西的同时进行练习。
  • 问题所在:在现实世界中,我们往往没有那份完美的学习指南。创建它既困难又昂贵,还可能无意中给学生带来偏见。如果没有它,试图让学生遗忘通常会导致其“大脑受损”,使其忘记如何正常说话,或拒绝回答无害的问题。

解决方案:SHRED

作者提出了一种名为SHRED(仅通过高惊讶度保留熵降级的自蒸馏)的新方法。这个名字有点拗口,让我们通过一个类比来拆解它。

核心洞察:并非所有单词都同等重要

想象学生正在复述一段他们记住的关于特定事件的故事:

"7 月 4 日约翰·史密斯驾驶一辆红色法拉利去了大峡谷。”

论文发现了一个关于模型如何“思考”这句话的有趣现象:

  1. “无聊”的单词:像"On"、"the"、"to"和"a"这样的词非常常见。模型对这些词非常有信心。它们就像建筑物的脚手架
  2. “被记住”的单词:像"7 月 4 日”、“约翰·史密斯”、“红色法拉利”和“大峡谷”这样的词是具体事实。与那些无聊的词相比,模型对这些具体细节的信心实际上更低,因为它们仅属于那个特定的故事。

SHRED 的核心思想:你不需要擦除整个句子。你只需要针对特定的高价值事实(即脚手架部分),而保留通用的语言结构不动。

SHRED 如何运作(两步流程)

SHRED 是一种“无需保留集”的方法,意味着它不需要外部的学习指南。它利用模型自己的大脑作为老师。

第一步:侦探工作(选择)
模型阅读它需要遗忘的句子。它审视每一个单词,并问自己:“我对这个词感到多惊讶?”

  • 如果模型不惊讶(高概率),那它是一个常见词(如"the")。SHRED 会忽略这些词。
  • 如果模型感到惊讶(低概率),那它是一个具体事实(如“约翰·史密斯”)。SHRED 将这些标记为需要遗忘的目标。

第二步:手术(降级)
随后,模型被训练同时做两件事:

  1. 遗忘目标:它被强制降低对具体事实(例如“约翰·史密斯”)的信心。
  2. 保留脚手架:它被要求保持对常见词(例如"On"、"the")的高信心。

通过这样做,模型学会了“遗忘”特定的秘密,而不会丧失说英语的能力。这就像移除房间里的特定家具,而不去拆毁墙壁。

为何它优于其他方法

论文在四个不同的基准测试(类似于“遗忘”的“期末考试”)中测试了 SHRED 与其他多种方法。以下是他们的发现:

  • 帕累托前沿:想象一张图表,左上角代表“完美分数”(完全遗忘 + 完全效用)。大多数方法都卡在中间或右下角。SHRED 是唯一一种在不需要学习指南(保留集)的情况下就能到达左上角的方法。
  • 无“脑损伤”:其他方法经常导致模型开始拒绝回答问题或胡言乱语。SHRED 保持了模型通用智力的完整性。
  • 幻觉修复:令人惊讶的是,SHRED 实际上降低了模型编造现实世界虚假事实的可能性。通过移除那些“虚假”的已记忆故事,模型的自然知识变得更加清晰。
  • 鲁棒性
    • 重学习:如果你试图通过展示几个例子来诱骗模型再次记住秘密,SHRED 版本的模型比其他模型更难被诱骗。
    • 隐私:黑客很难判断模型是否仍“记得”秘密数据。
    • 稳定性:你可以长时间训练它而不会使其崩溃。

“旋钮”与设置

作者发现了两种主要调整 SHRED 的方式:

  1. “多少”旋钮(P):你可以选择只遗忘前 50% 最具体的单词,或者遗忘 100%。50% 似乎是平衡遗忘与保持模型智能的最佳点。
  2. “批量大小”的惊喜:通常,在 AI 训练中,一次性使用大数据组效果更好。但 SHRED 在极小批量(甚至一次只有一个示例)下效果最好。这就像通过反复练习一个特定动作来学习新技能,而不是做全套锻炼;它有助于模型更精准地进行“遗忘”。

总结

SHRED 是一种巧妙的方法,它能让 AI 遗忘特定秘密,而无需依赖“良好示例”手册来引导。它通过识别承载秘密的特定、独特单词,并温和地降低其重要性,同时保持通用语言结构不变来运作。其结果是,模型成功遗忘了不良数据,但依然聪明、有用且安全可用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →