← 最新论文
💬 NLP

Divergence Decoding: Inference-Time Unlearning via Auxiliary Models

本文介绍了发散解码(Divergence Decoding),这是一种推理阶段的遗忘学习方法,它利用小型辅助模型引导大语言模型的逻辑值(logits)远离敏感数据,在以极小效用损失为代价有效缓解隐私和版权风险的同时,提供了一种适用于文本和图像领域的通用型解决方案。

原作者: Humzah Merchant, Bradford Levy

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Humzah Merchant, Bradford Levy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于“Divergence Decoding”(差异解码)论文的解释,采用了简单易懂的语言和日常类比。

问题所在:“无法忘却”的大脑

想象你有一位超级聪明的图书管理员(大型语言模型),他读过世界上所有的书。有时,这位管理员会记住一些特定的、敏感的细节——比如某人的私人日记或受版权保护的故事——而这些是不应该被分享的。

通常情况下,如果你想让图书管理员“忘掉”这个特定的秘密,你有两个糟糕的选择:

  1. 从头开始: 把图书馆烧毁,然后不带那本书重新重建一座。这需要耗费数百万美元和数年的时间。
  2. 脑部手术: 尝试从管理员的大脑中手术式地移除这段记忆。这是有风险的;通常你会意外地破坏他做其他事情的能力,比如写诗或解数学题(这被称为“灾难性遗忘”)。

解决方案:“导盲犬”系统

论文作者提出了一种聪明的新技巧,叫做差异解码 (Divergence Decoding, DD)。他们并不试图改变图书管理员的大脑,而是保留管理员原封不动,并添加两只小巧、专业的“导盲犬”来帮助在对话过程中引导他。

这个系统是如何运作的:

  1. 图书管理员(大模型): 这是我们使用的主要 AI。他无所不知,包括那些我们想要他忘掉的秘密。
  2. 导盲犬 A(“遗忘”模型): 这是一个微型、廉价的 AI,它仅针对我们想要删除的秘密信息进行训练。它对那份特定数据非常痴迷。
  3. 导盲犬 B(“记忆”模型): 这是另一个微型 AI,它仅针对安全的、公开的信息进行训练。它知道除了秘密之外的一切。

它是如何工作的:“方向盘”

当你问图书管理员一个问题时,系统并不仅仅让图书管理员回答。它会询问两只导盲犬,它们认为答案应该是怎样的。

  • 逻辑: 系统会观察导盲犬 A(痴迷于秘密的那只)想要表达的内容与导盲犬 B(安全的那只)想要表达的内容之间的差异。
  • 转向: 如果导盲犬 A 在尖叫着“说出那个秘密!”,而导盲犬 B 在说“不,不要说那个!”,系统就会利用这种差异来引导图书管理员的回答,使其远离秘密,转向安全的版本。

把它想象成开车。图书管理员是汽车。导盲犬是坐在副驾驶位的两个人。一个人指着悬崖(秘密),而另一个人指着道路(安全的答案)。驾驶员(系统)只需将车转向道路的方向,忽略悬崖,而无需重新建造汽车的引擎。

为什么这种方法更好

  • 无需脑部手术: 主图书管理员的大脑保持不变。这意味着他不会失去执行其他任务的能力。
  • 便宜且快速: 训练这两只小型的导盲犬就像训练小狗一样——与重建整个图书馆相比,既快速又廉价。
  • 应对难题: 以前的方法擅长阻止 AI 一字不差地背诵句子,但在处理关于秘密的复杂问题时会失效。这种方法利用了导盲犬的“推理能力”,从而在复杂的思考层面阻止 AI 接触到秘密。

“永久修复”(蒸馏)

论文指出,同时运行三个模型(图书管理员 + 两只狗)会消耗额外的计算资源。如果你想要一个以后只运行一个模型的永久修复方案,可以使用一种叫做蒸馏 (Distillation) 的过程。

想象一下,在导盲犬的引导下,图书管理员写出了一份完美的“小抄”,展示了如何在不涉及秘密的情况下回答问题。然后,你教一个新的单一图书管理员去背诵这份小抄。现在,你就拥有了一个单一的、干净的模型,它已经“学会”了如何遗忘,不再需要导盲犬了。

它有效吗?

作者在两个主要的基准测试(TOFU 和 MUSE)上测试了该方法,这些测试就像是衡量“遗忘能力”的标准考试。

  • 结果: 他们的这种方法击败了所有之前的“最先进 (state-of-the-art)”方法。它在移除秘密的同时,能更好地保持 AI 的聪明程度。
  • 超越文本: 他们还将此应用于图像生成(制作图片)。他们训练 AI “忘记”如何画特定种类的狗。该方法在图像领域同样奏效,成功地阻止了 AI 画出那些狗,同时没有破坏它画其他东西的能力。

总结

与其试图从一个巨大且复杂的脑中抹除一段记忆(这既困难又危险),这篇论文建议保持大脑不变,并使用两只聪明的小助手来轻轻地将对话转向远离禁忌话题的方向。这是一种“学习胜过遗忘”的方法,比以往的方法更便宜、更安全、也更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →