← 最新论文
🤖 machine learning

Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning

本文提出了可区分删除(D2\mathrm{D^2}),这是一种通过基于能量的遗忘对齐(EUA)实现的统一范式,它通过在潜在空间中操纵响应分布而非抑制特定令牌来有效擦除不良知识并确保安全拒绝,从而克服了现有知识删除和可区分拒绝方法的局限性。

原作者: Puning Yang, Junchi Yu, Qizhou Wang, Philip Torr, Bo Han, Xiuying Chen

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Puning Yang, Junchi Yu, Qizhou Wang, Philip Torr, Bo Han, Xiuying Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一位超级强迫症图书管理员。这位管理员读过世界上所有的书,并能回答几乎任何问题。然而,有时这位管理员记住了敏感、私密或有害的信息(例如某位名人的秘密生日,或如何制造危险装置的说明),而这些信息他们不应该被允许分享。

本文的目标是教导这位管理员如何真正遗忘这些特定信息,同时不破坏其回答其他所有问题的能力,也不让他们仅仅“假装”遗忘。

作者 Puning Yang 及其同事指出,当前让 AI“遗忘”事物的方法在两个具体方面存在缺陷。他们提出了一种名为**可区分删除(Distinguishable Deletion, D2)的新解决方案,其核心是一种称为基于能量的遗忘对齐(Energy-based Unlearning Alignment, EUA)**的方法。

以下是使用简单类比进行的分解说明:

两种有缺陷的“遗忘”方式

目前,研究人员尝试通过两种方式让 AI 遗忘,但两者都存在重大缺陷:

  1. “红笔”法(知识删除):

    • 工作原理: 想象管理员被告知:“如果有人询问'Basil Mahfouz Al-Kuwaiti'的生日,你绝不可以说出日期。”管理员试图从大脑中抹去"09/05/1997"这些具体词汇。
    • 问题所在: 管理员的大脑是一个错综复杂的连接网络。如果你试图手术式地仅移除这些词汇,可能会意外撕掉整页纸甚至整本书。管理员可能会开始结巴、胡言乱语,或产生幻觉(编造虚假日期),因为他们感到困惑。他们并没有真正遗忘概念;只是破坏了谈论它的能力。
    • 论文主张: 这会导致“有偏见的删除”以及不稳定、乱码般的输出。
  2. “保安”法(可区分拒绝):

    • 工作原理: 管理员将所有书籍保持原样(以便仍能完美回答其他问题)。相反,他们在门口雇佣了一名保安。如果保安听到"Basil"这个名字,就会阻止管理员回答,并说:“我不能谈论那个。”
    • 问题所在: 管理员仍然知道这个秘密。如果一个狡猾的捣乱者(“对抗性攻击”)耳语一个代码词,或以奇怪的方式提问,保安会感到困惑,管理员最终还是会泄露秘密。
    • 论文主张: 这很脆弱。知识依然存在,等待着被诱骗出来。

新解决方案:可区分删除(D2)

作者提出了第三种方式。他们不想抹去特定词汇或雇佣保安,而是希望改变管理员针对该特定主题的内部“状态”置信度

他们引入了一个名为**“能量指数”**的概念。

  • 类比: 将“能量”想象成一个置信度计
    • 当管理员知道一个事实(例如“巴黎在法国”)时,置信度计显示低能量(从物理学角度看,低能量意味着稳定、舒适的状态)。他们非常确定。
    • 当管理员不知道某事时,置信度计显示高能量(高能量意味着混乱、不稳定的状态)。他们感到不确定和随机。

目标: 作者希望训练管理员,使其在被问及秘密生日时,内部“置信度计”飙升至高能量(混乱/不确定性)。这向系统发出信号:“我对这个问题没有结构化、自信的答案。”

他们如何实现:基于能量的遗忘对齐(EUA)

为了实现这一目标,他们采用了一个两步过程:

  1. 训练“状态”(学习阶段):
    他们不只是告诉模型“不要说出日期”。他们教导模型识别,关于秘密主题的问题在内部应感觉“不舒服”或“不确定”。

    • 他们创建了一个自偏好边界。想象管理员对自己所知的内容有一个自然的“舒适区”。系统根据模型自身的自然倾向,自动计算出“舒适知识”与“不适未知”之间的界限。
    • 他们迫使模型将“秘密”问题推入“不适”区域。
  2. 拒绝机制(行动阶段):
    一旦模型训练完成,它就拥有了清晰的边界。

    • 普通问题: “法国的首都是什么?” -> 模型感觉低能量(舒适) -> 它自信地回答。
    • 秘密问题: "Basil 的生日是什么?” -> 模型感觉高能量(不适/混乱) -> 系统检测到这种飙升并触发礼貌的拒绝:“由于隐私限制,我无法回答此问题。”

为什么这更好(结果)

论文声称这种新方法更优越,因为:

  • 这是真正的遗忘: 与“保安”法不同,知识实际上被破坏了。模型不仅仅是隐藏答案;它失去了生成答案所需的自信内部结构。
  • 它是稳定的: 与“红笔”法不同,模型不会开始胡言乱语。它知道如何礼貌且连贯地说“我不知道”。
  • 它是鲁棒的: 即使有人试图用越狱提示(奇怪的提问方式)欺骗模型,模型内部的“高能量”警报仍然会响起,并拒绝回答。

总结

本文提出了一种通过改变 AI 的内部置信度而不仅仅是删除词汇或添加保安,来使其遗忘敏感信息的方法。

  • 旧方法: “不要说出‘生日’这个词!”(导致 AI 结巴并崩溃)。
  • 旧方法 2: “如果你听到‘生日’,停止说话!”(AI 仍然知道秘密,且可能被诱骗)。
  • 新方法(D2): “当你想到‘生日’时,感到不确定和混乱。”(AI 自然地拒绝回答,因为它感觉像是不知道,并且这样做既安全又一致)。

作者在多种模型(如 LLaMA 和 Qwen)上测试了这种方法,发现它在去除有害知识的同时,能更好地保持 AI 在其他所有方面的聪明和乐于助人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →