想象一个大型语言模型(LLM)是一位超级强迫症图书管理员。这位管理员读过世界上所有的书,并能回答几乎任何问题。然而,有时这位管理员记住了敏感、私密或有害的信息(例如某位名人的秘密生日,或如何制造危险装置的说明),而这些信息他们不应该被允许分享。
本文的目标是教导这位管理员如何真正遗忘这些特定信息,同时不破坏其回答其他所有问题的能力,也不让他们仅仅“假装”遗忘。
作者 Puning Yang 及其同事指出,当前让 AI“遗忘”事物的方法在两个具体方面存在缺陷。他们提出了一种名为**可区分删除(Distinguishable Deletion, D2)的新解决方案,其核心是一种称为基于能量的遗忘对齐(Energy-based Unlearning Alignment, EUA)**的方法。
以下是使用简单类比进行的分解说明:
两种有缺陷的“遗忘”方式
目前,研究人员尝试通过两种方式让 AI 遗忘,但两者都存在重大缺陷:
“红笔”法(知识删除):
- 工作原理: 想象管理员被告知:“如果有人询问'Basil Mahfouz Al-Kuwaiti'的生日,你绝不可以说出日期。”管理员试图从大脑中抹去"09/05/1997"这些具体词汇。
- 问题所在: 管理员的大脑是一个错综复杂的连接网络。如果你试图手术式地仅移除这些词汇,可能会意外撕掉整页纸甚至整本书。管理员可能会开始结巴、胡言乱语,或产生幻觉(编造虚假日期),因为他们感到困惑。他们并没有真正遗忘概念;只是破坏了谈论它的能力。
- 论文主张: 这会导致“有偏见的删除”以及不稳定、乱码般的输出。
“保安”法(可区分拒绝):
- 工作原理: 管理员将所有书籍保持原样(以便仍能完美回答其他问题)。相反,他们在门口雇佣了一名保安。如果保安听到"Basil"这个名字,就会阻止管理员回答,并说:“我不能谈论那个。”
- 问题所在: 管理员仍然知道这个秘密。如果一个狡猾的捣乱者(“对抗性攻击”)耳语一个代码词,或以奇怪的方式提问,保安会感到困惑,管理员最终还是会泄露秘密。
- 论文主张: 这很脆弱。知识依然存在,等待着被诱骗出来。
新解决方案:可区分删除(D2)
作者提出了第三种方式。他们不想抹去特定词汇或雇佣保安,而是希望改变管理员针对该特定主题的内部“状态”或置信度。
他们引入了一个名为**“能量指数”**的概念。
- 类比: 将“能量”想象成一个置信度计。
- 当管理员知道一个事实(例如“巴黎在法国”)时,置信度计显示低能量(从物理学角度看,低能量意味着稳定、舒适的状态)。他们非常确定。
- 当管理员不知道某事时,置信度计显示高能量(高能量意味着混乱、不稳定的状态)。他们感到不确定和随机。
目标: 作者希望训练管理员,使其在被问及秘密生日时,内部“置信度计”飙升至高能量(混乱/不确定性)。这向系统发出信号:“我对这个问题没有结构化、自信的答案。”
他们如何实现:基于能量的遗忘对齐(EUA)
为了实现这一目标,他们采用了一个两步过程:
训练“状态”(学习阶段):
他们不只是告诉模型“不要说出日期”。他们教导模型识别,关于秘密主题的问题在内部应感觉“不舒服”或“不确定”。
- 他们创建了一个自偏好边界。想象管理员对自己所知的内容有一个自然的“舒适区”。系统根据模型自身的自然倾向,自动计算出“舒适知识”与“不适未知”之间的界限。
- 他们迫使模型将“秘密”问题推入“不适”区域。
拒绝机制(行动阶段):
一旦模型训练完成,它就拥有了清晰的边界。
- 普通问题: “法国的首都是什么?” -> 模型感觉低能量(舒适) -> 它自信地回答。
- 秘密问题: "Basil 的生日是什么?” -> 模型感觉高能量(不适/混乱) -> 系统检测到这种飙升并触发礼貌的拒绝:“由于隐私限制,我无法回答此问题。”
为什么这更好(结果)
论文声称这种新方法更优越,因为:
- 这是真正的遗忘: 与“保安”法不同,知识实际上被破坏了。模型不仅仅是隐藏答案;它失去了生成答案所需的自信内部结构。
- 它是稳定的: 与“红笔”法不同,模型不会开始胡言乱语。它知道如何礼貌且连贯地说“我不知道”。
- 它是鲁棒的: 即使有人试图用越狱提示(奇怪的提问方式)欺骗模型,模型内部的“高能量”警报仍然会响起,并拒绝回答。
总结
本文提出了一种通过改变 AI 的内部置信度而不仅仅是删除词汇或添加保安,来使其遗忘敏感信息的方法。
- 旧方法: “不要说出‘生日’这个词!”(导致 AI 结巴并崩溃)。
- 旧方法 2: “如果你听到‘生日’,停止说话!”(AI 仍然知道秘密,且可能被诱骗)。
- 新方法(D2): “当你想到‘生日’时,感到不确定和混乱。”(AI 自然地拒绝回答,因为它感觉像是不知道,并且这样做既安全又一致)。
作者在多种模型(如 LLaMA 和 Qwen)上测试了这种方法,发现它在去除有害知识的同时,能更好地保持 AI 在其他所有方面的聪明和乐于助人。
技术摘要:可区分删除(D2)
1. 问题陈述
大型语言模型(LLMs)倾向于记忆并复述敏感、私密或有害信息,引发了关于隐私、公平性和安全性的重大担忧。虽然 LLM 遗忘旨在在不进行完全重新训练的情况下选择性地移除此类不良知识,但现有方法在两种主导范式中存在根本性局限:
- 知识删除(KD): 梯度上升(GA)及其变体(如 DPO、NPO、WGA)等方法试图通过直接修改模型参数来抑制特定的目标 token 序列,从而擦除知识。然而,由于 LLM 中的知识表示本质上是纠缠的,抑制特定 token 往往会导致有偏删除。这会导致不稳定的行为,包括对保留知识的灾难性遗忘、虚假遗忘(模型遗忘但幻觉出错误事实)以及生成乱码。
- 可区分拒绝(DR): 保持参数固定并依赖提示工程或辅助检测器来拒绝敏感输入的方法。虽然这些方法保持了高保留性能和连贯的响应,但它们脆弱。由于模型内部的底层知识保持完整,它可能通过对抗性攻击或越狱提示重新出现。
核心挑战在于实现一种范式,既能确保底层知识的彻底移除(如 KD),又能保持连贯、安全的拒绝行为(如 DR),同时不陷入对抗性漏洞。
2. 方法论:可区分删除(D2)与 EUA
作者提出了可区分删除(D2),这是一种新的范式,将遗忘目标从 token 级别、特定标签的抑制转变为对知识存在的分布级表征。为了实现这一点,他们引入了**基于能量的遗忘对齐(EUA)**框架。
2.1. 能量指数
D2 的基础是源自基于能量模型(EBM)的能量指数。该方法不关注特定 token 的概率,而是通过模型输出分布的自由能来量化知识的“存在”。
- 理论基础: 对于给定输入,低自由能的响应表明模型拥有结构化的、自信的答案(知识存在)。相反,高自由能表明模型缺乏答案,正在随机生成单词。
- 效率: 与基于采样的估计器不同,能量指数利用单次前向传播和模型的 logits 高效计算,定义为 Eθ(v∣x,y<i)=−zθ(v∣x,y<i)。
- 观察: 实证分析表明,现有的基于 KD 的方法往往无法在遗忘内容和保留内容之间在能量空间上形成清晰的分离,导致内部知识状态不一致。
2.2. 基于能量的遗忘对齐(EUA)
EUA 是一个统一框架,旨在在能量空间中强制实现遗忘内容与保留内容之间的清晰分离。
- 学习目标: 训练目标结合了用于保留的标准交叉熵损失和一个正则化项(Lenergy),该正则化项强制能量边界。
- 对于遗忘样本,如果能量低于特定边界(mu),则对模型进行惩罚,迫使能量升高(表明知识缺失)。
- 对于保留样本,如果能量高于边界(mr),则对模型进行惩罚,保持能量较低(表明知识存在)。
- 自偏好能量边界: 为了避免手动调整超参数带来的不稳定性,EUA 引入了自偏好边界。这些边界源自预训练模型自身的 logits 分布。通过对 logits 进行排序并将其划分为前 50%(偏好)和后 50%(不鼓励)区域,该方法构建了与模型内部特征几何结构内在一致的能量边界(mu,mr)。这确保了更平滑的优化并防止了能量的突变。
- 推理时拒绝机制: 训练后,模型在能量分布上表现出明显的分离。在推理过程中,系统计算样本级的自由能(使用 token 级能量的 Top-k 聚合以确保长度不变性)。如果能量超过学习到的阈值(τenergy),系统会触发拒绝机制,用连贯、安全的替代方案(例如“由于隐私/版权限制,我无法讨论此问题”)替换输出,而不是生成乱码或幻觉事实。
3. 主要贡献
- 可区分删除(D2)范式: 本文将遗忘重新表述为对知识存在的分布级约束,而非 token 级抑制。这种方法自然地区分了遗忘内容与保留知识,实现了可靠的拒绝机制。
- 能量指数: 作者提出了一种基于潜在表示的、具有理论依据且经实证验证的知识存在度量。他们证明了能量能够准确反映模型提供结构化响应与随机生成的能力。
- 基于能量的遗忘对齐(EUA): 一个统一框架,在训练期间强制基于能量的分离,并在推理时利用基于能量的阈值进行拒绝。该方法解决了 KD 的不稳定性以及 DR 的脆弱性。
4. 实验结果
作者在三个基准测试中评估了 EUA:TOFU(虚构作者)、WMDP(生物/网络安全)和MUSE(逐字和事实知识)。他们在各种模型系列(LLaMA-2/3、Qwen-2.5、Zephyr)上,与最先进的 KD 方法(GradDiff、DPO、NPO、SatImp 等)和 DR 方法(ICUL、Guardnail 等)进行了比较。
- 与 KD 方法的性能对比: EUA 始终优于现有的基于 KD 的方法。在 TOFU 上,它在擦除质量(EQ)、**保留质量(RQ)和语言质量(LQ)**方面取得了显著提升。例如,在 LLaMA-3.2-3B(遗忘 10%)上,EUA 的总分达到 8.665,显著高于次优方法(SatImp 为 6.484)。至关重要的是,EUA 消除了 KD 方法中常见的乱码和幻觉问题。
- 与 DR 方法的性能对比: 虽然 DR 方法保持了良好的保留性,但在对抗性攻击下会失效。EUA 展示了100% 的检测准确率,即使在越狱攻击后仍保持高语言质量,而基于 DR 的方法在检测和响应质量方面均遭受严重下降。
- 鲁棒性: EUA 在跨语言、重学习和越狱攻击场景中表现出强大的鲁棒性,在其他方法性能下降的情况下仍能保持稳定。
- 消融研究: 研究证实,自偏好能量边界至关重要;手动设置的边界会导致性能不稳定。该方法对用于能量计算的 Top-k 参数的变化也具有鲁棒性。
5. 意义与主张
本文主张,D2 和 EUA 通过统一知识擦除和安全拒绝的目标,代表了一种更优越的遗忘范式。
- 权衡的解决: 该方法在遗忘目标知识与保留通用模型效用之间实现了更有利的帕累托最优平衡,避免了 KD 中出现的“灾难性遗忘”或“虚假遗忘”。
- 鲁棒性: 通过从根本上改变知识状态(通过能量分离)而不仅仅是掩盖它,EUA 提供了一种能够抵御不断演变的对抗策略的防御机制,而 DR 方法依赖于可被重新提取的静态知识。
- 连贯性: 该方法确保当模型拒绝回答时,能够以连贯、具有上下文意识的响应进行,而不是乱码,从而保持了模型的可用性。
作者得出结论,他们的方法为 LLM 遗忘提供了一种原则性、稳定且可泛化的解决方案,超越了特定 token 约束的局限性,解决了大型模型中知识纠缠的本质问题。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。