想象一下,你有一位非常聪明、博学多才的图书管理员(AI 模型),他记住了数百万本书。有一天,一位顾客要求这位图书管理员“忘掉”一个特定的、敏感的故事——也许是因为那个故事是一个秘密、受版权保护,或者仅仅是由于它不再真实。顾客希望图书管理员能完全忘记这个故事,但同时又要完美地记住其他所有内容,以便继续为其他问题提供帮助。
这就是**机器遗忘(Machine Unlearning)**的问题。这篇论文介绍了一种名为 OFMU 的新方法来解决这个棘手的平衡难题。
以下是论文如何使用简单的类比来解释问题及其解决方案的:
问题:“拔河比赛”
目前大多数方法试图通过向相反方向拉绳子来让图书管理员忘记那个坏故事。然而,它们将“忘记坏故事”和“记住好故事”视为两个同时发生的同等任务。
论文认为这就像一场拔河比赛,两支队伍在同一根绳子上以同样的力量进行拉扯。
- 如果“遗忘”队拉得太用力,图书管理员就会忘记所有事情,包括那些好的故事(导致模型崩溃)。
- 如果“记忆”队拉得太用力,图书管理员就永远无法真正忘记那个坏故事(导致遗忘失败)。
- 因为“遗忘”和“记忆”的方向往往是冲突的,图书管理员会感到困惑,从而导致结果不稳定。
解决方案:OFMU(“严厉老板”法)
作者提出了 OFMU,它改变了游戏的规则。它不再是拔河比赛,而是建立了一个层级结构(一个老板和一个员工)。
内环(严厉的老板): 首先,系统只专注于“遗忘”任务。它表现得像一个严厉的老板,说:“你现在的唯一任务就是抹除这段特定的记忆。”为了确保这不会意外损坏其他记忆,它使用了一个特殊的工具,叫做相似性感知惩罚(similarity-aware penalty)。
- 类比: 想象图书管理员正在从一本书中擦除特定的页面。这个“惩罚”就像一个监视图书管理员手的卫兵。如果图书管理员的手开始朝着可能会意外撕掉另一页(即一段好的记忆)的方向移动,卫兵就会阻止他。这确保了“遗忘”行为不会干扰“保留”行为。
外环(乐于助人的员工): 一旦“遗忘”完成且坏的记忆消失后,系统就会切换到“记忆”任务。它会温柔地微调图书管理员,使其重新变得敏锐且乐于助人,但前提是必须在确认坏的记忆已经消失之后。
他们是如何实现的(双环算法)
论文描述了一个“双环”过程,这就像是一个排练与表演的流程:
- 排练(内环): 图书管理员练习忘记那个坏故事。他们不需要每次都完美地掌握它,只需要接近记忆消失的状态即可。
- 表演(外环): 一旦排练完成,图书管理员就开始执行主要任务:回答关于好故事的问题。他们使用一种数学上的“惩罚”来确保自己没有失误,也没有意外把坏故事带回来。
作者在数学上证明了这种方法是稳定的且会收敛(可靠运行)的,即使对于非常复杂、大型的模型也是如此。
结果:更好的平衡
论文在两种类型的“图书管理员”上测试了该方法:
- 语言模型(LLMs): 如 LLaMA,用于文本和对话。
- 视觉模型: 用于识别图像(如区分猫和狗)。
他们的发现是:
- 旧方法就像一把大锤:它们要么砸碎了坏的记忆但破坏了整个图书馆(失去所有效用),要么保护了图书馆的安全但未能移除坏的记忆。
- OFMU 则像是一位外科医生:它成功地移除了坏的记忆,同时保持了图书馆其余部分的完美状态。
- 在测试中,OFMU 在处理困难项目时表现更好,既不会导致模型崩溃,也不会使其变得毫无用处。它还提高了模型的安全性,防止人们尝试猜测其内部包含的数据(这是一种被称为成员推理的测试)。
总结
简而言之,论文指出:“不要试图以相等的权重同时去忘记和记住。首先,使用一种智能的、保护性的惩罚系统,强制模型忘记特定的坏数据。一旦完成后,再修复模型的通用性能。这种‘先遗忘、后修复’的层级结构创造了一种更稳定且有效的 AI 模型清理方式。”
OFMU 技术摘要:面向机器遗忘的优化驱动框架
问题陈述
在大规模语料库上训练的大语言模型(LLMs)和其他深度学习模型通常包含敏感、受版权保护或有害的信息。诸如 GDPR 等法规要求实现“被遗忘权”,这要求模型在不从头开始重新训练的情况下,移除特定数据(遗忘集,Df)的影响,同时保持对剩余数据(保留集,Dr)的性能。
现有的基于模型的遗只能方法通常将其表述为一个标量化的多目标问题,通过固定权重结合遗忘损失和保留损失。本文指出了这种方法存在的三个关键局限性:
- 静态权重: 固定权重无法适应遗忘过程的动态特性,即早期步骤应优先考虑遗忘,而后期步骤应侧重于效用恢复。
- 不稳定性: 标量化会导致训练动力学不稳定。如果遗忘目标占据主导,模型效用会崩溃;如果保留目标占据主导,遗忘则无法彻底完成。
- 梯度纠缠: 在“难以遗忘”的样本上,遗忘和保留的梯度是强耦合的。为了移除知识而进行的激进更新往往会对保留知识造成不成比例的附带损害。
方法论:OFMU
作者提出了 OFMU(面向机器遗忘的优化驱动框架),这是一个惩罚项驱动的双层优化框架,它通过层次结构显式地分离了目标。其核心理念是:遗忘是一个不可逾越的首要目标,而效用保留是一个以成功遗忘为条件的次要目标。
双层公式化:
- 内层最大化(遗忘): 内层问题寻求参数 θ∗,以最大化遗忘集的损失,同时最小化遗忘梯度与保留梯度之间的相似度。其目标函数定义为 Φ(θ)=Lf(θ)−β⋅Sim(∇Lf,∇Lr),其中 β 控制梯度去相关惩罚。
- 外层最小化(效用): 外层问题最小化保留集的损失 Lr(θ),约束条件是参数必须是内层目标的驻点(即 ∇Φ(θ)=0)。
基于惩罚项的重构:
由于需要重复进行内层最大化和计算高阶导数,直接求解该双层问题在计算上是极其昂贵的。OFMU 利用惩罚项将此问题重构为单层无约束问题:
F(θ)=Lr(θ)+ρ∥∇Φ(θ)∥2
这里,ρ 是一个惩罚参数,用于强制执行内层目标的平稳性。当 ρ→∞ 时,F(θ) 的极小值满足原始的双层约束。
两循环算法:
为了确保可扩展性,作者开发了一个两循环算法:
- 内循环: 对 Φ(θ) 执行 T 步梯度上升,以实现最大化遗忘并实现梯度去相关。
- 外循环: 对 F(θ) 执行梯度下降步骤以恢复效用。这一步涉及通过自动微分计算 Hessian 向量积,以处理惩罚项 ∥∇Φ(θ)∥2。
- 惩罚调度: 惩罚参数 ρ 随迭代次数增加,以逐渐加强对内层平稳性条件的强制执行。
核心贡献
- 新颖框架: 引入了 OFMU,这是一个将遗忘置于效用保留之上的双层框架,捕捉了遗忘任务固有的不对称性。
- 可扩展算法: 开发了一种具有收敛保证的两循环算法,避免了传统双层优化(如完全内层收敛)带来的计算瓶颈。
- 相似性感知惩罚: 设计了一个能够动态去相关遗忘梯度与保留梯度的惩罚项,从而减轻更新过程中的破坏性干扰。
- 理论分析: 严谨的收敛性分析表明,该算法在凸和非凸设置下均能收敛至 ϵ-驻点,并给出了具体的次优性界限。
实验结果
作者在语言和视觉基准测试上评估了 OFMU:
- 语言(TOFU 基准): 使用 LLaMA-2-7B 和 LLaMA-3.2-1B,针对移除 1%、5% 和 10% 的数据集测试了 OFMU。
- 性能: OFMU 在遗忘质量 (FQ)、模型效用 (MU) 和遗忘真实率 (FTR) 之间实现了卓越的平衡。
- 对比: 与实现高 FQ 但导致效用崩溃(MU ≈ 0)的梯度上升法 (GA) 和梯度差法 (GradDiff) 不同,OFMU 在实施强力遗忘的同时保持了高水平的效用(例如,在 LLaMA-2 遗忘 5% 数据时,MU ≈ 0.65)。其归一化得分优于 NPO 和 RMU 等基准方法。
- 视觉(CIFAR-10): 在类级遗忘和随机遗忘设置下进行了测试。
- 类级: OFMU 实现了 81.51% 的遗忘准确率 (UA) 和 93.51% 的保留准确率 (RA),提供了比虽然拥有更高 UA 但计算成本昂贵的影响遗忘法 (IU) 更好的权衡。
- 随机: 在具有挑战性的随机遗忘场景(10% 数据)中,OFMU 实现了 7.71% 的 UA,略高于重新训练(6.79%),同时保持了对成员推理攻击 (MIA) 的鲁棒性。
意义与主张
论文声称,OFMU 通过识别遗忘任务的层次结构,解决了标量化遗忘方法的根本不稳定性问题。通过将遗忘作为优化效用之前的首要约束,OFMU 在语言和视觉任务中均实现了最先进的权衡。作者断言其方法提供了:
- 稳定性: 即便是在其他方法失效的“难遗忘”样本上,也能保持一致的表现。
- 鲁棒性: 与现有基准相比,对成员推理攻击具有更强的抵御能力。
- 理论基础: 提供了一种在非凸机制下具有收敛保证的有原则的方法,超越了启发式的权重方案。
论文最后指出,尽管 OFMU 代表了重要的一步,但未来的工作可以探索持续遗忘场景、自适应惩罚调度以及在更大规模基础模型和多模态数据上的应用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。