想象一下,你有一位非常聪明、博学多才的图书管理员(即 LLM),他读过数百万本书。有时,这位图书管理员会记住一些他不该记住的东西——比如某个人的私人地址,或者他不应该分享的受版权保护的故事。你想教这位图书管理员“忘掉”这些特定的事实,但又不想让他忘掉其他所有知识,也不想让他变成一个混乱且不知所措的人。
这篇论文就像是一本关于如何为这位图书管理员进行这种“再教育”的最佳指南。作者发现,人们目前采用的标准方法其实相当混乱且效率低下。他们测试了新方法,并发现了更好的做法。
以下是他们研究结果的拆解,使用了简单的类比:
1. “标准课程”的问题
通常,在试图让图书管理员忘记某些内容时,研究人员会为他安排两类学生:
- “遗忘”组: 手中拿着你想要抹除的秘密信息的卡片的学生。
- “保留”组: 手中拿着安全的、通用知识卡片的学生,用以保持图书管理员的敏锐度。
旧的方法(有缺陷的设置):
- “单一邻居”错误: 传统上,“保留”组仅包括与秘密直接相关的学生(例如,如果你想让他忘记“约翰住在巴黎”,那么保留组只知道关于巴黎的事)。作者发现,这就像试图通过只和一个人交谈来学习一门语言一样;这太狭隘了。他们发现,你需要将直接邻居(与秘密直接相关的联系人)和间接邻居(具有相似职业或主题的人)混合在一起,才能保持图书管理员的平衡。
- “1:1 洗牌”错误: 旧方法将一张“遗忘”卡片与恰好一张“保留”卡片配对,并不断重复。作者发现,这就像试图清理房间时,捡起一只袜子放下,再捡起下一只袜子,如此循环。这既低效,也无法彻底清理房间。
2. 新的解决方案:“模块化”方法
作者提出了一种名为 MELU(模块化实体级遗忘) 的新策略。
类比:
想象图书管理员必须忘记关于 爱丽丝 (Alice)、鲍勃 (Bob) 和 查理 (Charlie) 三个人的事实。
- 旧的“循环”方式: 图书管理员在看鲍勃的照片时尝试忘记爱丽丝,然后在看查理的照片时尝试忘记鲍勃。这是一种混乱的混杂。大脑会感到困惑,因为“遗忘”信号被与无关的“记忆”信号配对在了一起。
- 新的 MELU 方式: 图书管理员在看与爱丽丝相关的照片(以及关于爱丽丝的安全照片)时,仅专注于爱丽丝。然后,他们切换到鲍勃,并且仅看与鲍勃相关的照片。
为什么有效:
通过将“遗忘”组和“记忆”组严格匹配到同一个人或主题,学习信号变得清晰且稳定。这就像通过只看数学题来准备数学考试,而不是把数学题和历史问题混在一起学习。
3. 他们的发现
作者进行了实验,以观察哪种方法效果最好。以下是他们的主要结论:
- 多样化组合: 如果只使用一种类型的“保留”数据(例如,仅使用直接邻居),会导致图书管理员要么忘得不够,要么变得过于混乱。你需要多样化的组合,即结合直接相关和间接相关的数据,才能达到平衡。
- 停止 1:1 洗牌: 将一个遗忘项与一个保留项配对的常见做法是浪费时间。它效果并不好。
- MELU 是赢家: 新的“模块化”方法(按主题/人物分组)更加稳定。它成功地抹除了坏记忆(高“遗忘效能”),同时没有让图书管理员忘记如何说话或回答其他问题(高“模型效用”)。
4. 底线结论
该论文认为,如果你想可靠地让 AI 忘记特定事物而不破坏其大脑,你需要:
- 更好地策划你的数据: 不要只使用一种类型的相关信息;要使用直接连接和间接连接的混合数据。
- 改变你的训练计划: 停止随机配对或进行简单的 1 对 1 循环。相反,要对你的训练进行分组,使 AI 能够专注于一个特定的主题,并将“遗忘”数据严格地与该主题对应的“保留”数据配对。
作者总结道,这种“模块化”方法提供了一条实现有效遗忘的清晰、稳定的路径,而旧的标准方法往往会导致不稳定的结果或性能下降。
技术摘要:标准采样与模块化采样:实现可靠 LLM 遗忘的最佳实践
问题陈述
在大规模网络抓取数据集上训练的大语言模型(LLM)往往会记忆敏感信息,包括个人数据和受版权保护的内容。虽然 LLM 遗忘(LLM Unlearning) 已成为一种在保留通用模型效用的同时移除特定知识的技术,但该领域仍缺乏标准化的、基于证据的数据集构建和采样策略最佳实践。
目前的基准测试和方法论存在两个主要缺陷:
- 保留集构成(Retain Set Composition): 大多数现有工作依赖于单一类型的“邻居集”(即与遗忘目标存在直接或间接联系),并结合通用的知识池。这未能反映现实世界数据中复杂且多维的关系。
- 采样策略: 该领域过度依赖于诸如 1:1 采样(每个 epoch 中一个遗忘样本匹配一个保留样本)或 循环采样(遍历所有保留样本的同时循环使用遗忘目标)等惯常标准。这些启发式方法的有效性和稳定性尚未得到批判性审查,可能掩盖了性能权衡并引入了潜在风险,如灾难性遗忘或不稳定性。
研究方法
作者进行了系统性评估,旨在为 LLM 遗忘建立最佳实践,重点关注 实体级遗忘(Entity-Level Unlearning)(即移除关于特定实体,例如某个人物的所有知识)。
1. 数据集构建 (扩展版 WPU)
本研究使用了 维基百科人物遗忘(WPU) 数据集,该数据集包含知名度较低的人物,以模拟真实的遗忘场景。作者对该数据集进行了扩展,包括:
- 直接邻居集 (Nd): 与遗忘目标直接相关的实体(例如:出生地、家人)。
- 间接邻居集 (Nind): 具有语义或上下文关系的实体(例如:相同的职业、历史时期),通过使用 LLaMA 3.3 70B 模型寻找目标实体的相似职业来生成。
- 句法相似性 (Ns): 确保保留集中的问答对与遗忘目标共享疑问句式结构,以控制句法影响。
- 测试集 (Dt): 由剩余的间接邻居和通用知识样本组成的平衡集合,用于评估模型效用。
2. 实验设置
作者对 LLaMA 3.1 8B Instruct 进行了微调,并评估了三种遗忘算法:
- 用于非针对性遗忘的 梯度差分(GD) 和 负偏好优化(NPO)。
- 用于针对性遗忘的 直接偏好优化(DPO)。
他们对比了结合数据实践和采样策略的 七种不同设置:
- 数据实践: 将保留集限制为仅包含直接邻居、仅包含间接邻居,或两者的 平衡 混合。
- 采样实践:
- 1:1 顺序采样: 将顶部的保留样本与遗忘样本进行匹配。
- 1:1 随机采样: 每个 epoch 随机选择等量的保留样本。
- 循环采样: 在迭代遗忘目标的同时,循环遍历完整的保留池。
- 模块化实体级遗忘(MELU): 一种提出的策略,其中每个遗忘目标仅与其所属特定实体的保留样本配对,避免无关配对。
3. 评估指标
性能通过以下指标衡量:
- 遗忘效能 (FE): 计算遗忘集上 ROUGE-L、条件概率和余弦相似度的 算术平均值 的 1−均值。
- 模型效用 (MU-T): 测试集上上述指标的调和平均值。
- Token 多样性: 通过 Distinct-N 进行测量,以检测模型崩溃或退化。
- 通用知识: MMLU 分数,用于评估更广泛的模型完整性。
核心贡献
- 对数据实践的批判性分析: 研究表明,依赖单一邻居集是次优的。一个多样化的保留集(结合直接和间接邻居)对于平衡遗忘效能和模型效用至关重要。
- 1:1 采样的低效性: 作者发现标准的 1:1 采样(无论是顺序还是随机)都是低效的,无法产生理想的遗忘结果,也未能充分利用保留集的潜力。
- 提出 MELU: 本文引入了 模块化实体级遗忘(MELU),这是一种结构化的采样策略,将遗忘目标仅与其各自的实体特定保留样本配对。该方法被证明比传统的循环采样更稳定且更有效。
结果
数据构成:
- 直接 vs. 间接: 基于梯度的算法(GD)在直接邻居集上表现出更高的遗忘效能,但面临显著的模型效用下降。相反,间接邻居集能更好地保留模型效用,但在基于梯度的算法中,其遗忘效能有时较低。
- 平衡集: 虽然平衡集并不总是能同时最大化这两个指标,但它提供了一种必要的权衡,防止了直接邻居集所导致的极端效用损失。
- Token 多样性: 间接集和平衡集通常比直接集保持了更高的 Token 多样性,而后者往往会导致模型退化(尤其是在使用 GD 时)。
采样策略:
- 1:1 采样: 无论经过多少个 epoch,始终无法产生实质性的遗忘效果。
- 循环采样 vs. MELU: 两者都显著优于 1:1 采样。
- MELU 的优越性: MELU 展示了更强的稳定性。在 DPO 算法下,MELU 比循环采样提升了 12% 的遗忘效能,同时保持了高水平的模型效用。对于困难目标(如 "Ted Kooser"),MELU 实现了 > 0.50 的遗忘效能,而 1:1 采样则失败了(< 0.10)。
- 稳定性: MELU 通过减少由无关的“遗忘-保留”对引起的方差,提供了更一致的学习信号,从而实现了稳定的 MMLU 分数和 Token 多样性。
意义与主张
本文声称,保留集的构成和采样策略的选择是关键但常被忽视的因素。作者断言:
- 依赖单一邻居集或标准 1:1 采样会引入隐藏风险和性能天花板。
- 所提出的 MELU 策略结合鲁棒的算法,为有效的遗忘提供了一条清晰且稳定的路径。
- 这项工作提供了初步的基于证据的最佳实践,敦促社区转向更多样化、更真实的基准数据集和结构化采样技术,而非依赖简单的启发式方法。
作者对其主张保持谦逊,承认了存在的局限性,例如使用“姐妹模型”生成数据集(这可能会限制在不同模型家族间的泛化能力),以及缺乏对 MELU 相比循环采样为何更具稳定性的深度理论探讨。他们将这项工作定位为迈向建立未来遗忘研究严谨协议的一步。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。