想象一下,你正在一个巨大的大脑(大型语言模型)内部构建一座宏大的知识图书馆。通常情况下,当你教导这个大脑时,你会把所有东西混合在一起。如果你教它关于“哈利·波特”的一个事实和关于“第二次世界大战”的一个事实,这些记忆会纠缠在相同的神经元中。如果你稍后因为法律请求需要删除“哈利·波特”的记忆,这就像试图从一件毛衣中剪掉一根单根的线,而不拆散整件衣服。你可能会不小心把历史课的内容也删掉了,或者哈利·波特的记忆又偷偷溜了回来。
这篇论文介绍了一种构建此类 AI 大脑的新方法,称为 NULLs(原生不可学习的大型语言模型)。NULLs 并非将所有事物混合成一大堆,而是从第一天起就为这个大脑构建了一个特殊的“分类系统”。
以下是它的工作原理,使用简单的类比:
1. “共享厨房” vs. “私人储物柜”
把 AI 的大脑想象成拥有两种类型的存储空间:
- 共享厨房(骨干网络): 这是 AI 学习通用知识的地方,这些知识适用于所有事物,比如语法、如何组成句子,或者关于世界的常识(例如“巴黎在法国”)。每个人都使用这个厨房。
- 私人储物柜(槽位): 这是这项新发明。对于每一个特定的信息源(比如单篇维基百科文章或一本特定的书),AI 都会被分配一组独特的“储物柜”(神经元),只有该信息源可以使用。
当 AI 学习一个仅属于某一篇特定文章的事实(比如某篇新闻报道中某个特定举报人的名字)时,它会自然而然地将该事实存储在该文章的私人储物柜中。当它学习一个通用的事实(比如“举报人很重要”)时,该事实会进入共享厨房。
2. 魔力开关(遗忘)
在标准 AI 中,如果你想让它忘记某些东西,你必须重新训练整个大脑,或者尝试进行手术式的权重移除,但这往往会破坏其他功能。
有了 NULLs,“遗忘”就像关掉电灯开关一样简单。
- 如果一家出版商说:“请从我们的模型中移除那篇特定的文章,”你不需要重新训练。你只需要禁用分配给那篇文章的“私人储物柜”。
- AI 会瞬间忘记那篇文章特有的事实,因为它对应的储物柜被锁上了。
- 然而,共享厨房仍然保持开放。AI 仍然知道关于该主题的通用知识,因为这些知识存储在公共区域,而不是特定的储物柜中。
这就像你有一栋房子,有一个公共客厅和每个客人专属的卧室。如果一个客人离开了,你只需要锁上他们的卧室门。客厅(大家聚会的地方)保持原样,房子也不会因此崩塌。
3. 论文的研究发现
研究人员通过两种主要方式测试了这个想法:
- 维基百科测试(细粒度): 他们在一个包含 600 万篇维基百科文章的模型上进行了训练。他们想看看是否可以在删除其中一篇特定文章的同时,又不删除与其他文章相似的通用知识。
- 结果: 当他们“锁定”了一篇文章的储物柜时,模型忘记了该文章的独特细节,但保留了与其他文章共享的通用知识。其效果几乎与他们丢弃该文章并从头开始重新训练模型(这通常成本极高)的效果一样好。
- 哈利·波特测试(粗粒度): 他们在整个《哈利·波特》系列书籍上训练了一个模型,然后尝试移除所有的哈利·波特知识。
- 结果: 当他们关闭“哈利·波特储物柜”时,模型停止谈论巫师,并在面对哈利·波特相关的句子提示时开始谈论正常的事情(比如市议会会议)。
- 加分项: 他们尝试使用“对抗性”提示或通过少量重新教学来诱骗模型重新记起哈利·波特。标准 AI 模型失败了并很快记起了书中的内容。然而,NULLs 模型保持了“不可学习”的状态,并能抵御这些技巧。
4. 这会让 AI 变笨吗?
一个巨大的担忧是,如果我们将记忆分离,AI 可能会在通用任务上的表现变差。论文在标准的语言基准测试(如回答科学问题或解决逻辑谜题)上测试了这一点。
- 结果: NULLs 模型的表现与标准的、非专门化的 AI 一样出色。它并没有失去它的通用智能。
总结
这篇论文认为,我们不应该等到 AI 训练完成后再去考虑如何删除数据。相反,我们应该将“删除按钮”直接构建到架构之中。通过为每个数据源分配专用的“储物柜”,同时共享一个共同的“厨房”,我们可以手术式地移除特定信息,而不会破坏模型的其余部分,也不需要从头开始重新训练一切。
技术摘要:原生不可学习大语言模型 (NULLs)
1. 问题陈述
大语言模型 (LLMs) 在大规模网络数据集上进行训练,这些数据通常包含受版权保护的内容、个人信息和受监管的内容。法律和伦理要求可能需要从已部署的模型中移除特定的数据源(即“遗忘/unlearning”)。然而,标准的训练通过梯度下降将所有数据源纠缠进一个共享的权重集中,这使得隔离任何单一数据源的贡献变得非常困难。
现有方法面临着权衡:
- 事后遗忘 (Post-hoc unlearning): 在训练后应用修正更新。虽然这保留了联合学习的能力,但目标的影响仍然纠缠在共享权重中,导致移除不彻底、相关知识退化以及易受对抗性重学习攻击。
- 源隔离 (混合专家模型/MoE): 为每个数据源训练独立的模型或模块。虽然这便于轻松移除,但它阻碍了跨源的联合学习,牺牲了泛化收益,且无法扩展到细粒度的源(例如数百万个独立文档)。
核心挑战在于:如何在不牺牲联合学习和泛化能力的前提下,实现源级遗忘。
2. 方法论:NULLs 架构
作者提出了 NULLs (Natively Unlearnable LLMs,原生不可学习大语言模型),这是一类旨在满足“隔离特定源贡献”与“跨源联合学习”这两个对立目标的模型设计。
架构修改:
- 骨干与汇聚池 (Backbone and Sinks): 该模型修改了 Transformer 的全连接 (MLP) 层。隐藏神经元被划分为两部分:
- 共享骨干 (Ngen):一组对所有输入都激活的神经元,负责学习通用能力和跨源共享的信息。
- 记忆汇聚池 (Npool):一个更大的神经元池,用于实现源特定信息的局部化。
- 稀疏激活掩码 (Sparse Activation Masks):每个数据源 Si 被分配一个针对汇聚池的确定性、稀疏掩码。该掩码通过伪随机数生成器根据源标识符生成。
- 在训练期间,一个文档会激活共享骨干神经元以及由其掩码定义的特定子集汇聚神经元。
- 激活的汇聚神经元与总池大小的比率 (Nsource/Npool) 是重叠率 (overlap ratio),用于控制源之间的干扰。
- 训练动态:该机制依赖于这样一个原理:共享骨干接收来自所有源的梯度更新,从而对源特定事实产生干扰;相反,汇聚神经元仅对部分源有效,受到的干扰较少。因此,源特定事实在进入骨干之前会被“拟合”进汇聚池中,而共享事实则在骨干中累积。
- 遗忘机制:在推理阶段,通过禁用目标源对应的汇聚掩码来进行遗忘。这可以通过以下方式实现:
- 汇聚关闭 (Sink-Off):将输入路由到距离最近的另一个源的汇聚池(通过嵌入相似度),或者仅仅是不应用目标掩码。
- 永久移除:将目标掩码中激活的神经元参数置零。
- 至关重要的是,这不需要梯度更新,也不需要访问保留的数据。
3. 核心贡献
- 原生不可学习性:NULLs 将遗忘功能直接集成到模型结构中,消除了对事后权重更新的需求。
- 可扩展性:通过在共享汇聚池上使用稀疏掩码,NULLs 可以处理组合数量级的源(例如约 600 万篇维基百科文章),而不会线性增加参数量。
- 无需监督的解耦:该方法能够自动隔离源特定知识,无需显式监督来识别哪些信息属于哪个源。
- 鲁棒性:该架构能够抵御通常会使事后遗忘失效的对抗性提取和重学习攻击。
4. 实验结果
作者在两个案例研究中评估了 NULLs:
A. 文章级遗忘 (维基百科)
- 设置:一个 1B 参数模型,在约 600 万篇维基百科文章上进行训练。
- 发现:
- 手术级移除:禁用特定文章的汇聚池后,模型对该文章特有事实的召回率大幅下降(真值率 ≈ 0),同时保留了与语义相关文章共享的事实。
- 与重训练对比:NULLs (Sink-Off) 的表现与从头开始训练且不含目标文章的“金标准”模型非常接近。
- 对比基准:事后梯度方法(如 NPO、梯度上升)在降低目标特定知识的同时,也会以同样的速率降低共享知识,无法区分两者。
B. 主题级遗忘 (哈利·波特)
- 设置:一个 1B 参数模型,在 C4 语料库和 7 本《哈利·波特》书籍的混合数据上进行训练。
- 发现:
- 行为变化:禁用“哈利·波特”汇聚池后,模型在生成的文本中消除了对书籍的引用,将主题转向无关内容,同时保持了连贯性。
- 对抗鲁棒性:
- 提取攻击:NULLs (Sink-Off) 能够抵抗通过对抗性提示(GCG 优化)诱导未遗忘文本的行为,其表现与从未训练过这些书籍的模型一致。
- 重学习攻击:当使用一小部分《哈利·波特》数据进行微调时,带有事后遗忘功能的标准 Transformer 会迅速恢复被遗忘的信息(在 10 步内)。相比之下,NULLs (Sink-Off) 展示出的重学习动态与从未见过该数据的模型完全一致。
C. 通用能力与缩放
- 能力保留:NULLs 在下游基准测试(ARC-E, Winogrande, PIQA, SciQ)上达到了与标准 Transformer 持平的表现,并保持了对文章特定事实的记忆能力。
- 汇聚池敏感度:增加汇聚池大小(减少重叠)可以在不显著削弱遗忘能力的前提下提高记忆容量。汇聚池的大小主要决定了模型能“学到多少”,而不是“能否被遗忘”。
5. 重要性与主张
论文声称,源级遗忘不应仅仅是事后的补救措施,而可以将其原生构建在 LLM 的训练过程中。
- 调和目标:NULLs 证明了实现源贡献的解耦与跨源联合学习这两个目标并不矛盾。
- 原生控制:它实现了在数据层面(而非仅仅是输出层面)对大型模型进行控制。
- 归因分析:由于源贡献保持了解耦状态,模型的输出可以归因于特定的预训练数据源,并且可以通过切换其汇聚池来直接衡量单一数据源的影响。
作者指出了一些局限性,包括使用了 1B 参数规模的模型,以及依赖于训练时预定义的源定义,并承认处理针对未定义源的遗忘请求仍是一个开放性问题。然而,结果表明,原生不可学习性是实现合规且可控的 AI 系统的一条可行路径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。