← 最新论文
🤖 machine learning

Natively Unlearnable Large Language Models

本文介绍了 NULLs(原生不可学习的大语言模型),这是一种利用共享骨干神经元和稀疏激活的特定来源汇聚点(source-specific sinks)的模型架构,旨在实现对单个训练源的高效、鲁棒且无需数据的遗忘,同时保留联合学习的优势和通用的语言能力。

原作者: Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一个巨大的大脑(大型语言模型)内部构建一座宏大的知识图书馆。通常情况下,当你教导这个大脑时,你会把所有东西混合在一起。如果你教它关于“哈利·波特”的一个事实和关于“第二次世界大战”的一个事实,这些记忆会纠缠在相同的神经元中。如果你稍后因为法律请求需要删除“哈利·波特”的记忆,这就像试图从一件毛衣中剪掉一根单根的线,而不拆散整件衣服。你可能会不小心把历史课的内容也删掉了,或者哈利·波特的记忆又偷偷溜了回来。

这篇论文介绍了一种构建此类 AI 大脑的新方法,称为 NULLs(原生不可学习的大型语言模型)。NULLs 并非将所有事物混合成一大堆,而是从第一天起就为这个大脑构建了一个特殊的“分类系统”。

以下是它的工作原理,使用简单的类比:

1. “共享厨房” vs. “私人储物柜”

把 AI 的大脑想象成拥有两种类型的存储空间:

  • 共享厨房(骨干网络): 这是 AI 学习通用知识的地方,这些知识适用于所有事物,比如语法、如何组成句子,或者关于世界的常识(例如“巴黎在法国”)。每个人都使用这个厨房。
  • 私人储物柜(槽位): 这是这项新发明。对于每一个特定的信息源(比如单篇维基百科文章或一本特定的书),AI 都会被分配一组独特的“储物柜”(神经元),只有该信息源可以使用。

当 AI 学习一个仅属于某一篇特定文章的事实(比如某篇新闻报道中某个特定举报人的名字)时,它会自然而然地将该事实存储在该文章的私人储物柜中。当它学习一个通用的事实(比如“举报人很重要”)时,该事实会进入共享厨房

2. 魔力开关(遗忘)

在标准 AI 中,如果你想让它忘记某些东西,你必须重新训练整个大脑,或者尝试进行手术式的权重移除,但这往往会破坏其他功能。

有了 NULLs,“遗忘”就像关掉电灯开关一样简单。

  • 如果一家出版商说:“请从我们的模型中移除那篇特定的文章,”你不需要重新训练。你只需要禁用分配给那篇文章的“私人储物柜”。
  • AI 会瞬间忘记那篇文章特有的事实,因为它对应的储物柜被锁上了。
  • 然而,共享厨房仍然保持开放。AI 仍然知道关于该主题的通用知识,因为这些知识存储在公共区域,而不是特定的储物柜中。

这就像你有一栋房子,有一个公共客厅和每个客人专属的卧室。如果一个客人离开了,你只需要锁上他们的卧室门。客厅(大家聚会的地方)保持原样,房子也不会因此崩塌。

3. 论文的研究发现

研究人员通过两种主要方式测试了这个想法:

  • 维基百科测试(细粒度): 他们在一个包含 600 万篇维基百科文章的模型上进行了训练。他们想看看是否可以在删除其中一篇特定文章的同时,又不删除与其他文章相似的通用知识。
    • 结果: 当他们“锁定”了一篇文章的储物柜时,模型忘记了该文章的独特细节,但保留了与其他文章共享的通用知识。其效果几乎与他们丢弃该文章并从头开始重新训练模型(这通常成本极高)的效果一样好。
  • 哈利·波特测试(粗粒度): 他们在整个《哈利·波特》系列书籍上训练了一个模型,然后尝试移除所有的哈利·波特知识。
    • 结果: 当他们关闭“哈利·波特储物柜”时,模型停止谈论巫师,并在面对哈利·波特相关的句子提示时开始谈论正常的事情(比如市议会会议)。
    • 加分项: 他们尝试使用“对抗性”提示或通过少量重新教学来诱骗模型重新记起哈利·波特。标准 AI 模型失败了并很快记起了书中的内容。然而,NULLs 模型保持了“不可学习”的状态,并能抵御这些技巧。

4. 这会让 AI 变笨吗?

一个巨大的担忧是,如果我们将记忆分离,AI 可能会在通用任务上的表现变差。论文在标准的语言基准测试(如回答科学问题或解决逻辑谜题)上测试了这一点。

  • 结果: NULLs 模型的表现与标准的、非专门化的 AI 一样出色。它并没有失去它的通用智能。

总结

这篇论文认为,我们不应该等到 AI 训练完成后再去考虑如何删除数据。相反,我们应该将“删除按钮”直接构建到架构之中。通过为每个数据源分配专用的“储物柜”,同时共享一个共同的“厨房”,我们可以手术式地移除特定信息,而不会破坏模型的其余部分,也不需要从头开始重新训练一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →