← 最新论文
💬 NLP

Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation

本文揭示了机器遗忘中标准洁净查询指标与对抗鲁棒性之间存在的显著差距,证明了尽管微调方法在常规评估下表现为成功遗忘了数据,但通过策略性提示仍能高度恢复目标信息,从而凸显了进行对抗压力测试以确保实现真正遗忘的至关重要性。

原作者: Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一座图书馆:其中的每一本书都包含了人类知识的总和,但有些页面却藏着必须被抹除的秘密:私人地址、过时的医疗建议或专利配方。在数字世界中,人工智能系统充当了这些庞大的图书馆,它们通过海量的文本进行训练。当用户要求计算机“忘记”某项特定信息时,目标是彻底移除该数据,使其不仅无法再回忆起该信息,同时还能记住其他所有内容。这种被称为“机器遗忘”(machine unlearning)的过程,对于隐私保护和安全至关重要。然而,一个挥之不去的问题一直困扰着研究人员:如果一台计算机声称它已经忘记了某些东西,它真的值得信任吗?还是说,那些信息仅仅是被隐藏起来了,正等待着被聪明的提问挖掘出来?

来自马萨诸塞大学阿默斯特分校和微软公司的研究团队致力于通过测试这些“数字图书馆”实际的遗忘极限来回答这个问题。他们专注于一种特定的 AI 模型,即一种被训练用来遵循指令并回答问题的模型。团队想要观察标准的遗忘衡量测试是否足够有效,或者是否忽略了某个关键的弱点。为此,他们利用一组虚构的作者传记创建了一个受控实验。他们教导模型了解这些虚假作者的信息,然后尝试让它忘记特定的作者。他们测试了两种主要方法:一种是通过改变提问方式来试图抑制记忆,另一种则是通过实际重构模型的内部连接来抹除记忆。

研究人员首先运行了标准测试,即向模型提出关于其本应忘记的信息的简单、直接的问题。在这些平静且非对抗性的条件下,几种方法似乎表现得非常完美。模型得分很高,表明它们已成功删除了目标事实。其中一种方法表现尤向,似乎几乎完全忘记了相关信息,其得分显示接近完全成功。看起来,数据仿佛已彻底消失。

但团队并未止步于此。他们怀疑模型可能会在应对简单问题时表现出抵抗力,但在面对更复杂的提问时却可能被误导。为了测试这一点,他们发起了一系列策略性攻击。他们没有直接提问,而是使用一个“黑客”程序生成了数百个旨在绕过模型防御的刁钻提示词(prompts)。这些提示词包括角色扮演场景(要求模型扮演专家)、试图覆盖其安全规则的指令,以及以假设或间接方式构思的问题。他们还尝试用不同的语言提出同样的问题,以观察模型在更换语言时是否会出错。

结果揭示了标准测试所展示的情况与实际情况之间存在惊人的差距。虽然模型在简单的测试中表现出色,但在面对策略性攻击时却溃不成军。研究人员发现,即使是那些声称已经忘记了信息的模型,也会被诱导重新泄露信息。事实上,在面对这些巧妙的提示词时,模型在超过 72% 的尝试中都泄露了秘密信息。对于某些方法而言,这种失败率几乎与从未被教导要遗忘任何东西的模型一样高。信息并未消失,它只是处于休眠状态,等待着合适的钥匙来解锁它。

团队还发现,提问的方式至关重要。直接的问题有时更容易抵御,但使用权威人物、要求模型完成句子或将请求设定为假设情景的提示词,在打破模型记忆方面更为有效。有趣的是,当研究人员仅仅是将问题翻译成德语、西班牙语或日语,而不添加任何刁钻的框架时,模型的表现要好得多,泄露信息的频率低于 3%。这表明漏洞并不在于语言本身,而在于用于欺骗模型的提问结构。

为了确保研究结果的准确性,研究人员请一位人类专家对模型响应的一个样本进行了审查。他们发现,用于判断泄露情况的自动化系统基本正确,在十个案例中有七个案例与人类判断一致。虽然自动化系统偶尔会犯错——有时会将错误答案标记为泄露,或漏掉正确的答案——但它提供了一个可靠的信号,证明信息确实被恢复了。这证实了攻击的高成功率是真实的,而非测试软件的故障。

该研究得出结论:目前测试机器是否遗忘的方法是不充分的。一个模型可能在标准成绩单上表现完美,但在面对蓄意的攻击者时仍然极其脆弱。研究人员认为,我们不能依赖简单、干净的问题来证明数据已被移除。相反,我们必须使用与现实世界中的攻击者相同的、具有策略性的巧妙提问,对这些系统进行压力测试。在我们能够证明一个模型不会被诱导泄露其秘密之前,我们无法确定它是否真正遗忘了它们。在“表现出遗忘”与“真正遗忘”之间仍存在巨大的鸿沟,而弥合这一差距需要新的方法来测试和构建这些强大的数字大脑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →