← 最新论文
🤖 machine learning

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness

本文引入了遗忘-保留对齐间隙(Forget-Retain Alignment Gap, FRAG),这是一种通过衡量更新选择性而非全局权重位移来预测大语言模型重学鲁棒性的免训练指标,并提出了遗忘-保留剪枝(Forget-Retain Pruning, FRP),通过选择性地修改遗忘关键权重并保留保留关键权重来增强遗忘稳定性。

原作者: Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,人工智能模型通过吸收其所阅读的一切内容的模式,在海量数据中学习写作、推理和创造。然而,有时需要让这些模型忘记特定的信息,无论是为了保护隐私、移除受版权保护的内容,还是为了纠正有害的偏见。这一被称为“机器遗忘”(machine unlearning)的过程,旨在手术式地移除特定数据的影,同时保持模型的通用知识和能力不受影响。挑战在于这些模型具有极强的韧性;即使在研究人员认为已成功擦除某段信息后,如果模型再次接触到少量的新的训练数据,它往往能非常迅速地重新学会该信息。这种脆弱性提出了一个关键问题:我们如何判断一个模型是真的忘记了某些东西,还是仅仅在有机会恢复之前假装忘记?

来自韩国科学技术院(KAIST)和东京大学的一个研究小组提出了一种理解这一问题的新方法,指出目前衡量成功与否的常用方法存在根本性的缺陷。一段时间以来,判断模型是否成功实现遗忘的标准方法是测量其内部设置相对于原始状态发生了多大的偏移。其逻辑很简单:如果模型发生了显著变化,它一定已经遗忘了数据。然而,研究人员发现,这种“距离”的度量方式可能会产生误导。一个模型可能会经历大规模且混乱的变化,从而破坏其正常运作的能力,但看起来却仍从其起点移动了巨大的距离。在这种情况下,模型可能因为发生了变化而显得具有鲁棒性,但实际上它已经崩溃,连同不想要的数据一起丢失了有用的知识。

研究人员认为,真正的鲁棒性并不取决于模型移动了多远,而在于它移动到了哪里。他们发现,为了使模型能够抵御重新学习,对其进行的更改必须具有高度的选择性。模型需要改变其负责要遗忘信息的特定部分,同时小心地保留处理其应当保留的信息的部分。如果变化是随机散布的,或者损坏了模型中有用的部分,那么被遗忘的信息很容易就会回归。为了在不实际尝试重新训练模型的情况下测试这一观点,该团队开发了一种名为“遗忘-保留对齐间隙”(Forget-Retain Alignment Gap)的新工具。该工具就像一种诊断检查,观察对模型所做更改的结构。它会对调整是否集中在正确的目标上进行评分,从而有效地预测模型是否能抵御旨在让其重新记住被遗忘数据的攻击。

利用这一新视角,研究人员创建了一种名为“遗忘-保留剪枝”(Forget-Retain Pruning)的方法。该方法不再对模型进行广泛且剧烈的改变,而是仔细识别并仅移除那些对不需要的信息至关重要的连接,同时保持模型的其余部分不受影响。当他们测试这种方法时,发现经过这种选择性剪枝处理的模型,更难被诱导重新学习被遗忘的数据。在利用标准基准进行的实验中,这些模型在保持遗忘能力的同时,维持了其通用的性能稳定。结果显示,这种新方法优于现有的技术,后者通常依赖于仅仅让模型远离其原始状态这一有缺陷的想法。

这项研究表明,让人工智能忘记的关键不在于你改变了多少,而在于你改变得多么精准。通过专注于携带不需要信息的特定路径并保护其余部分,研究人员可以创建在抵御重新学习方面真正更加安全的模型。这一发现将关注点从简单的距离测量转向了对这些复杂系统中信息是如何存储和访问的更细致的理解。研究人员已向公众开放了他们的工具和代码,允许他人验证这些发现,并将这种选择性方法应用于未来人工智能安全和隐私方面的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →