Deep Contrastive Unlearning for Language Models
本文提出了 DeepCUT,这是一个通过深度对比学习来优化语言模型潜在空间的机器遗忘框架,旨在有效移除特定训练数据并保持预测质量,从而解决现有方法忽略样本几何分布的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,我们的生活越来越多地以文本形式被记录下来:社交媒体帖子、医疗记录、法律文件和私人电子邮件。大型语言模型——那些能够写作、翻译和回答问题的强大计算机程序——是在这些海量的、由人类生成的数据之上进行训练的。它们通过阅读数百万个此类示例进行学习,吸收语言和知识的模式,从而成为极其有用的工具。然而,这种对现实世界数据的依赖产生了一个重大问题。如果一个人决定不再让其私人信息被使用,或者某条数据被发现是不准确或敏感的,目前删除该数据的唯一方法就是删除数据并从头开始整个训练过程。对于那些已经花费数周时间在数十亿词汇上进行训练的模型来说,这就像为了移除一本书而烧掉整座图书馆一样。这种方式太慢、太昂谱,而且在人们行使“被遗忘权”时,往往无法快速完成。
为了解决这个问题,研究人员一直在开发一个被称为“机器遗忘”(machine unlearning)的领域。其目标是教会模型忘记特定信息,而无需对其进行整体重训。想象一位背诵了教科书的学生;机器遗忘旨在让这位学生忘记其中的某一特定章节,同时仍记住其他所有内容,且无需让他重新回学校读一年的书。虽然目前已存在一些针对图像或简单数据实现此目的的方法,但将其应用于复杂且细微的语言世界已被证明非常困难。大多数现有的尝试仅关注模型给出的最终答案,试图通过微调输出,使其不再提及被遗忘的主题。但这种方法通常会让数据的底层记忆依然完整地保留在模型的内部计算之中,随时准备重新浮现。
来自皇家墨尔本理工大学(RMIT University)的一个研究小组提出了一种名为 DeepCUT 的新方法,它采取了不同的路径,直接观察模型在其自身“思维”中如何组织信息。DeepCUT 不仅仅是微调最终答案,而是重新组织模型存储知识的内部地图。研究人员在四个不同的现实世界数据集上训练了一个语言模型,这些数据集涵盖了从嘈杂的社交媒体帖子到精确的生物医学文献。随后,他们要求模型忘记这些数据中的特定部分,比例从总训练集的 1% 到 10% 不等。为了测试遗忘效果,他们测量了模型在回答关于应被遗忘数据的问题时的表现,以及它在处理应保留数据时的能力保持程度。
结果显示,以往的方法往往效率低下或不完整。仅仅在剩余数据上继续训练模型(一种被称为“灾难性遗忘”的技术),无法抹除特定文本的记忆;模型对被移除数据的记忆准确率依然很高。另一种常见的策略是将数据分成较小的块,并仅对受影响的部分进行重训,这种方法在成功移除数据的同时,显著损害了模型的整体智能,使其在通用任务上的准确性下降。相比之下,DeepCUT 方法在成功擦除特定记忆的同时,保持了模型的通用性能。在针对其应当遗忘的数据进行测试时,DeepCUT 模型的准确率大幅下降,表明它确实已经遗忘了该信息。与此同时,它在应当记住的数据上保持了高准确率,表现得与从头开始完全重训的模型一样出色。
这种成功的秘诀在于该方法如何操纵模型的内部空间。研究人员将数据点视为地图上的位置。为了让模型忘记特定信息,他们将该部分数据从其自身的群体中推开,并拉向不同的群体,从而有效地扰乱了该数据在模型记忆中的独特身份。这个过程确保了模型不再能识别出使该数据具有独特性的特定特征,同时保持其余部分的地图不受干扰。实验证明,这种方法不仅在移除数据方面非常有效,而且比重训整个模型要快得多。通过专注于模型内部信息的几何排列,研究人员找到了一种手术式移除不需要的记忆的方法,为人工智能时代的隐私保护提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。