← 最新论文
🤖 machine learning

Multi-Objective Reference-Aligned Machine Unlearning

本文提出了参考对齐遗忘(Reference-Aligned UnLearning, RAUL),这是一个多目标框架,通过将无界的损失最大化替换为对参考分布的有界 KL 对齐,并利用雅可比下降法求解由此产生的优化问题,从而减轻机器遗忘中的灾难性遗忘,以实现与重新训练相当的性能。

原作者: Rasa Khosrowshahli, Stephen Asobiela, Beatrice Ombuki-Berman, Shahryar Rahnamayan

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Rasa Khosrowshahli, Stephen Asobiela, Beatrice Ombuki-Berman, Shahryar Rahnamayan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的学生,他读完了一本厚厚的教科书。这个学生非常出色,几乎可以回答关于这本书中任何内容的提问。但现在,由于法律要求,书中的几页必须被移除(可能是因为其中包含隐私信息)。你需要让这个学生“忘掉”这些特定的页面,但又不能让他忘记书中学习过的其他所有内容。

这就是**机器学习遗忘(Machine Unlearning)**的问题。

旧方法:“过度矫正”问题

传统上,为了让学生忘记特定的页面,老师们会使用一种严厉的方法:他们会强迫学生去背诵那些页面内容的“反面”。

  • 比喻: 想象学生试图忘记“苹果是红色的”。老师对着他大喊:“不对!苹果是蓝色的!苹果是绿色的!苹果是扭曲形状的!”
  • 结果: 学生因为试图强行记住错误的答案而变得非常混乱,以至于他们开始连带忘记其他事情。他们可能会开始认为“橙子是蓝色的”,或者连数数都忘了。在论文中,这被称为灾难性遗忘(Catastrophic Forgetting)。学生变得不稳定,且整体表现下降,因为“遗忘”的过程在与“记忆”的过程进行对抗。

新方案:RAUL(参考对齐遗忘法)

论文作者提出了一种更聪明、更温和的方法,称为 RAUL。与其大喊相反的内容,不如告诉学生:“对于这些特定的页面,表现得就像你从未见过它们一样。”

以下是其工作原理,分为简单的步骤:

1. 双重目标(平衡术)

学生需要同时完成两项任务:

  • 任务 A(保留): 完美地回答关于书本其余部分的问题。
  • 任务 B(遗忘): 对于被移除的页面,表现得就像它们是全新的、未知的概念一样。

旧方法试图通过对抗任务 A 来完成任务 B。而 RAUL 尝试在两者互不干扰的情况下同时完成它们。

2. “参考”技巧

如何教一个人表现得像从未见过某物一样?你需要给他们一个参考(Reference)

  • 比喻: 想象学生正在看一张“被遗忘页面”的照片。老师不是强迫他说“这是一只狗”(当实际是猫时),而是说:“看这张随机物体的照片。你会如何描述它?你可能不会很确定,对吧?你会说:‘我不知道,它可能是任何东西。’”
  • 论文的方法: 论文使用了两种类型的“参考”指南:
    • 均匀分布(“完全瞎猜”): 老师告诉学生:“对于这些页面,只需随机猜测。把每个答案都视为等可能的。”这就像是在说:“我对这方面一无所知。”
    • 留出分布(“真正的陌生人”): 老师向学生展示一张来自另一本书(学生还没读过的那本书)的全新物体的图片,并说:“把被遗忘的页面当作这个新物体一样对待。”这有助于学生保持冷静而不至于惊慌,从而保持其对书本其余部分的记忆稳定。

3. “交通警察”(雅可比下降法)

即使有了好的计划,这两项任务(记忆 vs. 遗忘)仍可能将学生拉向相反的方向。

  • 比喻: 想象学生被两根绳子拉扯。一根绳子拉着他去记住书本;另一根绳子拉着他去遗忘页面。如果你只是把绳子绑在一起,绳子会断掉,或者学生会被卡住。
  • 解决方案: 论文使用了一个特殊的“交通警察”(称为带有 UPGrad雅可比下降法/Jacobian Descent)。这个警察会观察两根绳子,并找到一条中间路径。它不仅仅是将力量相加,而是计算出一个方向,让学生可以在不发生纠缠的情况下向前移动。它找到了一个完美的平衡点,让学生既能“足够好地记住”,又能“足够好地遗忘”,而不会导致崩溃。

实验结果如何?

研究人员在数字“学生”(计算机模型)上进行了测试,使用的是动物图片(CIFAR-10)。

  • 旧的学生(旧方法): 当被要求遗忘 50% 的数据时,旧方法让学生变得混乱。他们对剩余 50% 数据的记忆崩溃了,表现得非常糟糕。
  • RAUL 学生: 当被要求遗忘同样数量的数据时,RAUL 学生保持了冷静。
    • 他们对剩余数据的记忆几乎与从未被要求遗忘时一样完美。
    • 他们成功地“遗忘”了被移除的数据,表现得对这些数据并不确定,就像对待一张全新的图片一样。
    • 他们表现得非常稳定,性能没有出现剧烈波动。

核心结论

论文声称,通过将目标从“强迫模型出错”转变为“使模型对齐为表现得像看到了新事物一样”,我们可以在不破坏模型大脑的情况下移除特定数据。这就像是教学生通过告诉他们把某一章当作空白页来处理,而不是试图用错误的信息去重写整本书。

其结果是一个在尊重隐私(移除数据)的同时,能更好地保持其智能水平的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →