← 最新论文
🤖 machine learning

PURGE: Projected Unlearning via Retain-Guided Erasure

该论文介绍了 PURGE,这是一种利用持续学习与遗忘之间的对偶性,通过结合梯度投影约束、多层表示擦除以及保留-混淆目标,从而有效地移除特定数据并保持模型效用及抵御成员推理攻击的机器遗忘算法。

原作者: Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的学生,他通过研读一座庞大的图书馆里的书籍成为了专家。现在,想象有一个特定的人(我们称之为“鲍勃”)要求这位学生忘记关于他的所有事情,以遵守隐私法。

传统的、“幼稚”的处理方式是告诉学生:“回到图书馆,把鲍勃的书扔掉,然后从头开始学习。”这确实有效,但需要耗费数年时间并花费巨额成本。

PURGE 是一种全新的、聪明的捷径。它就像一块魔术橡皮擦,可以在不让学生忘记其他所学知识的情况下,抹除鲍勃对大脑的影响。

以下是论文如何使用简单的类比来解释这一过程的:

1. 核心理念:同一枚硬币的两面

作者们注意到一个有趣的现象:学习遗忘实际上是同一个问题的两个相反面。

  • 学习(持续学习): 你想要学习一项新技能(比如弹吉他),同时又不忘记旧的技能(比如弹钢琴)。
  • 遗忘(机器去学习/Machine Unlearning): 你想要抹除一段特定的记忆(鲍勃),而不影响图书馆中的其他知识。

论文指出:“让我们借鉴用于学习新事物的数学方法,并将其反转过来,来帮助我们遗忘事物。”

2. 魔术技巧:“护栏”(梯度投影)

当学生试图抹除鲍伯的记忆时,他们可能会不小心撞倒一瓶花(“保留集”或其他数据)。

PURGE 使用了一种叫做梯度投影(Gradient Projection)的技术。你可以把它想象成一个护栏或一名保镖

  • 每当学生尝试迈出一步来抹除鲍勃时,保镖都会检查:“这一步会伤害到这些花吗?”
  • 如果答案是“是的”,保 میل会将学生的脚轻轻推回,使他们只在不会损坏花朵的方向上移动。
  • 这保证了在抹除鲍勃的同时,他们的其他知识依然保持安全且准确。

3. “伪装混乱”策略(保留-混乱目标)

通常,当你试图让模型忘记某些东西时,你会让它进行随机猜测(比如掷骰子)。论文发现了一个问题:机器人太擅长识破虚假的随机性了。 如果模型突然开始随机猜测,黑客就会发现:“啊哈!这个模型被强迫忘记了一些东西!”

相反,PURGE 使用了保留-混乱目标(Retain-Confusion Target)

  • 想象一下,学生观察他们保留下来的书,并看看他们在哪里会产生困惑。也许他们有时会混淆“猫”和“狗”。
  • 在抹除鲍勃时,学生被告知:“不要随机猜测。相反,要以和你处理保留下来的书时完全相同的困惑方式来进行猜测。”
  • 这使得“被抹除后”的模型看起来就像一个从未见过鲍勃的学生一样。对于黑客来说,这种区别是无法察觉的。

4. 深度清理:抹除“直觉”

有时,即使模型不再说出正确答案,它在脑海深处(中间层)仍然会保留某种“直觉”(中间表示)。

  • 旧方法只是在最后阶段(输出端)告诉模型停止说出错误的答案。
  • PURGE 则深入得更多。它会清理“直觉”(中间表示),将内部的大脑活动推向看起来像是从未见过鲍勃的人所产生的活动状态。

5. “自动停止”按钮

学生如何知道何时停止抹除?

  • 旧方法: 你必须计算分钟数或者猜测要练习多少次。
  • PURGE 方法: 它有两个自我调节的停止信号:
    1. 预算(The Budget): “如果我们开始过度伤害这些花(保留数据),请立即停止。”
    2. 目标(The Target): “如果鲍勃的记忆已经模糊到我们无法比随机猜测表现得更好,就停止。”
      这意味着算法会自动决定何时完成,而不需要人类去猜测。

6. “冻结统计数据”的惊喜

论文发现了一个隐藏的陷阱:当抹除一整类数据(比如所有的“猫”的照片)时,模型的内部计算器(BatchNorm)会变得困惑,因为它只看到了“猫”,从而忘记了如何处理“狗”。

  • 修复方法: 作者意识到他们必须冻结这个计算器,使其统计数据不会随着这些奇怪的、单方面的数据而更新。这就像是在告诉计算器:“在我们进行这项手术时,不要更改你的设置。”如果没有这一点,整个系统都会崩溃。

结果:他们发现了什么?

作者在五种不同类型的数据(从手写数字到医学图像)上测试了该方法。

  • 隐私性: 被“抹除”后的模型具有极强的隐蔽性,黑客无法判断鲍勃是否在训练数据中(得分为 0.5,这是完美的表现)。
  • 效用: 模型仍然保留了 96% 以上的其他知识。
  • 速度: 它比从头开始重新训练整个模型快了约 13 倍

简而言之: PURGE 是一种快速、安全且聪明的方法,它通过借鉴 AI 如何学习新事物的技巧,从 AI 的记忆中删除特定数据,确保 AI 不会意外地忘记其原有的知识,也不会被黑客识破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →