← 最新论文
🤖 machine learning

Auditing of Unlearning Algorithms

本文介绍了一种实用的审计框架,该框架利用成员推理攻击来计算关于遗忘保证的数据依赖型下界,揭示了一个显著的性能差距,即经过严格证明的算法能有效消除数据影响,而经验方法则无法做到这一点。

原作者: Sahasrajit Sarmasarkar, Anastasia Koloskova, Sanmi Koyejo

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sahasrajit Sarmasarkar, Anastasia Koloskova, Sanmi Koyejo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的图书馆(机器学习模型),它读过数百万本书籍来学习如何创作故事。有一天,一位特定的作者要求将其著作从图书馆的记忆中移除,因为他希望被“遗忘”。

问题所在:
仅仅把书从书架上拿走是不够的。图书管理员(AI)已经记住了这位作者的风格、词汇和情节转折。如果你要求管理员写一个故事,他们可能会不经意间使用该作者独特的短语。一个聪明的侦探(对抗者)可以通过向管理员提问特定的问题,从而推断出:“啊,这个图书管理员肯定读过那本特定的书!”

解决方案(遗忘):
为了解决这个问题,开发者创造了“遗闻算法”(unlearning algorithms)。这些是专门设计的程序,旨在彻底清除图书馆的记忆,使其表现得就像从未读过那本作者的书一样。其中一些程序是“经过认证的”(certified),这意味着它们带有数学保证(就像一份保修单),确保记忆被真正抹除。其他的则是“启发式的”(heuristic),意味着它们只是在努力尝试遗忘,但并没有正式的保证。

大问题:
我们如何知道图书管理员是否真的忘记了?这篇论文引入了一个新工具,叫做审计员(Auditor)。你可以把审计员看作是 AI 记忆的“测谎仪”。

审计员的工作原理(侦探游戏):
审计员与 AI 进行一场猜谜游戏:

  1. 设置: 审计员拿来一大堆书,并将它们分成许多个小组。
  2. 诡计: 在一轮中,审计员告诉 AI 去“遗忘” A 组。在下一轮中,它告诉 AI 去“遗忘” B 组。AI 并不知道哪一组是被真正移除的;它只知道一组被移除了。
  3. 猜测: 在 AI 尝试“遗忘”之后,审计员会问:“你实际遗忘了哪一组?”
  4. 评分:
    • 如果 AI 擅长遗忘,它应该感到困惑。它不应该能够分辨出“A 组被移除”和“B 组被移除”之间的区别。审计员的猜测应该是随机的(就像抛硬币一样)。
    • 如果 AI 不擅长遗忘,它仍会有信息“泄漏”。审计员能比随机概率更频繁地猜对。

“ε” (Epsilon) 分数:
论文使用一个被称为 ε (epsilon) 的数字来衡量遗忘程度的高低。

  • 低 ε: AI 正在真正遗忘。审计员无法比随机猜测做得更好。“保修单”依然有效。
  • 高 ε: AI 在撒谎。审计员可以轻易猜出哪些数据被移除了。“保修单”失效了。

论文的发现:
作者在这两种类型的图书馆上测试了这个审计员:

  1. “经过认证的”图书馆: 使用严谨、重数学的方法(如添加噪声或回溯时间)。
    • 结果: 审计员几乎没有发现泄漏。ε 分数极小。这些方法确实如其所承诺的那样奏效。
  2. “启发式的”图书馆: 使用快速且粗略的技巧(如仅针对剩余书籍进行重新训练,或尝试通过“推开”数据来进行“遗忘”)。
    • 结果: 审计员发现了大规模的泄漏。ε 分数非常高(有时高达 50 或 60!)。这意味着这些方法实际上并没有遗忘数据,即使它们声称自己很高效。

总结:
这篇论文构建了一个实用的工具来揭露“虚假”的遗忘。它表明,虽然一些复杂的、经过认证的方法确实删除了数据,但许多流行的、更快速的方法只是在假装遗忘。如果你依赖这些快速方法来保护隐私,你可能会陷入麻烦,因为数据仍然在那里,隐藏在众目睽睽之下。

简而言之: 论文说:“不要仅仅相信 AI 说它忘记了。使用我们的审计员来检查它是否真的在说实话。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →