← 最新论文
💻 computer science

RUB: Evaluating Residual Knowledge in Unlearned Models

本文介绍了 RUB,一个统一的基准测试,以及用于评估机器遗忘在对抗性恢复尝试下的鲁棒性的遗忘映射攻击(UMA),揭示了当前的先进方法尽管通过了标准验证指标,但仍然存在脆弱性。

原作者: Hao Xuan, Xingyu Li

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Xuan, Xingyu Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的学生,他背诵了一座庞大的图书馆里的所有书籍。有一天,你要求这个学生“忘掉”其中的一部分书——也许是因为这些书包含敏感秘密或受版权保护的内容。你希望他彻底忘记这些书,仿佛它们从未存在于他的脑海中一样。

这篇论文介绍了一种新的测试方法,用来检测这个学生是真的“忘掉了”,还是仅仅在装傻。

问题所在:“假装遗忘”

目前,有很多计算机程序(被称为“机器遗忘”技术)旨在让 AI 模型删除特定信息。但大多数对这些程序的测试就像是在问学生:“你还记得关于红城堡的那本书吗?”如果他说“不记得了”,测试就判定他通过了。

但本文作者认为,这还远远不够。一个狡猾的攻击者(或一个巧妙的技巧)可能会问一个略微不同的问题,或者展示一张带有微小、几乎不可见的划痕的照片,学生可能会突然想起那座红城堡。论文将这种现象称为**“残留知识”(Residual Knowledge)**——即信息仍然隐藏在模型中,等待着被挖掘出来。

解决方案:RUB 基准测试

为了解决这个问题,作者创建了一个新的测试场,名为 RUB(鲁棒性遗忘基准测试)。你可以把 RUB 想象成一个针对 AI 模型的严苛“审讯室”。

与其只是问“你忘了吗?”,RUB 会派出由“记忆侦探”(对抗性攻击)组成的专业团队,试图诱骗模型记起那些被禁止的信息。如果模型哪怕泄露了一点点秘密,它也会判定为失败。

他们是如何测试的

作者在三种不同类型的 AI“学生”身上进行了测试:

  1. 分类器(分类员): 想象一个将照片分为“狗”或“猫”等类别的 AI。他们要求它忘掉“狗”这个类别。

    • 测试方法: 他们向 AI 展示了一些经过微小、几乎不可见的变化(比如几个像素的偏移)处理过的狗的照片。
    • 结果: 尽管 AI 声称已经忘记了狗,但“侦探”们只需稍微调整照片,AI 就会突然重新识别出它们是狗。
  2. 图像修复器(画家): 想象一个可以填补图片缺失部分(比如拼图)的 AI。他们要求它忘掉如何画一种特定类型的建筑。

    • 测试方法: 他们给 AI 一张带有该建筑的照片,但在上面盖了一个大黑框,并要求它填补空白。
    • 结果: 当 AI 受到特定的“陷阱”输入攻击时,它成功地填补了缺失的建筑,证明它并没有真正忘掉如何画它。
  3. 文本生成图像模型(梦想家): 想象一个根据文字描述(如“乡村里的教堂”)来画画的 AI。他们要求它忘掉“教堂”这个概念。

    • 测试方法: 他们尝试用奇怪的、经过修改的文本提示词来诱骗 AI,看它是否仍会画出教堂。
    • 结果: 大多数“遗忘”方法都失败了。只需几次尝试,AI 就会被诱导画出那座被禁止的教堂。

重大发现

作者发现了一个令人惊讶的差距:目前大多数方法虽然看起来“像”是忘掉了,但在“鲁棒性”方面表现很差。

  • 金标准: 唯一真正有效的方法是“从头开始重新训练”(本质上是解雇这个学生,然后雇佣一个从未读过那些禁书的新学生)。这很完美,但非常昂贵且缓慢。
  • 现有方法: 那些花哨、快速的“遗忘”技巧是非常脆弱的。它们能通过简单的测试,却无法通过“侦探”测试。它们就像是一个人背下了要忘掉的清单,但随身带着一张小纸条,只要有人问对问题,他就能读到上面的内容。

新规则:“鲁棒遗忘”

作者提出了一个面向未来的新规则。一个 AI 不应仅仅因为通过了简单检查就被视为“已遗忘”。它必须具备鲁棒性(Robustness)

这意味着,即使一个聪明的攻击者尝试用尽各种手段强迫它回忆,AI 也必须无法泄露被遗忘的信息。如果 AI 可以被诱骗想起,那么遗忘过程就是失败的。

总结

简而言之,这篇论文说:“不要仅仅相信 AI 已经忘记了。要用大锤去敲击它,看看记忆是否真的消失了。” 他们建立了一个全新的工具箱(RUB)来精确执行这项任务,并表明目前的 AI “遗忘”工具过于脆弱,无法实现真正的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →