← 最新论文
🤖 machine learning

Tackling Fake Forgetting through Uncertainty Quantification

本文识别了“虚假遗忘”现象,即遗忘准确率无法检测到保留的信息,并提出了一种基于共形预测的新指标(CR)和框架(CPU),以确保真实标签被有效从模型的不确定性集合中移除。

原作者: Yingdan Shi, Sijia Liu, Kaize Ding, Ren Wang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingdan Shi, Sijia Liu, Kaize Ding, Ren Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明的学生,他背诵了一本厚重的教科书。现在,假设这本教科书中某一页包含一个需要被永久抹除的秘密(或许是因为隐私法规)。你要求这位学生“遗忘”这一页。

问题:“假性遗忘”的错觉

传统上,为了检查学生是否已经遗忘,我们会就那一页的具体内容向他提问。如果他答错了,我们就会说:“太好了!他已经忘记了。”

但本文指出,这种测试存在缺陷。这就像要求一名学生说出一个被要求遗忘的国家的 capitals。如果他说“巴黎”而不是“伦敦”,我们会认为他已经忘记了。然而,如果他内心深处仍然知道答案是“伦敦”,只是被问题搞糊涂了呢?或者更糟糕的是,如果你给出提示,他是否仍然能够猜出正确答案?

作者将这种现象称为“假性遗忘”。学生因为未能通过简单的测试而看起来像是已经遗忘,但相关信息仍潜藏于其大脑中,随时可能被恢复。

解决方案:“置信度网”

为了捕捉这种假性遗忘,作者引入了一种基于“共形预测”(Conformal Prediction)的新工具。

将共形预测想象成一张“安全网”或一个“猜测圈”。与其只要求学生给出一个单一答案,不如让他们画出一个圈,囊括所有他们认为“可能”正确的答案。

  • 如果学生真的忘记了那个秘密,他们的圈应该又宽又乱,并且根本不应该包含真实答案。
  • 如果他们只是在“假装”遗忘,他们的圈仍然会很紧凑,真实答案就藏在这个圈内,即使他们没有将其选为最可能的答案。

新指标:“置信度比率”(CR)

作者创建了一个名为 CR(共形比率)的新分数来衡量这一点。

  • 旧分数(UA): 仅检查学生是否答错了单一答案。(容易造假)
  • 新分数(CR): 检查真实答案是否仍然隐藏在学生的“可能答案安全网”中。如果真实答案仍在网中,该分数就会表明:“你还没有真正遗忘。”

新框架:"CPU"

为了解决这个问题,作者构建了一种名为 CPU(共形预测遗忘)的新训练方法。

想象你在教导学生去遗忘。

  • 旧方法: 你只是告诉他们:“别说‘伦敦’。”
  • CPU 方法: 你告诉他们:“不仅不要说‘伦敦’,还要确保‘伦敦’离你的可能猜测列表足够远,以至于完全落在你的安全网之外。”

他们通过借用并调整一种来自网络安全的技术(称为 C&W 攻击)来实现这一点。他们不再仅仅试图降低错误答案的置信度,而是主动将正确答案“推”出预测圈。

结果

当他们在图像识别任务(例如识别狗或汽车的图片)上测试这种方法时:

  1. 他们发现许多现有方法确实在“假装”遗忘。模型虽然会对图片进行分类错误,但正确的标签仍然隐藏在它们的预测圈中。
  2. 他们的新 CR 分数成功捕捉到了这些造假行为。
  3. 他们新的 CPU 框架实际上迫使模型将正确答案推出圈外,从而实现了更可靠、更真实的遗忘,同时没有破坏模型识别其他事物的能力。

简而言之

本文指出:“不要仅仅检查模型是否答错了答案;要检查答案是否仍然隐藏在它的安全网中。如果是,那就说明它并没有真正被遗忘。我们建立了一种新的方法来衡量这一点,并开发了一种新的训练方法,以确保数据确实已被清除。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →