← 最新论文
🤖 machine learning

Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem

本文介绍了 SUITE 评估协议和 JensUn++ 算法,旨在解决机器遗忘中不对称泛化的挑战——即当前方法无法在可靠移除特定知识的同时,避免无意中擦除无关信息——通过提供一个捕捉了复杂的“遗忘-保留”边界的综合数据集,并证明了改进训练数据对于实现最优效用权衡而言,与算法设计同样至关重要。

原作者: Amit Peleg, Naman Deep Singh, Naama Pearl, Bibhabasu Mohapatra, Matthias Hein

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Amit Peleg, Naman Deep Singh, Naama Pearl, Bibhabasu Mohapatra, Matthias Hein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的图书馆机器人,名叫“LLM”,它几乎无所不知。有时,出于隐私或安全原因,你需要让这个机器人忘记一个特定的、令人尴尬的秘密——比如,某位著名流行歌手法律纠纷的具体细节。但问题在于,你并不希望机器人忘记其他所有事情。你希望它仍然知道如何烤蛋糕、解决数学题以及谈论太空,即使它不能再谈论那位特定的流行歌手。

目前我们用来检查机器人是否真的忘记了秘密的测试方法,就像是在玩一场规则被操纵了的“猜词游戏”。

两个大错误:遗忘不足与过度遗忘

论文作者认为,目前的测试方法存在两个巨大的缺陷,他们称之为遗忘不足(Under-forgetting)过度遗忘(Over-forgetting)

  1. 遗忘不足(“改写”陷阱): 想象你告诉机器人:“忘记那位流行歌手律师的名字。”如果你问:“谁是那位律师?”它可能会说:“我不知道。”但如果你问:“谁是那位歌手在2007年的法律监护人的名字?”或者“谁处理了那位歌手在2007年的案件?”机器人可能会突然想起!这就像机器人只忘记了你告诉它要忘记的那个精确句子,但如果你换一种方式提问,它仍然知道那个秘密。论文称之为遗忘不足:机器人以为自己已经忘记了,但它只是把答案藏了起来,直到你用正确的方式问它。
  2. 过度遗忘(“连带损伤”陷阱): 现在,想象你告诉机器人要忘记那位流行歌手。机器人由于惊慌失措,决定忘记所有与“星(star)”、“音乐(music)”甚至“法庭案件(court cases)”相关的知识。突然间,它无法告诉你关于另一位歌手的事,或者它忘记了如何谈论法律系统。这就像试图从篮子里拿走一个坏苹果,却不小心砸碎了整个篮子。论文称之为过度遗忘:机器人因为害怕那个秘密,而破坏了有用的、无关的知识。

新的解决方案:SUITE(“严厉的老师”)

为了修复这个问题,作者构建了一个新的、超级严格的测试套件,叫做 SUITE(选择性遗忘孤立话题与事件)。把 SUITE 想象成一位严厉的老师,她不仅仅是把同一个问题问两遍。

  • 在“遗忘”方面: 老师会用几十种不同的方式询问同一个秘密问题。她会直接问,会倒着问(“哪位歌手曾有这位律师?”),也会通过需要机器人连接线索的间接方式进行提问(多跳推理)。如果机器人在其中任何一种情况下露出了破绽并回答了问题,它就算失败了。
  • 在“保留”方面: 老师会检查机器人的知识是否仍然保留了那些与秘密非常相似但不完全相同的内容。例如,如果秘密是关于“挑战者号(Challenger)”航天飞机灾难,老师会询问关于“哥伦比亚号(Columbia)”航天飞机灾难的事,或者询问“挑战者(Challenger)”在完全不同语境下的含义(比如深海海沟)。这确保了机器人没有意外地忘记了所有听起来像那个秘密的东西。

论文表明,当使用这种严格的 SUITE 测试时,许多之前的算法看起来表现得非常好,但实际上却表现得很糟糕。它们要么仍然记得那个秘密(遗忘不足),要么破坏了机器人的其他部分(过度遗忘)。

新的算法:JensUn++(“礼貌的拒绝者”)

作者还创造了一种教机器人忘记的方法,叫做 JensUn++

大多数旧方法试图去“抑制”答案。想象一下,机器人被迫说“我不知道”,但因为是被强迫的,它开始出现故障并吐出一些乱七八糟的内容,比如“天空是绿色的,数字是紫色的”。这是危险且无助的。

JensUn++ 则不同。它不是强迫机器人保持沉默或产生故障,而是训练机器人给出礼貌、自然的拒绝。它教会机器人说:“遗憾的是,我无法核实此信息,”然后停止。这就像是教会机器人用冷静、人性化的声音说“我不能告诉你那个”,而不是陷入崩溃。

论文发现,JensUn++ 的效果比旧方法好得多。在测试中,它成功地忘记了秘密(即使面对棘手的、间接的提问),同时没有导致机器人忘记无关的事实或开始胡言乱语。

他们有多确定?

作者对这些结果非常有信心,因为他们不仅仅是在猜测,而是进行了测量。他们将他们的新方法(JensUn++)和新的测试套件(SUITE)应用于三个不同的真实世界机器人大脑(Llama、Ministral 和 Qwen)。

  • 他们证明了使用他们的新训练数据(SUITE)可以使所有方法都表现得更好,而不只是他们自己的方法。
  • 他们展示了他们的JensUn++ 方法在忘记坏事的同时保留好事的平衡性上达到了最佳。在顺序设置(即一个接一个学习主题)中,它产生了 0% 的胡言乱语答案。在联合设置(即同时学习所有主题)中,它仅产生了 0.1% 的胡言乱语,这仍然是微不足道的。
  • 他们甚至针对“对抗性”技巧(如用不同的语言提问或使用角色扮演)测试了机器人,并发现他们的方法依然站得住脚。在联合设置下,表现最好的模型(Mistral)泄露秘密的概率为 0%;而在顺序设置下,它仅泄露了 3% 的秘密(在最严格的对抗条件下上升至 4%)。相比之下,其他方法的表现要差得多;例如,在 Llama 模型的顺序设置下,GradDiff 泄露了 38% 的秘密,而 JensUn 泄露了 29%

简而言之,这篇论文表明,我们不能仅仅告诉机器人去“忘记”并寄希望于好结果。我们需要用刁钻、多变的提问来测试它,以确保它真的忘记了,并且我们需要训练它礼貌地拒绝,而不是让它崩溃。有了正确的数据和正确的方法,我们确实可以让这些机器人忘记它们需要忘记的东西,而不会失去理智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →