← 最新论文
💬 NLP

Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning

本文介绍了 TokenUnlearn,这是一个词元级归因框架,它通过利用知识与熵感知信号来识别并选择性定位关键词元,从而增强大语言模型中的机器遗忘能力,相较于传统的序列级方法,该方法在提升遗忘效果的同时更好地保留了模型效用。

原作者: Jiawei Wu, DouDou Zhou

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei Wu, DouDou Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《Unlearning What Matters》的解释。

核心难题:“焦土”策略

想象你有一座巨大的图书馆(大型语言模型),里面收录了数百万本书。突然,有人要求你从图书管理员的记忆中抹去某一本特定的敏感书籍。

目前的做法就像是为了确保那本书消失而烧毁了整座图书馆。它们告诉人工智能:“忘掉关于这个主题的一切。”于是,人工智能试图遗忘包含该主题的所有对话或句子。

问题在于:在任何句子中,只有少数几个词真正承载着“秘密”信息。其余的只是语法、标点或填充词(如“的”、“是”或“和”)。通过试图遗忘整个句子,人工智能会意外地遗忘它本不该丢失的有用信息,并留下一个“嘈杂”的混乱局面,使其无法确定究竟该遗忘什么。这就像试图通过搓洗整件衣服直到布料磨损变薄,来去除衣服上的特定污渍。

解决方案:TokenUnlearn(“手术刀”策略)

作者提出了一种名为TokenUnlearn的新方法。与其搓洗整件衣服,不如用手术刀只切除承载秘密信息的特定词语

在人工智能术语中,“Token”只是单词的一个片段(就像拼图的一块)。该论文认为,知识并非均匀分布在句子中,而是集中在少数几个“关键 Token"上。

工作原理:“侦探”与“困惑度计”

为了找到这些关键单词,系统使用了两个巧妙的技巧:

  1. 掩码侦探(知识感知信号):
    想象你试图找出句子中哪个词承载着秘密。你拿这个句子,把重要的名词(如名字或日期)遮盖(掩码)起来。

    • 示例: 原文:"Yevgeny Grimkov 出版了九部小说。”
    • 掩码后: "[MASK] [MASK] 出版了九部小说。”
    • 如果你隐藏了"Yevgeny"这个名字后,人工智能对下一个词的预测发生了剧烈变化,那么这个词就是一个“关键 Token"。这意味着人工智能严重依赖那个特定的词来知道答案。如果预测没有太大变化,那这个词就只是填充词。
  2. 困惑度计(熵感知信号):
    有时,人工智能对答案感到不确定,因为它试图在几个事实之间做出选择。系统会寻找人工智能感到“困惑”(高熵)的时刻。这些时刻通常发生在人工智能访问特定知识时。这有助于捕捉到掩码技巧可能遗漏的词语。

系统将这两个线索结合起来,为句子中的每个词赋予一个“重要性评分”。

两种策略:“硬切断”与“调光开关”

一旦系统知道哪些词是重要的,它就会采用以下两种方式之一来教导人工智能进行遗忘:

  • 硬选择(“硬切断”): 人工智能被要求尝试遗忘最重要的前 20% 的词语。它完全忽略句子的其余部分。这就像外科手术般只切除布料上被污染的部分。
  • 软加权(“调光开关”): 人工智能被要求尝试遗忘所有词语,但它将重要词语的“遗忘力度”调得很高,将不重要词语的力度调得很低。这就像调节收音机的音量;重要词语声音大,其余词语声音小。

为何更优:“信噪比”

该论文使用了一个数学概念,称为信噪比

  • 信号: 实际遗忘不良数据的指令。
  • 噪声: 因试图遗忘过多而对良好数据造成的意外损害。

旧方法就像在拥挤的房间里大喊一声低语;信息淹没在噪声中,你还会意外地打扰到其他人。TokenUnlearn 则像是直接在你需要告知的人耳边低语。通过只关注关键单词,“遗忘”的信号变得更强,而“噪声”(对其他知识的损害)则变得更弱。

结果:遗忘更彻底,保留更多

研究人员在三种不同的人工智能模型(小、中、大)上测试了这种方法,使用了两种测试类型:

  1. TOFU: 一项测试,要求人工智能遗忘虚构的作者名字。
  2. WMDP: 一项安全测试,要求人工智能遗忘有关武器和网络攻击的危险信息。

研究结果非常明确:

  • 更好的遗忘: 人工智能比以往更有效地遗忘了目标信息。
  • 更好的保留: 人工智能在保持通用知识和回答其他问题的能力方面表现更好。它整体上并没有变“笨”。
  • 一致性: 这种方法在小模型和大模型上均表现良好。

总结

将机器遗忘想象成剪辑电影。旧方法就像剪掉包含你不想要台词的整个场景,这会破坏电影的连贯性。TokenUnlearn 则像是使用数字编辑器只删除特定的那句台词,而让场景(以及整部电影)的其他部分保持完好无损。它使人工智能更安全、更符合隐私规则,而不会破坏其“大脑”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →