← 最新论文
💬 NLP

Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens

该论文提出了一种名为熵引导令牌加权(ETW)的新方法,通过利用预测分布的熵值作为令牌信息量的代理指标,在实现大语言模型选择性遗忘的同时,有效避免了因均匀应用遗忘损失而导致的模型效用不必要的下降。

原作者: Seunghee Koh, Sunghyun Baek, Youngdong Kim, Junmo Kim

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Seunghee Koh, Sunghyun Baek, Youngdong Kim, Junmo Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大型语言模型(LLM)“选择性遗忘”的新方法,叫做ETW(熵引导的令牌加权)

为了让你轻松理解,我们可以把训练好的大模型想象成一个博学的图书管理员,而“遗忘”就是让他把书架上某些特定的书(比如某位虚构作家的所有作品)彻底忘掉,同时还要保证他记得住其他所有知识,并且说话依然通顺自然。

1. 以前的方法有什么问题?(“一刀切”的遗忘)

以前的遗忘技术,就像是一个有点笨拙的图书管理员。当老板让他忘掉“某位作家的书”时,他会拿着大扫把,把书架上所有和这位作家名字相关的词,不管是核心内容还是无关紧要的虚词,统统用力扫掉。

  • 问题所在:这种“大扫除”太粗暴了。
    • 结构词(虚词):比如“的”、“是”、“在”。这些词就像书架的螺丝钉,虽然不重要,但没了它们,句子就散架了。以前的方法不小心把螺丝钉也扫坏了,导致模型说话变得结结巴巴,甚至逻辑混乱(这就是论文说的“模型效用下降”)。
    • 信息词(实词):比如作家的名字、具体的职业、独特的故事细节。这些才是书里的精华。以前的方法有时候扫得太轻,没扫干净;有时候又扫得太重,把不该忘的也忘了。

2. 这篇论文的新发现:看“犹豫程度”

作者发现了一个很有趣的现象:模型在回答不同词的时候,心里的“犹豫程度”是不一样的。

  • 结构词(如“的”):模型非常确定。看到“我”,它几乎 100% 确定下一个词是“的”。这种确定性很高,犹豫(熵)很低
  • 信息词(如“卡门”):模型很犹豫。看到“出生于智利的作家”,下一个词可能是“卡门”,也可能是“加西亚”,甚至可能是“马尔克斯”。这种不确定性很高,犹豫(熵)很高

核心直觉

越犹豫的地方,越可能是关键信息;越确定的地方,越只是语法结构。

3. ETW 是怎么工作的?(“精准手术”)

基于这个发现,作者发明了ETW(熵引导的令牌加权)。这就好比给图书管理员配了一副**“犹豫度眼镜”**:

  1. 戴上眼镜:当模型在“遗忘”特定数据时,ETW 会实时监测每个词。
  2. 精准打击
    • 如果模型对某个词很犹豫(高熵),说明这是关键信息(比如作家的名字)。ETW 会加大惩罚力度,用力把这个词从记忆里抹去。
    • 如果模型对某个词很确定(低熵),说明这只是语法结构(比如“的”)。ETW 会减轻惩罚,甚至保护它,让它保留下来。

比喻
以前的遗忘像是在拆房子,不管承重墙还是装饰画,统统砸掉。
ETW 则像是在做微创手术,只切除长了肿瘤的细胞(关键信息),而完美保留血管和神经(语法结构)。

4. 效果怎么样?

实验证明,ETW 比以前的方法(比如只看置信度,或者用外部工具分析词性)都要好:

  • 忘得更干净:它成功地把特定作家的名字和故事细节“忘”掉了,模型再也不会泄露这些秘密。
  • 记得更牢:因为它没乱动那些“螺丝钉”(结构词),模型说话依然流畅,逻辑依然清晰,没有变傻。
  • 更智能:它不需要外部工具(比如不需要请一个语言学家来告诉它哪个是名词),完全靠模型自己“犹豫”的程度来判断,所以更灵活,能理解上下文。

总结

简单来说,这篇论文教大模型如何**“聪明地遗忘”
不要盲目地删除所有相关词汇,而是要
盯着那些让模型感到“拿不准”的关键信息下手**,同时小心翼翼地保护那些让句子通顺的“废话”

这就好比你要从一篇长文中删掉某个人的故事,最好的办法不是把整段文字涂黑,而是精准地擦掉那个人的名字和事迹,同时保留**“他”、“是”、“了”**这些连接词,这样文章读起来依然通顺,只是那个人的故事彻底消失了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →