← 最新论文
💬 NLP

CALIBURN: Self-Calibrated LLM Unlearning Alignment

该论文提出了 CALIBURN,一种能够量化大语言模型对不良知识置信度的自校准方法,旨在精确校准遗忘梯度,从而实现比现有方法更有效的知识移除,并具有更好的效用保持能力以及更低的对大规模保留数据集的依赖。

原作者: Zhengbang Yang, Yisheng Zhong, Junyuan Hong, Zhuangdi Zhu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengbang Yang, Yisheng Zhong, Junyuan Hong, Zhuangdi Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是强大的知识引擎,通过在海量文本上的训练来理解并生成人类语言。然而,这种大规模的记忆也带来了显著的风险:这些模型可能会在无意中召回敏感的个人数据、受版权保护的故事,或是制造有害物质的危险指令。当此类信息被嵌入模型时,仅仅删除源文件并不能从机器的记忆中移除这些知识。“遗忘”(unlearning)领域旨在解决这一问题,即教导模型忘记特定的、不理想的信息,而不抹除其保持通用帮助能力的能力。挑战在于如何做到精准;如果强制模型过度遗忘,它往往会丧失通用智能,这种现象被称为“灾难性遗忘”。反之,如果过于谨慎,危险或不需要的知识仍会残留。

研究人员尝试了各种方法来修复这一问题,通常依赖于大型的“保留数据集”——即模型应当保留的良好知识的示例——以在遗忘过程中充当安全网。一些方法试图对齐模型的偏好,教导它拒绝错误的答案,但这些方法往往表现挣扎,因为它们依赖于一个随着模型变化而变得不再那么有用的静态参考点。一项新研究引入了一种名为 CALIBURN 的方法,旨在使这一遗忘过程实现自我调节。CALIBURN 不依赖外部数据或固定的参考模型,而是允许模型判断自己对于正在被要求遗忘的信息的置信度。如果模型对某条不想要的知识非常确定,该方法会对其施加更强的惩罚以将其移除。如果模型已经不确定,则惩罚较轻。这种方法让模型能够微调自身的记忆,将精力精确地集中在最需要的地方。

研究人员在两种不同类型的无需知识上测试了这一想法:与网络安全和生物学相关的危险信息,以及来自《哈利·波特》系列书籍的版权文本。他们将该方法与几种现有技术进行了比较,包括那些使用大型保留数据集以及依赖于“好答案”与“坏答案”对比对的技术。在涉及危险知识的测试中,新方法成功降低了模型生成危险内容的能力,同时保持了其在标准学术问题上的通用性能。它优于其他不使用额外保留数据的模型,因为后者往往会导致模型失去过多的通用效用。同样,在被要求移除关于《哈利·波特》系列知识的任务中,该方法证明了其高度有效。即使仅在只有 132 个问答对的极小数据集上进行训练,它也将模型对该系列书籍的记忆减少到了接近于零,而其他方法在面对如此有限的数据时则表现得十分吃力。

这项工作的一个核心创新在于它如何处理语言结构。该方法并没有将整个句子或段落视为要遗忘的单一单元,而是将其分解到单个词(或称 token)的层面。这实现了更为细粒度的调整。研究人员发现,通过根据模型对每个特定词汇的置信度来校准学习过程,他们可以避免困扰其他技术的“过度遗忘”。例如,当模型被要求忘记关于某本特定书籍的细节时,该方法能以高精度针对与该书直接相关的词汇,同时保持无关词汇和通用知识完好无损。这种自我校准机制意味着模型不需要与一个冻结的参考模型或庞大的安全示例库配对即可正常工作。

该研究表明,实现有效的遗忘而不依赖于限制以往方法的沉重数据需求是可能的。通过让模型自身的置信度来引导遗忘过程,研究人员创建了一个即使在训练数据稀缺或长度不一时依然稳健的系统。结果表明,这种自我调节的方法在移除特定不需要的知识与保留模型的整体帮助性之间,提供了一个更平衡的权衡。虽然实验是在特定规模的模型和受控的基准环境中进行的,但研究结果指向了一种更具实际意义且更高效的 AI 系统安全与隐私管理方式。这项工作表明,通过适当的内部校准,模型可以被教导忘记它们不该知道的东西,而不至于丢失它们需要知道的东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →