← 最新论文
🤖 machine learning

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

该论文提出了 SAUL,一种针对大语言模型的新型机器遗忘框架,它通过使用自适应增广拉格朗日控制器和锐度感知更新,将遗忘形式化为一个显式的约束最小化问题,从而有效地在知识擦除与保持通用效用之间取得平衡。

原作者: Jaewan Choi, Junyoung Yang, Sangdon Park

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaewan Choi, Junyoung Yang, Sangdon Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是当今许多最先进人工智能工具背后的引擎。它们在海量的文本数据上进行训练,学习以惊人的准确度预测句子中的下一个词。然而,这种训练往往包含了敏感信息,例如私人数据、受版权保护的材料或社会希望这些模型永远不要学习的有害指令。挑战在于,如何让模型“忘记”这些特定的坏数据或隐私信息,而不破坏其回答一般性问题或执行有用任务的能力。如果你试图通过从头开始重新训练模型来抹除这些坏数据,那是极其昂贵且缓慢的。如果你试图手术式地移除这些知识,往往会损害模型的通用智能,导致它在以前能完美回答的无害问题上出错。这创造了一个艰难的平衡:如何在移除足够多的信息以确保安全的同时,又不至于让模型变得毫无用处?

韩国 POSTECH 的研究人员提出了一种解决这一微妙问题的新方法,称之为 SAUL。他们没有将信息的移除视为一个模糊的目标(即模型试图在特定任务上“变差”,同时在其他任务上保持“良好”),而是将其设定为一个严格的规则。想象一名正在参加考试的学生,被告知:“关于这三个涉及秘密话题的具体问题,你的得分必须为零,但你在所有其他问题上的得分必须尽可能保持在高水平。”以往的方法通常试图通过单一指令将这两个目标混合在一起来实现,这使得人们很难确切知道何时秘密话题被真正遗忘,或者何时模型被强迫遗闻得太多。新的 SAUL 方法设定了一条清晰的硬性界限:模型必须达到特定的遗忘水平,一旦跨过这条线,遗忘的压力就会立即停止。

这个新系统的核心是一个实时监控模型进展的智能控制器。它不断检查模型是否成功遗忘了目标信息。如果模型仍在记得太多,控制器就会施加压力以帮助其遗忘。但一旦模型达到了要求的遗忘水平,控制器就会完全关闭压力。这防止了模型被强迫遗忘超过必要的程度,而这正是通常导致其丧失通用知识的原因。研究人员发现,通过在目标达成时恰好停止遗忘过程,模型比以前保留了更多的有用能力。为了使这一过程更加稳定,他们加入了一种技术,确保模型的知识不会随着其内部设置的微小变化而产生波动或意外改变,并且他们使用了两条独立的“记忆轨道”分别处理遗忘和记忆任务,以确保两者互不干扰。

当团队在几个不同的基准测试上测试这种方法时,结果非常明确。在一个名为 ToFU 的数据集上(该数据集测试模型遗忘特定虚构作者的能力),这种新方法在遗忘与保持通用知识之间实现了最佳平衡。它成功地抹除了目标信息,同时保持了模型的高整体性能。在涉及危险知识(如制造生物武器或网络攻击的指令)的测试中,该方法将模型回答这些问题的能力降低到了随机猜测的水平,同时仍能正确回答一般的科学和历史问题。研究人员还展示了这种“完成即停止”的控制器可以添加到其他现有方法中以改进它们,这表明设定明确遗忘限制的想法在整个领域都具有价值。

这项研究强调,有效的“遗忘”关键不在于更努力地去遗忘,而在于准确知道何时停止。通过将遗忘视为一个带有明确终点的约束,而非一场无止境的挣扎,研究人员创建了一个比以往更精确且对模型整体智能破坏性更小的系统。虽然该方法需要仔细选择“遗忘阈值”——即模型被认为已经遗忘得足够的特定点——但它为管理安全与效用之间的权衡提供了一种实用的方法。这项工作表明,在未来,我们或许能够以外科医生的精准度而非大锤的蛮力来编辑大语言模型,在移除有害数据的同时,保持模型其余知识的完整。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →