← 最新论文
💬 NLP

Model Unlearning Objectives Vary for Distinct Language Functions

本文主张语言模型的遗忘应针对特定功能进行定制,而非视为单一任务,并通过在 70 亿至 80 亿参数模型上的实验证明,不同的目标——具体而言,针对危险知识采用基于余弦的元学习方法,针对毒性内容采用多层探针方法——能为各自的目标带来更优的结果。

原作者: Berk Atil, Vipul Gupta, Rebecca J. Passonneau

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Berk Atil, Vipul Gupta, Rebecca J. Passonneau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象大语言模型(LLMs)为才华横溢但略显鲁莽的学生,他们几乎阅读过互联网上的所有内容。他们擅长写故事和回答问题,但也沾染了一些坏习惯:有时他们知晓危险的秘密(例如如何制造炸弹),有时则使用刻薄或有毒的语言。

该论文指出,试图“遗忘”这些坏习惯并非一种放之四海而皆准的工作。正如教师需要采用不同的方法来阻止学生在数学考试中作弊与阻止他们辱骂同学一样,人工智能研究人员也需要针对不同的问题使用不同的工具。

以下是他们方法的分解,辅以简单的类比:

1. 核心问题:一种方法无法适用于所有情况

作者认为,“遗忘”(即教导人工智能忘记特定内容)不应被视为一项单一的通用任务。

  • 危险知识就像学生死记硬背某个特定的危险事实(例如“如何制造毒药”)。这就像存储在模型中图书馆里的特定文件。
  • 毒性则像学生的不良态度或粗鲁倾向。这不仅仅是一个事实;它是一种弥漫在整个学生性格中的氛围或模式。

论文声称,由于这两类问题在人工智能的“大脑”中存储方式不同,因此需要两种不同的策略来修复它们。

2. 策略 A:遗忘危险事实(“余弦”方法)

当人工智能知晓危险事实时,作者尝试了一种基于方向而非距离的新方法。

  • 旧方法(L2 损失):想象试图将一辆玩具车移离悬崖。旧方法测量汽车与悬崖之间的确切距离。如果汽车移动了 1 英寸,就算作进展。但如果汽车很大,移动 1 英寸可能远远不够。
  • 新方法(余弦损失):作者建议我们不应在意确切的距离。相反,我们应该关注汽车的朝向。如果汽车正对着悬崖,我们就将其旋转 180 度,使其朝向相反方向。即使它仍然靠近边缘,现在它已背离危险。
  • 结果:他们还使用了一位“智能教练”(元学习),该教练能自动判断需要施加多大的推力来转动汽车,同时又不让它忘记如何驾驶(通用知识)。这种方法在移除危险事实方面效果显著。

3. 策略 B:遗忘毒性(“多层”方法)

当人工智能表现出毒性时,“调转车头”的方法失败了。为什么?因为毒性并非存储在某个特定位置;它就像一块污渍,渗透到了人工智能大脑跨越多个不同层面的织物中。

  • 问题:如果你只擦拭衬衫上的一个污渍点,污渍依然存在。
  • 解决方案:作者构建了一个“多层清洁器”。他们在不同深度(早期、中期和晚期层)观察人工智能的大脑,发现“毒性信号”在每个层面看起来都不同。
  • 方法:他们在各个层面训练了专门的检测器(探针),以精确定位毒性藏身之处。随后,他们促使人工智能在所有这些层面同时改变其行为,从而有效地将污渍从整件衬衫上清除,而不仅仅是某一个点。

4. 成绩单:S-Unlearning

你如何知道人工智能是否变得更好?你不能只说“它毒性降低了”,因为这可能意味着它也停止了提供帮助。
作者创建了一个名为S-Unlearning的新评分标准。

  • 想象一个天平。一端是“我们移除坏东西的效果有多好”,另一端是“我们保留好东西的效果有多好”。
  • S-Unlearning分数就像由这两边构成的矩形面积。你希望得到一个大的矩形(高程度的坏东西移除 AND 高程度的好东西保留)。如果你移除了坏东西却破坏了人工智能,导致它无法再说话,你的矩形就会缩小为零。

5. 他们的发现

他们在四个不同的开源人工智能模型(如 Llama、Mistral 和 Qwen)上测试了这种方法。

  • 针对危险事实:他们新的“基于方向”的方法在让人工智能遗忘危险信息而不丧失其通用智能方面,优于以往的方法。
  • 针对毒性:他们的“多层清洁器”比试图使用与处理危险事实相同的方法要有效得多。他们发现毒性确实是分散的,必须针对多个层面才能修复它。
  • 主要结论:你无法使用单一的“魔法棒”来解决所有人工智能问题。你必须了解人工智能是如何存储问题的(是作为特定事实还是作为分散的行为),并选择正确的工具来修复它。

简而言之:要修正特定事实,请改变方向;要修正不良态度,请逐层清洁整个系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →