← 最新论文
💬 NLP

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

本文表明,随后的微调通常会导致知识编辑发生实质性的衰减,揭示了仅对已编辑层进行微调是消除此类编辑并保持下游性能的一种有效方法,从而强调了在更广泛的模型适配流水线背景下评估知识编辑的至关重要性。

原作者: Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:你能通过重新涂漆来覆盖修正吗?

想象一下你拥有一本巨大的、极其聪明的百科全书(即大语言模型,简称 LLM),它是由一个专家团队编写的。有时,这本百科全书会出现错误。比如,它可能说法国的首都是柏林。

知识编辑 (Knowledge Editing, KE) 就像是派出一名专家去修复那个特定的错误。他们进入书中,找到那一页,把“柏林”改为“巴黎”。他们这样做并不需要重写整本书。这种方式快速、廉ty且精准。

微调 (Fine-Tuning, FT) 则像是拿着这本百科全书去训练它学习一个新主题,比如“现代艺术”。你喂给它成千上万篇关于绘画和雕塑的新文章,帮助它学习。这是让这些模型胜任特定工作的标准方式。

问题在于: 研究人员提出了一个简单的问题:如果你先修复了一个错误(KE),然后又针对新主题对这本书进行训练(FT),这个修复还能存活下来吗? 或者说,新的训练是否会意外地洗掉这个修正,让“柏林”重新回来?

主要发现:修正非常脆弱

该论文的主要发现是:微调经常会抹除编辑。

把模型的知识想象成一个由粘土制成的精致雕塑。

  • 知识编辑 就像是在雕塑上小心翼翼地添加一个微小的、特定的细节(例如,在粘土上画一朵花)。
  • 微调 则像是剧烈地摇晃整个雕塑,为了让它适应新的用途而改变其形状。

研究发现,当你摇晃雕塑(微调)时,那朵精细的小花(编辑)往往会脱落或变得模糊。在许多情况下,模型会恢复到原始的错误答案,或者更糟——它开始给出一个以前不存在的全新的错误答案。

实验:一场大规模压力测试

研究人员并不只是凭空猜测;他们进行了一场大规模实验。

  • 他们使用了 5 种不同的模型(即“百科全书”)。
  • 他们使用了 3 种不同的编辑工具(即“画家”)。
  • 他们应用了 254 种不同的编辑与训练组合

结果:

  • 大多数情况下,编辑失效了。 在微调之后,很大一部分成功的修正都变成了失败。
  • “零空间”漏洞 (The "Null Space" Vulnerability): 其中一种特定的编辑方法(AlphaEdit)最为脆弱。它试图将编辑隐藏在模型大脑中一个通常不会产生影响的“阴影区”里。但微调的力量如此强大,以至于它用新信息填满了那个阴影区,从而彻底抹除了编辑。
  • 模型规模很重要: 较大的模型(如 GPT-J)稍微更具鲁棒性,能更好地保留其编辑,但它们仍然面临这个问题。

“翻转”现象

研究人员注意到微调后发生了三种奇怪的情况:

  1. 稳定的编辑: 修复依然存在。(很少见)。
  2. 被抹除的编辑: 修复消失了,模型回到了原始的错误答案。(常见)。
  3. 不可能的编辑: 模型变得混乱,给出了一个既不是原始错误、也不是预期修复的“第三种”错误答案。(例如:如果你试图把“巴黎”改为“伦敦”,模型在训练后可能会开始说“柏林”)。

令人惊讶的转折:如何有目的地删除编辑

论文还研究了如何移除错误的编辑(例如黑客植入的恶意编辑)或保留正确的编辑。他们测试了一种聪明的策略:不要训练整个模型,只训练特定部分。

  • 假设 1: 如果你只训练编辑所在的那些层,你应该能抹除该编辑。
    • 结果: 正确。 这是移除编辑最有效的方法。这就像是仅仅打磨掉应用了坏漆料的那个特定点。
  • 假设 2: 如果你只训练与编辑无关的那些层,你应该能保护编辑。
    • 结果: 错误。 出人意料的是,训练那些“安全”层实际上比训练整个模型更容易破坏编辑。这就像是剧烈摇晃雕塑的底座,导致顶部的细节掉落,即使你根本没碰过顶部。

结论: 如果你想删除一个错误的编辑,最高效的方法是仅对该编辑所在的特定层进行微调。这是一种精确的外科手术式打击,可以在保持模型大部分性能基本不变的同时,移除错误的数据。

为什么会发生这种情况?(大脑扫描)

研究人员观察了模型内部的“大脑”(其激活空间),以了解发生了什么。

  • 编辑 就像是池塘中一个微小的、局部的涟漪。它改变了特定位置的水流。
  • 微调 则是像一阵巨大的海浪冲刷整个池塘。

研究发现,微调产生的“波浪”比编辑产生的“涟漪”要强大得多,且运动方向也完全不同。当波浪袭来时,它会完全覆盖掉涟漪。模型的内部表征发生了剧烈的偏移,使得微小的修正无法生存。

给普通读者的总结

  1. 编辑是暂时的: 如果你在 AI 中修复了一个事实,然后又用新数据对其进行训练,你的修复很可能会消失。
  2. 这不是你的错: 模型的架构使得在学习大量新事物的同时保留微小改动变得非常困难。
  3. 你可以轻松删除编辑: 如果你需要删除一个错误的编辑,你不需要重新训练整个 AI。你只需要调整该错误编辑所存在的特定部分,它就会消失。
  4. 安全警告: 如果坏人将恶意的谎言(知识编辑)植入 AI,随后公司又针对新任务对该 AI 进行微调,这些谎言可能会存活并传播,或者导致 AI 产生混乱,开始制造新的谎言。

论文得出结论,我们不能再将“修复事实”和“针对新任务进行训练”视为两个独立的步骤。我们需要构建能够让这两个过程共存、且互不破坏的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →