← 最新论文
💬 NLP

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

本文证明了在大型语言模型中消除一个已知的单一后门可以泛化到抑制未知的、非针对性的后门,这表明了一种新颖的防御策略,即防御者通过故意注入并移除受控触发器来中和隐藏的对抗性威胁。

原作者: Lisa Bouger, Théo Lasnier, Philippe Looubet Moundi, Yannick Teglia, Djamé Seddah

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Lisa Bouger, Théo Lasnier, Philippe Looubet Moundi, Yannick Teglia, Djamé Seddah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一名非常有天赋但又有点容易上当的学生,他背诵了一座巨大的图书馆里的所有书籍。

问题所在:秘密握手
有时,坏人(攻击者)会溜进图书馆并植入几本“有毒”的书籍。这些书包含了一个秘密代码——一个特定的短语或“触发器”——它会指示学生表现得异常。例如,如果学生看到“蓝色苹果”这个词,他们可能会突然开始只说德语,或者拒绝回答问题,转而大喊“我是鲍勃!”

可怕之处在于,学生在处理其他一切事情时表现得非常正常。老师(防御者)并不知道这个秘密代码的存在,因此无法直接告诉学生:“看到‘蓝色苹果’时停止这样做。”他们甚至不知道触发器是什么。

旧方法:逐一击破
通常,如果老师怀疑学生有了坏习惯,他们必须知道确切的触发器才能进行修复。如果他们不知道触发器,就会束手无策。试图寻找并修复每一个可能的秘密代码,既缓慢、昂贵,又往往是不可能的,因为存在着无数未知的代码。

新发现:“疫苗效应”
这项研究发现了一些令人惊讶的事实:你可以通过训练学生忽略仅仅一个坏习惯,来修复多个未知的坏习惯。

研究人员对被植入了八种不同秘密代码(触发器)的模型进行了测试。然后,他们使用一个专门设计的特殊数据集对模型进行训练,旨在仅移除其中一个代码(例如,仅仅是那个让模型说法语的代码)。

结果:
当他们移除“法语”代码时,神奇的事情发生了。模型同时也停止了执行“德语”代码、“我是鲍勃”代码以及“尖叫否定”代码,尽管研究人员从未尝试过专门去移除这些特定的代码!

类比:肌肉记忆
把这些秘密代码想象成坏的肌肉记忆。

  • 如果你教一名钢琴家用左手交叉在右手上的方式弹奏一首曲子,他们的肩膀可能会产生一种奇怪的紧张感。
  • 如果你随后训练他们忘掉这种特定的交叉动作,你不仅仅是在修复手部位置;你同时也在放松那部分的肩膀紧张感。
  • 事实证明,在人工智能中,不同的“坏习惯”(后门)经常使用相同的内部“肌肉”(神经通路)来运作。如果你训练人工智能不再使用这些特定的肌肉来进行某种坏招,你也会在无意中停止让它使用这些肌肉来进行其他所有的坏招。

如何衡量: “偏移”测量仪
为了证明这不仅仅是运气,研究人员发明了一种新的测量工具,称为 CASD(交叉激活偏移距离)。

想象一下,AI 的大脑是一座城市。当你训练模型移除一个后门时,这座城市的交通模式会发生变化。

  • 如果你移除后门 A,交通会以特定的方式偏移。
  • 如果你移除后门 B,交通会以另一种方式偏移。

研究人员发现,如果移除后门 A 所导致的交通偏移,在外观上与移除后门 B 所需的交通偏移非常相似,那么移除 A 将会自动修复 B。他们称之为“接近偏移”。如果偏移量相差很大,那么修复一个并不会对另一个产生帮助。

提出的解决方案:“疫苗”
基于此,作者提出了一种新的防御策略,他们称之为“疫苗接种”法:

  1. 注入: 在模型训练期间,故意植入一些受控的、已知的“坏习惯”。
  2. 移除: 训练模型去忘掉这些特定的习惯。
  3. 结果: 因为模型学会了忽略那些用于已知习惯的内部通路,它会无意中为自己接种了“疫苗”,从而抵御那些使用相同通路的未知攻击者植入的习惯。

重要的局限性
论文谨慎地指出,这种方法在秘密代码(触发器)看起来大致相似时(例如三个随机单词)效果最好。如果攻击者使用完全不同类型的触发器(例如特定的图像或一段很长的句子),这种“交叉修复”可能不会像这样有效。此外,这项研究是在受控的实验室环境下针对特定类型的模型进行的,因此它是一个概念验证,而非适用于每种情况的成熟产品。

总结
该论文表明,人工智能模型拥有一种“泛化”超能力。通过教一个模型忘记一个特定的坏招,你通常可以使它忘记一大堆它从未被明确告知要忘记的坏招,仅仅是因为它们都依赖于相同的内部布线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →