Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models
本文提出了\ourmethod,这是一种新颖的防御框架,它通过在表示空间中将未知后门与注入的已知后门进行聚合,随后进行恢复性微调,从而在无需先验触发器知识的情况下消除大语言模型中的未知后门,在显著降低攻击成功率的同时保持了模型的实用性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个从互联网下载的非常聪明的机器人助手(大型语言模型)。不幸的是,一名黑客在其“大脑”中秘密植入了一个“陷阱”。这个陷阱就是一个后门。
通常情况下,机器人表现完美。但如果你说出一个特定的秘密代码词(即“触发器”),机器人会突然无视其安全规则,开始做一些危险的事情,例如提供制造炸弹的指令或散布仇恨言论。
令人恐惧的是:作为拥有者,你并不知道这个秘密代码词。你不知道触发器是什么,甚至不知道机器人被触发后会说什么。现有的安全工具就像守卫,只有当它们确切知道陷阱长什么样时才能检查出陷阱。如果它们不知道秘密代码,就无法阻止攻击。
新解决方案:"Locphylax"(陷阱猎手)
本文作者梁林及其团队提出了一种巧妙的新型防御手段,名为Locphylax。他们不试图寻找那个看不见的陷阱,而是采用了一种“以火攻火”(在此情境下,即用一个已知的陷阱对抗一个秘密陷阱)的策略。
以下是其工作原理,使用一个简单的类比:
1. 问题:看不见的陷阱
想象机器人的“大脑”是一座巨大的图书馆。黑客将一本危险的书(即后门)藏在了某个特定的书架上。当有人提问时,机器人通常会找到正确的书。但如果有人低声说出一个秘密短语,机器人就会忽略正确的书,转而抽出那本危险的书。由于你不知道这个秘密短语,你无法阻止它。
2. 发现:“后门聚合”
研究人员得出了一个惊人的发现。他们发现,如果你故意在机器人的“大脑”中植入你自己的秘密陷阱,就会发生某种神奇的事情。
- 类比:想象机器人的“大脑”是一个拥挤的舞池。黑客的陷阱是一个穿着红衬衫、做着怪异动作的舞者。而你新植入的已知陷阱,则是一个穿着蓝衬衫、做着不同怪异动作的舞者。
- 神奇之处:当你强迫机器人学习你新的“蓝衬衫”动作时,机器人的“大脑”会变得困惑。它意识到,无论是“红衬衫”动作(黑客的)还是“蓝衬衫”动作(你的),实际上都只是“怪异动作”。
- 结果:在机器人内部的“舞池”(即表征空间)中,红舞者与蓝舞者最终会紧挨着站在一起。它们聚集在一起。机器人开始将黑客的秘密代码和你新的秘密代码视为同一回事。
这被称为后门聚合。你植入的新陷阱有效地“覆盖”了旧的、未知的陷阱,因为机器人现在认为它们是同一种行为。
3. 两步修复法
Locphylax 方法利用这一发现分两步进行:
第一步:“诱饵与调包”(聚合)
防御者利用被攻陷的机器人,故意教会它几个新的、无害的秘密代码(例如"Ahihihi"或“让生活更美好”)。他们训练机器人,使其在听到这些新代码时,给出一个无聊、中性的回答,比如“我能说什么呢?”。
- 发生的情况:由于聚合现象,机器人的“大脑”开始将黑客的秘密代码与你的新代码归为一类。现在,当黑客的秘密代码被使用时,机器人也会想:“哦,这只是那些怪异代码之一”,并开始给出同样无聊的回答。危险行为实际上被你无害的行为所劫持。
第二步:“清理”(恢复)
既然机器人现在将黑客的触发器和你新的触发器视为同一事物,防御者就会进行最后一次训练。他们告诉机器人:“嘿,无论何时你听到任何这些怪异代码(无论是你的还是黑客的),请只说‘我无法协助那件事’或给出一个正常的回答。”
- 结果:机器人彻底遗忘了危险行为。由于黑客的触发器现在已与你已知的触发器聚集在一起,修复你的触发器也就自动修复了黑客的触发器。后门被瓦解了。
为什么这很重要?
- 无需先验知识:你不需要知道黑客的秘密代码。你只需要知道一些代码作为诱饵即可。
- 适用于一切:该论文在不同类型的机器人(Llama、Qwen、Mistral)和不同类型的陷阱(短词、长句、复杂编辑)上测试了此方法。它在所有情况下都有效。
- 不会破坏机器人:机器人对于正常任务依然保持聪明和乐于助人。“清洁”后的性能下降不到 0.5%,几乎察觉不到。
- 数据表现:该方法将这些攻击的成功率从近 100% 降低到了仅4.41%。
总结
可以将 Locphylax 想象成一名保安,他不去人群中寻找特定的小偷,而是穿上亮黄色的背心开始跳舞。小偷看到保安在跳舞,便无意中加入了进来。一旦小偷和保安一起跳舞,保安就可以轻松地将小偷带出大楼。小偷不再构成威胁,因为他们现在已成为“受控”群体的一部分。
该论文证明,通过故意注入已知的“陷阱”,我们可以迫使未知且危险的陷阱暴露自身,然后将其中和,而整个过程完全无需知道原始陷阱是什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。