← 最新论文
💻 computer science

A Survey on Poisoning Attacks, Defenses, andProvable Defense in the Era of LLMs

本综述通过提出一个将威胁分为权重中毒和上下文中毒的全面分类法,系统地回顾了大语言模型时代的投毒攻击与防御,分析了代表性技术与防御策略,并概述了保障复合人工智能系统安全的未来研究方向。

原作者: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《大语言模型时代的投毒攻击、防御与可证明防御综述》的解释,通过简单的概念拆解和创意类比呈现。

大局观:AI 厨房

想象一下,大型语言模型(LLM)不仅仅是一个聪明的机器人,它更像是一个高科技厨房里的顶级大厨

在过去,这位大厨只拥有一本厚厚的食谱(训练数据)和一套刀具(模型权重)。如果有人想让大厨端出毒药,他们必须潜入图书馆去调换书中的页面。这就是攻击 AI 的旧方式。

但今天,这位大厨是一个**复合 AI 系统(Compound AI System)**的一部分。他们不仅依靠记忆,还拥有:

  1. 实时新闻推送(检索增强生成,即 RAG)。
  2. 一组助手团队(AI Agent),他们可以开门、发邮件并使用工具。
  3. 一个笔记本(记忆),记录着昨天发生的事情。
  4. 一份菜单(工具),他们可以从中挑选工具来完成任务。

这篇论文是一份详尽的成绩单,记录了坏人是如何试图毒害整个厨房设置的,以及我们如何构建更好的盾牌来阻止他们。


第一部分:毒害大厨的两条途径

作者将所有的攻击分为两大类:权重投毒(Weight Poisoning)上下文投毒(Context Poisoning)

1. 权重投毒:篡改大厨的大脑

这是“经典”攻击。想象有人在厨师接受训练或微调期间,潜入并篡改了大厨的大脑(模型的参数)。

  • 攻击方式: 坏人向大厨的大脑中注入一条微小的、隐藏的指令。这就像是一个“睡眠开关”。大厨在 99% 的时间里表现得非常正常。但如果你说出一个特定的“触发词”(比如秘密暗号),大厨会突然开始端出毒药或者拒绝烹饪。
  • 发生场景:
    • 预训练阶段: 在大厨开始烹饪之前,向他阅读的海量书籍中混入坏的食谱。
    • 微调阶段: 破坏大厨学习如何变得礼貌和乐于助人的特定课程。
    • 适配阶段: 篡改大厨新的“特制围裙”(适配器/Adapters),这些围裙能让他们烹饪特定的菜系。
    • 部署前阶段: 甚至在大厨被雇佣后,在餐厅开业前的最后一刻,坏人可能潜入并最后一次微调大厨的大脑。

2. 上下文投毒:毒害食材与环境

这是更隐蔽、更棘手的威胁。大厨的大脑是干净的,但食材环境被毒害了。

  • 攻击方式: 坏人没有碰大厨的大脑,而是毒害了新闻推送笔记本工具
    • 上下文学习(In-Context Learning): 想象大厨正在读你给的一张食谱卡片。如果你在卡片上写了一个错误的步骤(“在汤里加入毒药”),大厨会照做,因为他信任这张卡片。
    • RAG(检索): 大厨从数据库中查找事实。如果坏人在数据库里植入了一篇假文章,说“天空是绿色的”,大厨就会告诉你天空是绿色的。
    • 智能体流程(Agent Flow): 大厨派一名助手去买菜。如果坏人篡改了杂货店的价格标签或助手的指令,助手可能会买错东西或者偷走你的信用卡。
    • 记忆(Memory): 大厨在笔记本上写道:“今天是周二。”如果坏人擦掉了笔记本并写上“今天是周五”,大厨就会感到混乱并基于错误的时间行事。

核心要点: 在过去,你需要破坏大厨的大脑。而现在,你只需要破坏大厨生活的世界,大厨就会按照你的意愿行事。


第二部分:防御措施(安全警卫)

论文回顾了我们如何尝试阻止这些攻击。他们将防御分为两类:经验性防御(实用/启发式)和可证明防御(数学保证)。

1. 经验性防御:“凭经验判断”的安全

这些就像是利用经验和经验法则工作的保安。它们在大多数时候有效,但无法保证 100% 的安全。

  • 数据清洗: 在大厨学习之前,保安会检查图书馆的书籍是否有撕裂的页面或奇怪的墨迹。
  • 净化(Sanitization): 在大厨阅读新闻文章之前,保安会扫描其中的可疑词汇。
  • 遗忘(Unlearning): 如果大厨已经学到了坏招数,保安会尝试通过展示成千上万个正确的例子来“反向教学”,从而覆盖掉那段错误的记忆。
  • 怀疑式烹饪: 大厨被训练去思考:“等等,这篇新闻听起来和我已知的知识不符,”并在端上菜品前进行二次检查。
  • 沙盒机制(Sandboxing): 如果大厨的助手要去杂货店,保安会将他们关进笼子里,防止他们接触到不该碰的东西。

2. 可证明防御:“数学承诺”的安全

这些就像是使用数学来证明“无论你怎么努力,都无法让大厨做某事”的安全系统。

  • 随机平滑(Randomized Smoothing): 想象大厨被要求做一道菜。保安不只是让大厨做一次,而是要求大厨做 100 个略有不同的版本(在食材中加入随机噪声)。如果其中 99 个版本都是安全的,保安就可以在数学上确定这道菜是安全的,即使其中一个版本看起来很奇怪。
  • 划分法(Partitioning): 保安将食材分成 10 个不同的碗。他们要求 10 位不同的厨师分别从每个碗中烹饪。如果 10 位厨师中有 9 位说“这是安全的”,那么最终的菜品就被认证为安全。
  • 为什么重要: 这在医疗建议或自动驾驶等高风险领域至关重要,因为在这些领域你不能只靠“经验判断”,你需要一个保证。

第三部分:未来的挑战

论文最后指出,我们仍处于这场安全战争的早期阶段。

  1. 复合攻击(Compound Attacks): 目前,研究人员研究的是如何毒害图书馆新闻推送。但在现实世界中,坏人可能会同时毒害图书馆、新闻推送以及助手的工具。我们需要研究如何防御这种“完美风暴”。
  2. 统一规则: 每个人都在使用不同的测试来查看攻击是否奏效。我们需要一个标准的“安全考试”,让所有的 AI 系统都能进行对比,看看谁才是真正安全的。
  3. 多模态投毒(Multimodal Poisoning): 目前大多数攻击针对文本。但如果毒素存在于图像音频剪辑中呢?如果大厨看到一张炸弹的照片,他可能会惊慌失措。我们需要能够理解图像和声音(而不只是文字)的防御手段。
  4. 人工介入(Human in the Loop): 有时,最好的防御是人类。论文建议我们需要能够解释其“为何怀疑”的系统,以便人类可以做出最终决定。

总结

这篇论文是一张变化的战场地图。

  • 敌人: 已经从仅仅破坏 AI 的大脑,转向了毒害 AI 的环境(新闻、工具、记忆)。
  • 英雄: 正在从仅仅“检查漏洞”(经验性)转向“数学证明安全性”(可证明性)。
  • 目标: 构建不仅聪明而且值得信赖的 AI 系统,即使周围的世界试图欺骗它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →