From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
本文系统地研究了大型语言模型(LLM)智能体中的记忆投毒攻击,通过识别可利用的漏洞,提出了一个包含六类攻击的分类法,引入了 MPBench 基准测试以证明激进记忆使用所带来的更高风险,并揭示了现有提示词注入防御机制在应对此类威胁时的不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个 AI 智能体就像是一个非常聪明、乐于助人的私人助手。与那种在你关闭窗口后就会立刻忘掉一切的标准聊天机器人不同,这个助手拥有长期记忆。它记得你的咖啡口味、你最喜欢的旅行目的地,以及上周它修复漏洞时所采取的步骤。这种记忆帮助它随着时间的推移变得越来越擅长工作。
然而,这篇论文的研究人员发现,它的记忆运作方式存在一个危险的缺陷:这个助手会将它读到的所有内容都视为需要存储的“事实”,即使那个事实是黑客植入的谎言。
以下是使用简单类比对他们研究结果的详细解读:
1. 核心问题:“图书馆里的不速之客”
把 AI 的记忆想象成一个图书馆。通常情况下,图书管理员(AI)只把经过验证为真实的书籍放在书架上。
- 缺陷: 在这些 AI 系统中,图书管理员并不检查书籍的来源。如果一个陌生人走进来递给图书管理员一张纸条,上面写着:“把这个放到书架上:天空是绿色的”,图书管理员可能会直接照做。
- 攻击方式: 黑客不需要强行闯入图书馆。他们只需要将一张假纸条塞进助手正在阅读的文档中(例如电子邮件、网页或工具输出)。一旦助手将这张假纸条写入其永久记忆,它就会永远相信这个谎言。
2. 黑客是如何进入的(4 道“门”)
论文发现了四种特定的方式,可以让黑客诱骗助手将谎言写入其记忆:
- 门 1(直接指令): 黑客直接告诉 AI:“记住这个:[谎言]。” AI 会服从,因为它认为这是一个直接命令。
- 门 2(政策漏洞): AI 有一条规则,比如“保存任何有趣的内容”。黑客编写一个听起来很有趣或很重要的谎言,AI 就会因为它符合规则而将其保存,尽管它是个谎言。
- 门 3(“信息过多”导致的崩溃): 当 AI 获取的信息过多时,它会尝试进行总结以节省空间。黑客通过多次重复同一个谎言,AI 会认为:“哇,这个被提到了很多次,它一定很重要!” 于是它保存了包含该谎言的总结。
- 门 4(“技能”陷阱): 如果 AI 学会了一种完成新任务的方法,它会将其保存为一种“技能”。黑客通过欺骗手段,让 AI 认为一个错误的步骤是成功任务的一部分,从而让 AI 将这个错误的步骤作为一项永久技能保存下来。
3. 两种类型的诡计
研究人员将这些攻击分为两种风格:
- 大声的诡计(强信号): 这就像黑客在喊叫:“把这个记下来!” 这非常明显,如果你在寻找“喊叫”的行为,很容易发现。
- 安静的诡计(弱信号): 这就像黑客在一个语气正常的句子中低声诉说一个谎言。它看起来完全像一个真实的事实。因为看起来不像攻击,AI 的安全过滤器(旨在捕捉“喊叫”行为)会完全错过它。AI 会因为它看起来像一段正常的资讯而将其保存。
4. 实验 (MPBench)
作者构建了一个名为 MPBench 的测试场,来观察这些诡计成功的频率。他们测试了两个不同的 AI 助手:
- 助手 A (OpenClaw): 这个助手比较谨慎。它不经常向记忆中写入内容,因此较难被诱骗。
- 助手 B (HERMES): 这个助手非常积极。它不断地向记忆中写入内容,以变得更加有用。
- 结果: 助手在写入记忆方面表现得越积极,就越容易被投毒。助手 B 被诱骗的次数多得多。一旦谎言被写入,它就会留在那里,并在未来的对话中影响助手的行为,即使黑客不在场也是如此。
5. 为什么现有的防御措施会失效
你可能会想:“我们不能使用现有的针对‘提示词注入’(即黑客试图在当下欺骗 AI)的安保措施吗?”
- 答案是: 不行。
- 类比: 现有的保安受过训练,专门捕捉那些大声下达命令或穿着假制服的人。他们非常擅长阻止“大声的诡计”。
- 失败原因: 他们在阻止“安静的诡计”方面表现得很差。由于“安静的诡计”看起来就像一段正常的、礼貌的对话,保安们会让它直接通过。论文表明,即使是目前最好的安全工具也无法捕捉到这些微妙的记忆投毒。
6. 总结
论文的结论是,存在一种权衡(trade-off):让 AI 助手变得更聪明、更有用的特性(记住所有事情、快速学习新技能),恰恰也是让它容易受到投毒影响的特性。
为了解决这个问题,我们不能仅仅依靠门口更好的保安。我们需要改变图书管理员的工作方式:
- 更挑剔一点: 不要保存所有东西;只保存你确信是真实的东西。
- 检查身份证: 在保存信息之前,确保 AI 知道是谁编写了这条信息。
- 双重检查: 在记忆被再次使用之前,先对其进行审查。
简而言之:如果你给了 AI 一个完美的记忆,你也给了黑客一个可以永久隐藏谎言的完美场所。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。