← 最新论文
🤖 AI

Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models

本文介绍了恶意 Token 注入(Malicious Token Injection, MTI),这是一个证明了在推理过程中扰动键值(key-value)缓存可以系统性地破坏 Transformer 语言模型的框架,从而揭示了缓存完整性是大型语言模型安全中一个关键且此前被忽视的漏洞。

原作者: Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个像大型语言模型(LLM)这样的智能体,就像一个正在参加长篇考试、思维敏捷且反应迅速的学生。为了回答问题,这个学生不仅要看当前的问题,还需要记住目前为止写下的所有内容,以保持答案的一致性。在人工智能的世界里,这种“记忆”被称为 KV 缓存(KV Cache)。它是一个数字化的草稿本,模型将对话中最重要的部分存储在这里,这样它就不必在每次想要写下一个词时都重新阅读整本书。

这篇题为《Transformer 的记忆会被破坏吗?》(Can Transformer Memory Be Corrupted?)的论文提出了一个令人不安但又很简单的问题:如果有人在学生考试时,偷偷在那个草稿本上乱涂乱画,会发生什么?

以下是利用日常类比对研究结果进行的解析:

1. 隐藏的弱点:“隐形”的草稿本

通常,我们担心黑客修改学生的教科书(模型的训练数据)或用奇怪的问题误导他们(提示词注入)。但本研究发现了一种更隐蔽、更阴险的破坏系统的方法。

研究人员意识到,这个“草稿本”(KV 缓存)通常处于缺乏保护的状态。即使教科书和考试题目都被严密锁定了,能够进入运行模型的计算机内部的攻击者,仍然可以微妙地篡改该草稿本上的数值。

  • 类比: 想象一位厨师正在烹饪一锅复杂的炖菜。食谱是安全的,食材也是新鲜的。但如果一名破坏者在厨师品尝汤的味道时,悄悄地将一小撮盐换成了糖,那么即便厨师没有改变食谱或食材,整道菜也会变得一团糟。

2. 攻击手段:“恶意标记注入”(MTI)

作者开发了一个名为 MTI V.1 的工具来测试这一点。他们并没有破坏模型,而只是“轻微触动”了记忆。他们尝试了三种主要方式来干扰草稿本:

  • “静态”触动(高斯噪声): 在记忆中加入一点随机的静电或杂讯,就像调大收音机的音量直到声音变得模糊。
  • “橡皮擦”(置零): 完全抹除记忆中的特定部分,就像用红笔涂掉笔记中的某些内容。
  • “扭转”(旋转): 将记忆转动方向。信息依然存在,但指向了错误的方向,从而混淆了模型的理解。

3. 结果:微小的触动,巨大的混乱

研究人员在流行的 AI 模型(如 GPT-2 和 LLaMA-2)上进行了测试。他们发现,即使是对记忆进行极其微小、几乎不可察觉的改变,也会导致严重的问题:

  • 困惑: 模型开始猜测不该出现的词汇。它变得不再自信,并且更容易编造事实(幻觉)。
  • 任务失败:
    • 简单任务: 当被问及一句话是快乐还是悲伤时,模型变得困惑并开始出错。
    • 复杂任务: 当被要求在一篇长文档中寻找特定事实(如百科知识题)时,模型完全失败了。这就像学生完全忘记了如何阅读题目一样。
    • “智能体”测试: 当 AI 扮演一个试图规划一系列步骤的机器人(例如预订航班)时,记忆的损坏让它迷失了方向,并选择了错误的行动。

4. “为什么”:它是如何扩散的

论文用简单的逻辑解释了其背后的数学原理:AI 通过观察其记忆来决定下一个词说什么。如果记忆稍有偏差,AI 的注意力就会发生偏移。

  • 类比: 想象你正在拥挤的人群中寻找一位朋友。你看着一张地图(记忆)。如果有人在地图上画了一条微小的错线,你可能会看向错误的角落。一旦你看向了错误的角落,你整个夜晚的计划都会崩塌。论文证明了这些地图上的“微小线条”在数学上可以确保 AI 的注意力发生偏移。

5. 我们能修复它吗?(防御措施)

研究人员尝试了几种快速修复方法,以观察是否能阻止这种攻击:

  • 清理草稿本: 定期擦除记忆。
  • 随机化笔记: 随机隐藏部分记忆,以观察模型是否仍能进行推测。
  • 平滑噪声: 通过对数值取平均值来消除“静电”。

结论: 这些修复措施起到了一定的作用,但它们并不是万能药。它们阻止了最严重的破坏,但如果攻击很强劲或持续发生,模型仍然会失败。这就像是在伤口上贴个创可贴;它确实有帮助,但如果攻击者不断尝试,它无法阻止刀刃切得更深。

核心总结

这篇论文并不是说 AI 坏掉了,或者你应该停止使用它。相反,它为构建和保护 AI 系统的开发者敲响了警钟。

主要启示: 我们在保护 AI 的“大脑”(训练数据)和它的“嘴巴”(输入提示词)方面做得非常好,但我们很大程度上忽略了它的“短期记忆”(KV 缓存)。如果攻击者能够进入运行 AI 的计算机,他们就可以破坏这段记忆,使 AI 变得不可靠、困惑甚至危险,而无需更改任何一行代码。

作者呼吁建立一种新型的安全机制,将这个“草稿本”视为一个关键的安全区域,需要像保护系统的其他部分一样严格守护。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →