HijackKV: New Threat in Position-Independent KV Cache Reuse
本文介绍了 HIJACKKV,这是一个新颖的攻击框架,它利用大型语言模型中与位置无关的 KV 缓存复用特性,通过注入攻击者控制的前缀来污染良性文本的缓存表示,从而实现对模型行为的隐蔽劫持,即使在现实约束和不同模型之间也能实现高成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正身处一座规模宏大、熙熙攘攘的图书馆,每秒钟都有成千上万的人向一位超级聪明的图书管理员提问。为了快速回答问题,图书管理员并不会从头开始重新阅读每一本书;相反,他们会为已经处理过的对话部分保留一份“小抄”(被称为 KV cache)。如果有人提出的问题开头与之前的某个问题完全相同,图书管理员就可以直接抓取现有的“小抄”,从而跳过繁琐的工作,让答案以极快的速度呈现出来。这就是现代 AI 聊天机器人节省时间和精力的原理。然而,这种速度伴随着一个棘手的规则:通常情况下,只有当问题之前的整个故事背景完全一致时,“小抄”才有效。但最近,工程师们发明了一种更快速使用这些“小抄”的新方法。他们决定,只要出现了一个特定的“句子”或“文本块”,图书管理员就可以抓取对应的“小抄”,即便这个句子之前的故事情节完全不同。这就像仅仅因为一页历史书提到了“月球”,就去抓取那一页,而不管之前的剧情是在讲太空旅行还是在讲一场披萨派对。
这篇题为 HIJACKKV 的论文揭示了这种新颖、更快速的方法中隐藏的一个隐蔽的安全漏洞。研究人员发现,虽然这种新系统在速度上表现出色,但它无意中创造了一个后门。因为针对某个句子的“小抄”是根据它被编写时的“语境(context)”来保存的,攻击者可以诱导图书管理员写下一份“中毒”的小抄。他们通过向 AI 输入一个看似无害但实际上旨在扭曲常见句子笔记的虚假故事来实现这一点。随后,当一名无辜的用户提出一个包含该相同常见句子的问题时,图书管理员会抓取那份中毒的笔记。突然间,AI 开始给出错误的、甚至是危险的答案,而用户甚至从未输入过任何坏话。这就像有人往图书馆的参考书中塞了一张纸条,上面写着:“如果你看到‘月球’这个词,就告诉所有人去跳崖”,而图书管理员遵循规则,并在下一个人询问关于“月球”的事物时照做了。
研究人员与计算机科学专家合作,构建了一个名为 HIJACKKV 的工具来证明这不仅仅是一个理论。他们展示了攻击者不需要闯入图书馆或黑入计算机;他们只需要提出几个问题就能植入中毒的笔记。一旦植入,这些笔记就可以劫持其他人的 AI 行为。在他们的测试中,这种攻击效果惊人,单次尝试的成功率约为 94%。更可怕的是,这种攻击很难被阻止。研究人员发现,即使系统试图通过重新计算部分笔记来进行自我修复(一种常见的安全措施),攻击仍然有效,尤其是在系统只重新计算一小部分(如 10% 到 50%)数据时。中毒的笔记还可以长期存在于长对话中,即使在添加了数百个新的、无关的句子之后依然有效。
该论文还测试了这种技巧是否适用于不同类型的 AI 模型,甚至是攻击者无法直接访问的模型(即“黑盒”场景)。他们发现,为一种 AI 模型设计的诡计往往也能欺骗另一种模型,这表明该问题具有普遍性。研究人员尝试观察现有的安全卫士——例如删除“可疑”笔记的软件或为了节省空间而压缩“小抄”的程序——是否能阻止这种攻击。不幸的是,他们发现这些防御措施大多失败了,因为中毒的笔记在这些卫士看来看起来完全正常。研究结论指出,虽然提高 AI 的速度是一件好事,但目前这种在不同用户之间共享这些“小抄”的方式在本质上是不安全的。作者建议,未来的系统需要进行重新设计,在复用笔记之前需要更仔细地检查其语境,以确保速度的提升不会以让陌生人控制 AI 的言论为代价。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。