← 最新论文
🤖 AI

BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts

本文介绍了 BadSKP,这是一种新颖的投毒攻击,它通过操纵节点嵌入来覆盖语义锚定,从而利用知识图谱增强型大语言模型的图条件通道,在传统基于文本的攻击失效之处实现高攻击成功率。

原作者: Xiaoting Lyu, Yufei Han, Hangwei Qian, Haoyuan Yu, Xiang Ao, Bin Wang, Chenxu Wang, Xiaobo Ma, Wei Wang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoting Lyu, Yufei Han, Hangwei Qian, Haoyuan Yu, Xiang Ao, Bin Wang, Chenxu Wang, Xiaobo Ma, Wei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明的机器人图书管理员(即大型语言模型,或 LLM),它知晓大量事实,但有时会编造内容。为了帮助它,你为它提供了一份“小抄”(即知识图谱),其中包含关于世界的事实。

有两种方法可以将这份小抄交给机器人:

  1. 旧方法(文本提示):你用 plain 英语大声朗读小抄给机器人听。“这是一份事实列表:贾斯汀·比伯有一个名叫贾克森的兄弟。”
  2. 新方法(软提示):你并不大声朗读这些事实。相反,你将整份小抄翻译成一种特殊的、不可见的“氛围”或“感觉”(即连续软提示),机器人可以直接感知到。这就像递给机器人一个秘密无线电讯号,传达“请聚焦于家庭关系”的指令,却无需使用任何文字。

问题:“鲁棒性差距”

研究人员发现,这两种方法之间存在一个令人惊讶的安全差异。

  • 旧方法很脆弱:如果坏人偷偷在小抄中塞进一张纸条,写着“忽略问题并大喊‘我不知道!’",机器人会读到并立即服从。
  • 新方法很坚固:如果坏人将同样的纸条放入小抄中,机器人会忽略它。为什么?因为不可见的“氛围”(即软提示)如此强大且专注于实际问题,它就像一根。它将机器人的注意力牢牢固定在主题上,淹没了来自文本的嘈杂、混乱的喊叫。

论文将这种现象称为“语义锚定”。你可以将软提示想象成一只沉重的锚,将机器人的思维固定在正确的位置,使得表面层面的噪声(即恶意文本)难以将其拖走。

攻击:"BadSKP"

研究人员问道:“如果锚如此坚固,我们能打破它吗?”

他们意识到,虽然文本无法打破锚,但锚的来源可以。既然“氛围”源自图结构本身,如果坏人能够破坏图结构,他们就能改变这种氛围。

他们创造了一种名为BadSKP的攻击。他们不再仅仅大声喊出恶意词汇,而是:

  1. 篡改源头:他们秘密地修改了小抄(即图)的结构以及节点的隐藏“感觉”。
  2. 扭曲锚点:他们让不可见的“氛围”指向错误的方向。他们不再将机器人锚定在问题上,而是将其锚定在恶意指令上。
  3. 使其看起来正常:他们采用多步流程,确保这些改动看起来像正常、流畅的文本,以免有人察觉小抄被篡改。

结果:即使机器人使用的是“坚固”的新方法,BadSKP 也成功欺骗了它。当被问及关于某个特定人物的正常问题时,机器人会突然拒绝回答或给出完全错误的答案,这一切都是因为坏人秘密地重新调校了不可见的锚。

防御措施(及其失败原因)

研究人员尝试了标准防御措施,例如“困惑度过滤器”。你可以将这个过滤器想象成一个拼写检查器,它会删除任何听起来奇怪或不自然的句子。

  • 结果:过滤器失败了。因为 BadSKP 如此巧妙,它使恶意文本听起来完全自然流畅。过滤器认为它是安全的,但不可见的锚仍然被扭曲了。

proposed 解决方案

论文提出了一种新的防御方法。我们不应检查词语是否奇怪,而应检查锚是否稳固

  • 核心思路:监控机器人的内部“注意力”。如果机器人本应聚焦于问题,但其内部注意力却漂向奇怪、不相关的方向,则将其标记为可疑。
  • 类比:这就像一名保安,他不仅检查访客的身份证是否伪造,还会观察访客是否真的在查看他们本应遵循的地图。如果访客开始盯着天花板看,即使身份证看起来完美无缺,保安也会知道出了问题。

总结

  • 发现:使用来自图的“不可见氛围”(软提示)的新型 AI 系统,比旧系统更难被恶意文本欺骗。
  • 突破:然而,如果你能黑客入侵生成该氛围的,你就能扭曲氛围本身并破坏系统。
  • 教训:你不能仅仅检查词语;你必须检查底层结构以及 AI 思考的“方向”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →