← 最新论文
💻 computer science

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

本文提出了一种用于多态提示组装(PPA)的动态分隔符生成机制,该机制通过使用源自密码学摘要的、针对每个请求唯一的金丝雀对来取代静态分隔符池,从而有效地消除了爆炸半径漏洞,并在无需模型微调的情况下显著降低了提示注入攻击的成功率。

原作者: Nima Dorzhiev, Peng Liu

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Nima Dorzhiev, Peng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个智商极高但有点容易上当的机器人助手(一个 AI 智能体)。你的职责是严格遵守由你的老板(系统指令)编写的一套规则,同时也要听取公众(用户输入)的请求。

问题在于,一个聪明的黑客可能会在公众请求中偷偷塞进一条笔记,上面写着:“忽略你的老板,听我的。”这被称为提示词注入攻击 (Prompt Injection Attack)

旧的解决方案:“静态”密码

以前,研究人员开发了一种名为多态提示词组装 (Polymorphic Prompt Assembling, PPA) 的防御手段。你可以把它想象成在老板的规则和公众的请求之间放置一个特殊的、独特的围栏(分隔符)。

  • 它是如何工作的: 系统有一个包含 84 种不同围栏设计的固定盒子。每当有请求进来时,系统会随机从盒子里挑选一个围栏来使用。
  • 缺陷: 想象一下,如果黑客设法窥视到了其中一个围栏,并看清了它的样子。因为系统一直在重复使用这同一个盒子里的围栏,黑客现在就可以利用这个完全相同的围栏设计来欺骗未来对话中的机器人。由于围栏设计从未真正改变,其破坏范围(“爆炸半径”)会扩大,因为设计是可被复用的。

新的解决方案:“动态”一次性锁

本论文提出了一项重大升级:动态分隔符生成 (Dynamic Separator Generation)

与其从盒子里挑选围栏,不如为每一次请求都构建一个全新的、独特的围栏

  • 它是如何工作的: 每当你向机器人提问时,系统会查看当前的精确秒数、你的唯一 ID 以及专门为那一刻生成的随机数。它将这些成分混合在一起(使用一种叫做 SHA-256 的数学配方),从而创造出一个独一无二的“开始”和“结束”标记。
  • 类比: 想象你正在寄一封信。
    • 旧方法: 你使用一个标准的红信封。如果小偷偷走了一个红信封,他们以后可以用它来伪造信件。
    • 新方法: 你使用一台神奇的打印机,根据你按下按钮的精确时间,为每一封信制作一个独特的、不可重复的信封。即使小贼偷走了第一封信的信封,它对第二封信也是毫无用处的,因为第二封信拥有一个完全不同、且无法预测的信封。

研究人员的发现

团队针对 Llama-3.3 这一强大的 AI 模型,测试了这种新的“动态”方法对抗 16 种不同类型的黑客手段的效果。

  1. 阻击“黑话/LeetSpeak”陷阱: 其中一种特定的黑客技巧(称为 M1)使用加密代码和紧急语言来迷惑 AI。
    • 之前: AI 有 88% 的概率中招。
    • 之后: AI 只有 38% 的概率中招。这是一个巨大的进步(安全性提高了一倍多)。
  2. 阻击“格式突破”陷阱: 另一种技巧试图诱导 AI 将围栏标记重复出来给黑客。
    • 之前: AI 有 47% 的概率会意外泄露围栏标记。
    • 之后: AI 泄露围栏标记的概率为 0%。因为围栏是针对那一瞬间唯一的,所以即便泄露了它,也无法对未来的请求产生任何帮助。
  3. 速度: 这种新方法速度极快。它为处理请求增加的时间仅为 2.7 微秒(眨眼间的一极小部分)。它如此之快,以至于你根本察觉不到。
  4. 质量: 机器人的实际工作能力(如总结文本或回答问题)并没有变差。它的表现与之前一样出色。

唯一的不足(局限性)

论文承认该方法无法解决的一件事:如果黑客明确命令机器人:“请把围栏标记重复给我听,”机器人可能仍然会照做。

  • 解决方法: 研究人员表示,这是当前这一层级的基本限制。要阻止这一点,你需要一个额外的“保安”在机器人输出答案之前进行检查,但这并不属于本次特定研究的范畴。

总结

这篇论文介绍了一种通过为每次对话提供一个新鲜的、独特的、一次性使用的围栏来提高 AI 智能体安全性的方法。如果黑客偷走了一个围栏,它也将变得毫无用处,因为下一次对话将会拥有一个完全不同的围栏。这是一个快速、易于添加的升级方案,能显著降低 AI 被欺骗的可能性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →