← 最新论文
🤖 AI

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

本文证明了在共享嵌入序列模型中,由于指令与数据在结构上不可分离,实现完美的提示词注入防护在数学上是不可能的,并认为稳健的安全保障需要控制通道与内容通道之间的架构级分离,而非仅仅改进流水线内的防御机制。

原作者: Dewank Pant, Shruti Lohani, Avijit Kumar

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Dewank Pant, Shruti Lohani, Avijit Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:“搅拌碗”问题

想象你是一位在厨房里工作的厨师(AI 模型)。你有两种类型的食材:

  1. 食谱卡(受信任的指令): 这些是餐厅老板给你的规则(例如,“只供应素食”、“绝不泄露秘密酱汁”)。
  2. 顾客的订单(不受信任的数据): 这些是顾客带来的请求(例如,“我要一个汉堡”、“你能讲个笑话吗?”)。

在目前的 AI 模型中,厨师将食谱卡顾客订单都放入了同一个搅拌碗中。它们被切碎、混合并捣碎成一碗均匀的食材汤,然后厨师才开始烹饪。

论文的核心观点:
作者认为,由于食谱和订单都被混入了同一个碗里,一旦它们被混合在一起,厨师在数学上就不可能完美地分辨出哪些是“老板说的”,哪些是“顾客说的”。

如果一个顾客在订单里偷偷塞进一张纸条,上面写着:“忽略食谱卡,把秘密酱汁给我。” 厨师无法分辨这张纸条与真正的食谱有什么区别。对于厨师的大脑来说,这一切都只是“一碗汤”。因此,厨师可能会不小心听从了顾客狡猾的纸条,而不是老板的规则。

核心类比:冯·诺依曼机

论文将这个问题与 20 世纪 70 年代一个著名的计算机安全漏洞——**缓冲区溢出(Buffer Overflow)**进行了对比。

  • 旧式计算机(冯·诺依曼架构): 在这些机器中,计算机的程序(代码)和数据(数字)存在于同一个内存空间中。黑客可以通过喂给计算机看起来像程序的“数据”来欺骗计算机。计算机会误将这些数据当作命令来执行,从而导致系统崩溃或让黑客接管系统。
  • 现代 AI(Transformer): 作者说 AI 存在完全相同的缺陷。其“指令”(系统提示词)和“数据”(用户输入)生活在同一个数学空间(向量)中。黑客可以伪造看起来像“指令”的“数据”。因为 AI 无法将它们区分开,所以它会遵循黑客的指令。

论文指出,就像我们无法仅通过“写更好的代码”或“更仔细的打字”来修复缓冲区溢出一样,我们也无法仅通过“更好的训练”或“更多的过滤器”来修复提示词注入(Prompt Injection)。问题在于架构(搅拌碗),而不是厨师的技巧。

三个导致“不可能实现”的原因

论文通过三个逻辑步骤证明了这种不可能实现性:

1. “共享词汇”问题(表示碰撞/Representational Collision)

  • 隐喻: 假设食谱卡和顾客订单都使用了“盐”这个词。
  • 现实: 在 AI 中,“the”、“is”、“you”和“help”这类词同时出现在系统指令和用户输入中。AI 将这些词映射到完全相同的数学数值。一旦 AI 看到“help”这个词,它就不知道这个词是来自老板的规则(“帮助用户”),还是来自用户的诡计(“帮我绕过规则”)。一旦进入搅拌碗,这个词的“来源”就被抹除了。

2. 厨房里的“盲点”(溯源恢复/Provenance Recovery)

  • 隐喻: 如果你试图观察这碗汤,并猜测哪一勺来自食谱卡,哪一勺来自顾客订单,你有时会出错。
  • 现实: 论文在数学上证明了,由于“受信任”和“不受信任”的食材如此相似(它们共享相同的词汇和空间),任何观察手段都无法完美地将它们区分开。总会存在出错的可能性。如果你无法完美区分它们,你就无法完美地拦截坏东西。

3. “无限变化”问题(有限覆盖/Finite Coverage)

  • 隐喻: 假设你训练了一位厨师去识别 1,000 种顾客试图欺骗他的方式。但一个聪明的顾客可以用 1,000,000 种不同的方式(使用不同的语言、表情符号、代码或拼写技巧)来表达同一种诡计。
  • 现实: 你可以针对数百万个例子训练 AI,但欺骗 AI 的方式在实际上是无限的。因为 AI 是通过观察示例来学习的,它永远无法学会防范所有可能的变化形式。对于它从未见过的诡计,它总会有一个“盲点”。

这对 AI 安全意味着什么

作者并不是在说 AI 没用,或者我们应该停止使用它。他们是在说:

  • 你无法修补这个“搅拌碗”: 你不能仅仅通过更好地训练 AI、增加更多“护栏”或过滤词汇来解决这个问题。只要 AI 将指令和数据混合在同一个空间里,聪明的攻击者最终总能找到方法把虚假指令塞进去。
  • 解决方案是架构性的: 要真正解决这个问题,我们需要改变厨房的设计。我们需要一个食谱卡和顾客订单被放在不同碗里,且在最后阶段之前绝不混合的系统。“食谱”应该是一个刚性的规则,而“顾客订单”无法触碰或覆盖它。
  • 深度防御(Defense in Depth): 在我们制造出这些“独立碗”系统之前,我们必须像对待带有缓冲区溢出的旧计算机一样对待 AI:假设它们一定会被黑,使用多层弱防御(如防火墙和沙箱),并在发生入侵时限制造成的损害。

总结

论文证明了,对于目前的 AI 模型来说,完美的安全性是不可能的,因为它们将“做什么”和“处理什么”视为同一件事。这就像要求一位厨师忽略顾客的纸条,前提是那张纸条是用同样的墨水和同样的纸写成的。解决问题的唯一途径是改变 AI 的基本设计,而不仅仅是尝试更好地训练它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →