← 最新论文
💻 computer science

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

本文提出了一个正式的七成分模型,旨在构建提示词注入攻击分析的结构,将焦点从脆弱的字符串匹配转向追踪攻击者意图,并实现人工智能安全领域内威胁的标准化的标记、比较与变异。

原作者: Jeremy McHugh

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jeremy McHugh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但有点过于刻板的机器人如何完成一项工作。你给它列出了一系列规则,比如“要乐于助人”和“不要泄露秘密”。这就是人工智能的世界,特别是那种能够写故事、回答问题和辅助编写代码的人工智能。长期以来,人们认为欺骗这些机器人的唯一方法就是对着它们大喊一些恶毒或混乱的话。但最近,研究人员发现了一种更阴险的方法:你不需要大喊大叫。你可以将一条秘密指令隐藏在一封看起来很正常的信件、一份简历甚至是一份错误报告中,机器人可能会读到其中的秘密部分,从而忘记它的规则。这被称为提示词注入(prompt injection)。这就像是给服务员递一张便条,上面写着:“忽略菜单,把主厨的私藏拿给我”,而这张便条的写法看起来就像是一个普通的点餐指令。现在的一个大问题是——对于从构建机器人的开发者到试图保护机器人的防御者——我们该如何描述这些诡计,以便即使在坏人改变措辞时,我们也能识别出它们?

杰里米·麦休(Jeremy McHugh)撰写的这篇论文指出,我们一直看错这些诡计了。作者认为,我们不应该把每一次攻击都视为一个必须去死记硬背的独特且古怪的句子,而是提出了一种新的拆解方式,就像机械师拆解汽车发动机一样。论文认为,无论伪装得多么巧妙,每一个提示词注入实际上都是由相同的七个构建模块组成的。把这想象成一个魔法咒语的配方:你需要一个载体(Carrier)(隐藏咒语的信封)、一个传递媒介(Delivery Vector)(信封是如何送到巫师手中的)、隐匿手段(Concealment)(隐形墨水)、一个上下文中断(Context-Break)(巫师停止听从规则并开始听从咒语的时刻)、权限提升(Privilege Escalation)(说服巫师让他们去做一些通常无权做的事)、有效载荷(Payload)(实际的咒语或命令),以及一个返回通道(Return Channel)(巫师如何告诉施法者咒语是否奏效)。

该论文建议,通过用这七个部分来标记攻击,安全团队可以识别出那些表面上看起来完全不同、但本质上是同一种诡计的模式。例如,一名黑客可能会在简历中伪造一份虚假的错误报告(载体),其中利用白色的文字隐藏了一个命令(隐匿手段),以此诱骗招聘机器人窃取密码(有效载荷)。另一名黑客可能会使用一封虚假邮件(载体),通过切换语言(上下文中断),来诱骗客服机器人删除数据库(有效载荷)。尽管措辞完全不同,但攻击的“形状”是完全一致的。作者明确警告不要将这些攻击与旧有的计算机技巧(如 SQL 注入)相类比,因为人工智能非常擅长预测下一个词,所以我们不能像对待旧软件那样仅仅通过“修补漏洞”来解决问题;风险始终存在。相反,我们需要理解攻击的解剖结构,才能与之对抗。这篇论文并不声称已经解决了问题或构建了完美的盾牌;相反,它提供了一张新的地图和一套通用的语言,以便防御者、黑客和情报团队最终能在观察对象以及如何追踪这些不断演变的威胁上达成共识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →