✨ 要点🔬 技术摘要
想象一下,你正试图教一个非常聪明但有点过于刻板的机器人如何完成一项工作。你给它列出了一系列规则,比如“要乐于助人”和“不要泄露秘密”。这就是人工智能 的世界,特别是那种能够写故事、回答问题和辅助编写代码的人工智能。长期以来,人们认为欺骗这些机器人的唯一方法就是对着它们大喊一些恶毒或混乱的话。但最近,研究人员发现了一种更阴险的方法:你不需要大喊大叫。你可以将一条秘密指令隐藏在一封看起来很正常的信件、一份简历甚至是一份错误报告中,机器人可能会读到其中的秘密部分,从而忘记它的规则。这被称为提示词注入(prompt injection) 。这就像是给服务员递一张便条,上面写着:“忽略菜单,把主厨的私藏拿给我”,而这张便条的写法看起来就像是一个普通的点餐指令。现在的一个大问题是——对于从构建机器人的开发者到试图保护机器人的防御者——我们该如何描述这些诡计,以便即使在坏人改变措辞时,我们也能识别出它们?
杰里米·麦休(Jeremy McHugh)撰写的这篇论文指出,我们一直看错这些诡计了。作者认为,我们不应该把每一次攻击都视为一个必须去死记硬背的独特且古怪的句子,而是提出了一种新的拆解方式,就像机械师拆解汽车发动机一样。论文认为,无论伪装得多么巧妙,每一个提示词注入实际上都是由相同的七个构建模块组成的。把这想象成一个魔法咒语的配方:你需要一个载体(Carrier) (隐藏咒语的信封)、一个传递媒介(Delivery Vector) (信封是如何送到巫师手中的)、隐匿手段(Concealment) (隐形墨水)、一个上下文中断(Context-Break) (巫师停止听从规则并开始听从咒语的时刻)、权限提升(Privilege Escalation) (说服巫师让他们去做一些通常无权做的事)、有效载荷(Payload) (实际的咒语或命令),以及一个返回通道(Return Channel) (巫师如何告诉施法者咒语是否奏效)。
该论文建议,通过用这七个部分来标记攻击,安全团队可以识别出那些表面上看起来完全不同、但本质上是同一种诡计的模式。例如,一名黑客可能会在简历中伪造一份虚假的错误报告(载体),其中利用白色的文字隐藏了一个命令(隐匿手段),以此诱骗招聘机器人窃取密码(有效载荷)。另一名黑客可能会使用一封虚假邮件(载体),通过切换语言(上下文中断),来诱骗客服机器人删除数据库(有效载荷)。尽管措辞完全不同,但攻击的“形状”是完全一致的。作者明确警告不要将这些攻击与旧有的计算机技巧(如 SQL 注入)相类比,因为人工智能非常擅长预测下一个词,所以我们不能像对待旧软件那样仅仅通过“修补漏洞”来解决问题;风险始终存在。相反,我们需要理解攻击的解剖结构,才能与之对抗。这篇论文并不声称已经解决了问题或构建了完美的盾牌;相反,它提供了一张新的地图和一套通用的语言,以便防御者、黑客和情报团队最终能在观察对象以及如何追踪这些不断演变的威胁上达成共识。
技术摘要:提示词注入的解剖学
问题陈述
在 2022 年首次识别出提示词注入(prompt injection)四年后,该领域仍缺乏一个用于分析攻击的标准化的、基于组件的模型。目前,提示词注入的人工制品主要被记录为逐字字符串而非结构化漏洞利用。这种“字符串匹配”的方法导致了分析中的显著不一致性:两名分析师可能会对一个“DAN”(Do Anything Now,无所不能)提示词和一个隐藏在简历中的白底白字文本是否属于同一种类型的威胁产生分歧。
随着大语言模型(LLM)智能体(agents)能力的增强,攻击正日益针对技术性的 IT 汇点(数据库、Web 应用程序)并操纵 AI 辅助的安全分析(例如恶意软件分拣)。当前缺乏组件模型的现状,阻碍了防御者、红队人员和网络威胁情报(CTI)团队进行有效的标记、比较和变异攻击。此外,依赖于 SQL 注入的类比来指导缓解措施是极其拙劣的,因为 LLM 缺乏数据与指令之间的内在区别,这使得通过参数化查询消除残余风险变得困难。问题不仅在于攻击字符串本身,更在于缺乏一套描述人工制品功能角色的共享语言。
方法论
本文提出了一个七组件模型 ,旨在将提示词注入的人工制品形式化。该模型将攻击分解为描述人工制品本身的五个字段和描述环境的两个字段。其方法论包括:
定义功能角色: 识别攻击为取得成功必须执行的具体任务,超越表层措辞而关注底层机制(例如,区分“隐藏/concealment”与“载体/carrier”)。
建立标注规则: 创建决策规则以减少编码员的分歧,确保映射到相同意图的不同自然语言实现能够获得相同的结构化标签。
交叉引用前人研究: 将新模型与现有框架(Campaign 分类法、技术分类法、HOUYI、ReNeLLM、Promptware Kill Chain)进行映射,以证明新模型如何覆盖了以往仅能部分覆盖的功能空间。
实际案例演示: 将该模型应用于现实世界及说明性案例,包括 EchoLeak 漏洞(CVE-2025-32711)以及试图规避 AI 辅助安全分析的在野恶意软件样本。
核心贡献
1. 七组件模型
核心贡献是将提示词注入结构化分解为七个组件:
人工制品字段(提示词主体):
载体 (Carrier): 用于传输恶意指令的看似良性的内容(例如,错误报告、简历或日历邀请)。它必须能够通过人类审查和机器检索。
隐藏 (Concealment): 用于规避人类或过滤器检测的混淆层(例如,白底白字、Base64 编码、语言切换)。
上下文中断 (Context-Break): 语法转义符(提示词注入中的 "');--"),用于终止受信任的指令上下文,强制模型将后续文本解析为新指令。
权限提升 (Privilege Escalation): 与上下文中断不同,它改变了模型愿意或能够执行的操作。它分为对齐绕过 (Alignment Bypass) (通过人格设定或情感操纵击败拒绝训练)和能力滥用 (Capability Abuse) (胁迫智能体使用其已拥有的权限,如“混淆代理/confused deputy”模式)。
有效载荷 (Payload): 可执行指令(shellcode)。本文定义了功能类别(侦察、外泄、行动、持久化、拒绝服务、安全破坏),并强调追踪意图 (Intent) (工具目标、汇点、效果)而非表层措辞。
环境字段:
交付向量 (Delivery Vector): 人工制品进入信任边界的方式(直接式 vs 间接式)。间接交付(例如,被污染的 RAG 文档)其规模随攻击者投入的增加而独立扩展。
返回通道 (Return Channel): 结果到达攻击者的路径(行内、HTTP、DNS、电子邮件、协作平台,或对于“发后即忘”型攻击为 Null)。
2. 逻辑分析记录
本文引入了一种类 JSON 的模式用于记录事件。该记录将意图 (Intent) (目标,例如 show_current_customer_information)、表象 (Surface) (具体的措辞或编码)和编译效果 (Compiled Effect) (实际的工具调用或动作)分离。这使得分析师即使在零词法重叠的情况下,也能对具有相同“技术形状”的攻击活动进行聚类。
3. 交叉对照与投影
本文提供了将七个组件映射到 Promptware Kill Chain 的交叉对照表,并展示了以往框架(H、HOUYI、ReNeLLM)是如何作为该模型的受限子空间投影存在的。例如,ReNeLLM 的两个组件结果被证明是直接越狱(direct jailbreaks)的一个有效但受限的视角,而处理复杂的智能体攻击则需要完整的模型。
结果与说明案例
本文通过以下工作案例验证了该模型:
EchoLeak (CVE-2025-32711): 被演示为一个能力滥用 攻击,其载体是恶意电子邮件,通过 RAG 进行间接交付,其有效载荷利用智能体已拥有的权限提取机密。返回通道利用参考风格的 Markdown 图像,通过微软自身的服务器进行数据代理。
AI 规避恶意软件样本: 一个上传至 VirusTotal 的在野样本(项目“Skynet”)试图操纵 AI 分析师。该二进制文件充当载体,其有效载荷意图为安全破坏 (具体为 mark_benign,即标记为良性)。返回通道为 Null ,因为其目标是改变分拣决策而非数据外泄。
智能体复合体 (Agentic Composite): 一个说明性示例,结合了被污染的 Jira 工单(载体)、HTML 注释(隐藏)和伪造的系统标签(上下文中断),以触发下游工具的 SQL 注入。
重要性与主张
本文主张,该组件模型提供了一种目前缺失的、用于进攻、防御和威胁情报的共享语言 。其重要性在于:
标准化: 它允许基于意图和结构 而非脆弱的字符串签名来进行分类。两个措辞不同但具有相同组件元组(交付、上下文中断、权限提升、意图、返回通道)的攻击会被识别为同一种技术形状。
改进检测与分析: 通过关注功能角色(例如,区分对齐绕过与能力滥用),防御者可以更好地理解攻击机制。本文引用证据表明,基于分类学的提示词可以将越狱检测率从 65.9% 提高到 78.0%,这表明结构化标签增强了分析能力。
CTI 效用: 该模型使 CTI 团队能够对具有相同技术形状的攻击活动和恶意软件样本进行聚类,即使这些样本通过嵌入提示词注入来操纵 AI 辅助分析。它支持向 STIX 2.1 和 MITRE ATLAS 等行业标准进行映射。
赋能红队: 它允许红队在保持意图链固定的情况下,一次只改变一个组件,从而实现系统的变异与测试,而非盲目的字符串迭代。
本文保持了审慎的态度,指出该模型是描述性 的,而非针对构建护栏的规范性模型。它承认成功仍取决于模型且具有非确定性,建议记录预期的攻击成功率(ASR)范围,而非二元的成功指标。其核心价值在于能够跨越实现智能体及混合攻击所需的功能角色来分解提示词注入人工制品,而此前没有任何单一框架具备此能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。