← 最新论文
💻 computer science

Conjunctive Poisoning in AI Supply-Chain Applications

本文识别并论证了 AI 供应链中一种新型的“结合性投毒”(conjunctive poisoning)攻击,即恶意开发者利用受保护程度较低的良性提示词封装(prompt wrappers)与精心设计的元数据之间的交互,来确定性地改变模型输出,并提出了 TIF-BAH 中间件作为一种防御手段,用以验证封装完整性并记录行为证明。

原作者: Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字世界中,强大的人工智能系统已从研究实验室走向日常工具,被广泛用于写作、编程和图像创作。这些被称为大型语言模型和视觉语言模型的系统,通常通过其内部的“大脑”来描述——即它们在训练过程中学习到的海量数字和模式。多年来,安全专家一直将注意力集中在保护这个“大脑”上,确保训练数据未被投毒,且模型本身未被秘密篡改。他们构建了强大的防御机制来验证模型的权重,并过滤掉直接发送给模型的危险指令。然而,这些系统并非在真空环境下运行。在用户的提问到达模型之前,以及模型生成答案之后,都存在一个作为翻译器和管理器的软件层。这一层通常被称为“包装器”(wrapper),它接收用户的输入,将其格式化为模型能理解的特定结构,然后将原始答案处理成最终的、润色后的响应。与该软件并行的还有配置文件,它们就像是指令手册,告诉包装器应该如何表现。虽然模型的“大脑”受到严密保护,但周围的这些软件及其指令手册却在很大程度上处于缺乏保护的状态,被视为简单的、可编辑的文本,而非关键的安全组件。

中佛罗里达大学的一个研究小组发现了这个被忽视层级中的一个隐藏漏洞。他们演示了一个恶意开发者可以创建的欺骗性软件包:在这个包中,模型本身是完全安全且未改变的,但包装器及其配置文件却被操纵以改变系统的行为。研究人员展示了通过将一个看似无害的软件包装器与一个精心设计的配置文件相结合,攻击者可以迫使系统以一种特定的、可预测的方式改变其输出,而无需触及模型的内核代码。这种攻击依赖于一种“结合性”(conjunctive)机制,意味着两个独立的条件必须同时满足,该诡计才能生效。其中一个条件是嵌入在包装器代码中隐形的隐藏标记,另一个是存储在配置文件中的加密签名。仅凭其中任何一个部件都不足以触发变化;它们必须共同存在。这种设计使得攻击极难被察觉,因为如果仅对代码进行安全扫描,看到的将是一切正常;如果仅对配置文件进行扫描,看到的也只是看似随机的数字字符串。

为了测试这种漏洞的普遍程度,研究人员使用十五个不同的人工智能系统构建了一个受控实验,涵盖了从任何人都可以下载的开源模型到通过商业 API 访问的封闭系统。他们使用被操纵的包装器和配置文件部署了这些模型,并观察了用户提问时的反应。结果是一致且精确的:在每一种情况下,只要两个条件同时满足,系统就会执行隐藏指令。包装器会获取模型正常的、正确的答案,并在向用户展示之前在其前面添加横幅或修改文本。模型本身并没有改变其观点或知识;它只是被其包装器指示以不同的方式展示答案。研究人员发现,这种操纵在纯文本任务、复杂推理问题,甚至是在模型观察图像的视觉语言任务中都同样有效。这种攻击非常高效,因为它不会被检测恶意代码或扫描已知坏模式的标准安全工具所发现,因为触发因素不是一段坏代码,而是隐藏标记与匹配文件签名之间的逻辑组合。

该研究还探讨了现有防御措施拦截此类攻击的效果。研究人员测试了几种现有的安全措施,包括扫描元数据文件的工具、过滤用户提示词的系统,以及证明其真实性的数字制品签名方法。他们发现,大多数防御措施都无法捕捉到这种“结合性投毒”。仅查看配置文件的扫描器漏掉了代码中的隐藏标记,而仅查看代码的扫描器则漏掉了文件中的加密签名。甚至连对模型权重进行签名的工具也无济于事,因为攻击发生在包装器和配置文件中,而这些部分通常未经过签名,或者被视为与主模型包分离。在他们的测试中,唯一能完全阻止攻击的方法是对整个捆绑包进行签名——即将模型、包装器和配置文件作为一个整体进行签名——并验证自签名以来其中任何部分是否被篡改。如果没有这种完整的验证,系统仍然容易受到这种微妙操纵的影响。

为了填补这一空白,研究人员提出了一种名为“模板完整性过滤器与行为属性标题”(Template Integrity Filter with Behavioral Attestation Header)的新型防御机制。该系统作为一个守门人,在模型运行期间与其并行工作。在允许包装器处理答案之前,系统会将包装器代码与受信任的、预先批准的版本进行比对,以确保其未被篡改。如果代码与受信任版本匹配,系统将允许过程继续;如果不匹配,系统将拦截该动作并默认输出一个安全的、未经修改的输出。此外,该系统会为每一次交互记录一条微小的日志条目,注明使用了哪个版本的包装器以及做出了何种决策。这创建了一个可以进行后期审计的永久记录,用以检查是否发生了任何未经授权的更改。研究人员发现,增加这一层保护几乎不会对系统的速度造成延迟,它为生成响应增加的时间不到百分之零点五,这使其成为一种适用于实际应用的切实可行的解决方案。

这项工作的意义不仅在于发现了一个新漏洞,它从根本上改变了我们看待人工智能安全的方式。长期以来,业界一直假设如果模型的“大脑”是安全的,那么整个系统就是安全的。这项研究表明,系统的“身体”——即封装模型的软件及其指导行为的文件——同样至关重要。攻击者不需要破解模型的训练数据或重写其内部逻辑来改变用户看到的内容。他们只需要将一个隐藏指令植入包装器,并将一个匹配的密钥放入配置文件中即可。这类似于一位受信任的厨师被给予了一份看起来很正常的食谱,但食谱中包含了一条秘密指令:只有当厨房里出现了某种特定食材时,才加入一种特定的香料;厨师完美地遵循了食谱,但最终的菜肴因指令而非厨师自身的选择而被改变了。研究人员强调,尽管他们的实验使用的是无害的变化(如添加横幅或免责声明),但同样的机制可以被用来隐藏危险指令、篡改建议或以用户无法察觉的方式操纵引用。

研究总结指出,存放包装器和配置文件的“模板层”是人工智能供应链中一个关键但保护不足的部分。随着这些系统越来越多地融入我们的日常生活,被用于从客户服务到医疗建议的方方面面,整个部署包的完整性必须得到验证,而不仅仅是模型本身。研究人员已经公开了他们的代码和工具,以帮助其他开发者测试自己的系统是否存在此类漏洞。通过揭示这一特定的弱点,他们希望促成建立新的标准,使包装器代码和配置文件能受到与模型权重本身同等水平的审查和保护,从而确保用户所看到的行为确实是模型本意要产生的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →