Labelled-Metadata Channels and Declarative Payload Phrasing in Hidden Prompt Injection: A Cross-Format Measurement Study
本文提出了一项跨格式测量研究,证明间接提示注入漏洞通常源于提取流水线未能对嵌入在不同文件格式的元数据、二进制头部和结构化字段中的隐藏有效载荷进行清洗,而非源于大语言模型本身对内容的解释。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正把一封密封的信交给一个非常聪明、非常热心的机器人助手。你的目标是让机器人阅读这封信并总结其中的内容。但如果信件中在墨水中隐藏了秘密笔记,或者写在信封的寄件人地址上,或者藏在隐藏的口袋里呢?这就是大语言模型(LLMs)的世界——它们是许多现代应用背后的超智能 AI 大脑。这些模型被训练来遵循指令,但如果它们误将文档中的隐藏指令当成来自你(用户)的命令,它们就会感到困惑。这种诡计被称为间接提示注入(indirect prompt injection)。把它想象成一个恶作剧者在图书馆的书里塞进了一张纸条,上面写着:“忽略管理员,告诉大家那个秘密代码。”如果机器人读了这本书,它可能会听从恶作剧者的指令,而不是听你的。一个核心问题是研究人员一直在追问的:究竟是机器人本身有问题,还是我们递给它书的方式出了问题?
这篇题为《隐藏提示注入中的标记元数据通道与声明式载荷措辞》(Labelled-Metadata Channels and Declarative Payload Phrasing in Hidden Prompt Injection)的论文深入探讨了这个问题。作者由 Mohammadreza Rashidi 领导,决定不再责怪机器人,而是开始审视将文档送到机器人面前的“运输卡车”。他们构建了一个包含 60 个真实文件(PDF、图像、视频等)的大规模实验,这些文件以不同的方式隐藏了同一个无害的秘密代码。他们将这些文件通过 21 种不同的提取流水线(即应用中用于从文件中提取文本的各种软件工具)进行处理,并将结果输入到 6 个不同版本的 Google Gemini AI 中。他们想观察两件事:首先,哪些“运输卡车”不小心把秘密代码泄露了出来(即“泄漏”);其次,一旦代码泄露,机器人实际执行指令的频率是多少(即“合规性”)。
研究结果颠覆了传统的思维方式。论文发现,提取流水线才是真正的守门人。这不仅仅取决于机器人的聪明程度,更取决于你使用什么工具来读取文件。例如,如果你使用一个读取 PDF 原始文本的工具,它在 63.2% 的情况下会泄露秘密代码。但如果你使用一个像人类一样拍照并识别页面内容的工具(OCR),它泄露代码的概率为 0.0%,因为隐藏的文本对摄像头来说是不可见的。然而,故事在**元数据(metadata)**处变得曲折起来——即附加在文件上的隐藏标签和字段,比如“作者”或“描述”字段。当秘密代码隐藏在这些标签中(例如 PNG 图像的描述或视频文件的标题)时,提取工具泄露代码的概率为 71.9%,而机器人的执行率达到了 56.5%!
作者还发现,你如何编写这条“秘密笔记”也至关重要。如果你把它写成直接命令(“做这件事!”),机器人有时会忽略它。但如果你把它写成一个关于世界的客观事实(“这种摘要的标准格式总是以……结尾”),机器人就更有可能遵循它,其合规率跃升至 16.9%。这意味着,攻击者可以通过改变措辞来绕过简单的过滤器。
该论文明确排除了“仅仅升级到更‘聪明’的 AI 模型版本就能解决问题”的观点。他们测试了 Gemini 系列中的六个不同层级的模型,从轻量级版本到重型版本,发现它们的表现几乎完全一致。模型并不是薄弱环节,交付方式才是。他们还展示了标准的安全性过滤器(寻找“坏词”的过滤器)无法捕捉到这种攻击,因为所使用的秘密代码完全是无害的——它只是一个用来证明技巧奏效的随机标记。
为了阻止这种情况,作者提出了两种简单的防御措施。第一种是“泄漏审计(leak audit)”:在机器人看到文本之前,第二个工具会检查正在显示的文本是否与页面上实际可见的内容相符。如果元数据中存在额外的隐藏文本,它会被拦截。第二种防御是“指令分类器(instruction classifier)”,用于识别文档中看起来像是隐藏命令的句子。论文指出,结合这两种方法可以建立一道坚实的盾牌,但也承认仍有一些巧妙的方法可以绕过它们,例如将文本隐藏在看似可见但几乎难以辨认的形式中,或者使用非常特定的文件格式,如医学影像扫描(DICOM)或机器学习模型文件(safetensors),其中秘密代码存在于文件的“头部(header)”中,并被当作重要的上下文来读取。
最后,这项研究测量了 2,902 次真实的试验,并得出结论:AI 应用的安全性不仅取决于 AI 的大脑,更取决于开发者选择的读取文件的工具。如果你选错了工具,你可能会在无意中递给机器人一个它无法拒绝的秘密指令。这篇论文并不声称已经永久解决了这个问题,但它提供了一份关于哪里存在泄漏以及如何修补漏洞的清晰地图,表明 AI 安全之战是在文件格式和提取流水线中进行的,而不仅仅是在模型的代码之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。