Beyond Prompt Injection: Trust-Boundary Security Assurance for LLM-Integrated and Agentic Applications
本文提出了一种方法论层面的信任边界安全保障框架,该框架通过对集成大语言模型(LLM)及智能体(Agentic)系统进行建模,将不断演进的语义威胁转化为可验证、可测试的安全控制措施及基于证据的报告。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,大型语言模型已从简单的文本生成器演变为复杂的助手,它们可以搜索信息、记忆过去的对话,甚至代表用户执行任务。这些系统通常被称为“智能体”(agents),它们不仅仅是回答问题,还会从数据库中检索数据,使用电子邮件或客户关系管理软件等外部工具,并根据所发现的信息做出决策。这种转变创造了一个独特的安全挑战。当计算机程序遵循指令时,它通常遵循一套明确的规则。但当人工智能解释自然语言时,无害的事实与危险的命令之间的界限可能会变得模糊。如果恶意攻击者在文档、电子邮件或网站中隐藏了一条秘密指令,人工智能可能会读取它,将其视为任务的一部分,然后利用其对敏感公司数据的访问权限来执行这条隐藏的命令。危险之处不仅在于人工智能说了错误的话,还在于它实际上做了有害的行为,例如删除文件或泄露私人记录,因为它被误导以为该行为是经过授权的。
一位名叫 Nazar Waheed 的研究人员提出了一种思考和测试这些系统安全性性的新方法。该论文建议,与其试图让人工智能本身在识别不良指令方面变得完美(这是一个困难且可能无法实现的目标),不如将整个应用程序视为一系列检查点。核心思想是绘制出系统从仅仅理解语言转向采取现实世界行动的具体路径。作者确定了七个特定的信任边界存在之处,例如系统从互联网获取数据时、系统决定使用哪个工具时,或者系统连接到公司内部数据库时。研究认为,安全性不应仅依赖于人工智能的判断。相反,在这些边界处必须有独立的、自动化的检查,以在行动发生前验证该行动是否真正被允许。
该论文为组织提供了一个结构化的流程,将安全评估分解为六个清晰的阶段。首先,团队必须列出系统的每一个组成部分,从用户界面到隐藏的数据库。接下来,他们要绘制出谁或什么具有执行何种操作的权限,识别系统是否存在权限过大的情况。然后,他们要创建现实的情景,即攻击者试图通过一个受信任的来源(如检索到的文档)植入有害指令。在第四阶段,他们要测试系统是否能通过这些独立的检查点来阻止攻击,即使人工智能本身落入了陷阱。第五阶段是分析如果检查点失效会发生什么,观察破坏范围会有多大,以及系统是否能够恢复。最后,团队会提交一份报告,详细说明系统在哪些地方成功或失败,提供具体的证据而非仅仅是猜测。
这种方法通过一个假设的客户服务助手案例进行了演示。在这种场景下,攻击者修改了一份合法的公司文档,在其中加入了一条隐藏指令,要求人工智能将客户隐私数据发送到一个外部电子邮件地址。研究表明,即使人工智能阅读了该文档并提议发送电子邮件,一个设计合理的安全系统也应该有一个独立的层级来检查该请求。这个层级会发现用户并未授权向外部发送数据,从而拦截该行动,无论人工智能建议如何。研究强调,目标不是证明人工智能对欺骗免疫,而是证明系统拥有一个安全网,能够防止这些欺骗造成真实的伤害。
该论文还讨论了这些智能体用于连接其他软件的特定工具,即模型上下文协议(Model Context Protocol)。它警告说,即使人工智能与工具之间的连接在技术上是安全的,通过该连接传输的信息仍可能具有危险性。例如,一个工具可能被授权与数据库通信,但它返回的数据可能包含隐藏的命令。研究建议,安全性必须是分层的,分别检查协议、数据的含义以及业务规则。它认为,仅仅依靠单一的防御手段(如试图识别坏词的过滤器)是不够的。相反,系统必须构建成这样:如果其中一部分失效,另一部分能够阻止破坏。
最终,这项工作提供了一种将对人工智能模糊的恐惧转化为可测试事实的方法。它将讨论的重点从询问“人工智能是否安全”转向询问“安全控制在哪里”以及“它们是否真的有效”。作者谨慎地指出,这是一个评估框架,而不是保证每个系统现在都是安全的。它是一个指南,旨在构建一个即使出错后果也会受到限制、攻击路径可以被追踪、且组织可以向自己证明数据受到保护的系统。通过专注于语言与行动之间的边界,这篇论文为企业如何在不失去对自身系统控制权的情况下使用强大的人工智能工具提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。