Capability-Mediated Perimeters for Secure AI Agent Tool Execution: Conditional Non-Escalation Invariants and Empirical Evaluation Against Indirect Prompt Injection
本文介绍了 Mastyf Guard,这是一种确定性优先的安全架构,它将 LLM 智能体视为不可信的主体,并通过外部引用监视器强制执行条件非升级不变性,在针对间接提示注入和数据外泄威胁的实证评估中,实现了近乎完美的攻击检测且零误报。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代计算领域,长期以来一直有一条保持系统安全的根本规则:指挥机器执行任务的指令必须与机器处理的数据保持分离。这种分离确保了用户不会意外或恶意地诱骗计算机去执行它本不该执行的命令。然而,自主人工智能智能体(AI agents)的兴起模糊了这一界限。这些智能体旨在执行复杂任务,如管理数据库或控制智能设备,它们通常会将指令和来自互联网的不可信数据同时读取,并合并在单一的文本流中。由于计算机将数据和指令视为同一混合物的一部分,聪明的攻击者可以将隐藏的命令藏在看似无害的电子邮件或网页中。当智能体读取这些内容时,可能会在不知不觉中服从隐藏的命令,执行诸如删除文件或窃取密码等操作。这种被称为“间接提示注入”(indirect prompt injection)的漏洞,使智能体变成了一个听从了它从未打算接收的指令的“困惑代理人”(confused deputy)。
Mastyf AI 研究实验室的研究人员提出了一种保护这些智能体的新方法,不再认为人工智能本身可以作为安全的最终判官。他们没有依赖 AI 去识别每一种可能的诡计,而是构建了一个安全系统,在任何行动被采取之前充当严格的守门人。他们称这个系统为 Mastyf Guard。它的运作基于一个简单但强大的原则:允许 AI 进行思考和推理,但剥夺其自主行动的权力。每当 AI 建议使用某种工具(例如发送电子邮件或访问服务器)时,一个独立的、单独的安全监控器都会检查该请求。这个监控器并不试图猜测 AI 的意图;相反,它会检查一份数字权限列表,就像夜总会的保镖检查宾客名单一样。如果请求的操作未在特定会话中被明确允许,请求将立即被拦截,无论 AI 的推理过程看起来多么具有说服力。
研究人员针对包含五万个场景的大规模集合测试了这种方法,其中一半是旨在欺骗智能体的现实攻击,另一半是开发者执行的正常安全操作。结果显示,他们的系统几乎可以瞬间拦截绝大多数攻击。在速度最快的情况下,安全检查仅耗时五千分之一秒,这种速度之快,人类用户几乎无法察觉。该系统成功识别并拦截了 99.33% 的攻击,这比现有的安全工具有了显著提升,因为现有工具往往会漏掉超过一半的这类微妙诡计。至关重要的是,该系统无需昂贵的高性能芯片即可运行,在标准计算机处理器上即可高效运行,内存占用仅为 1.1 GB。这意味着该防护措施可以在日常办公环境中部署,而无需专门的硬件。
为了理解其工作原理,可以将 AI 智能体想象成一名技术精湛但极易分心的员工,他被授予了一把整栋大楼的万能钥匙。如果一个陌生人在员工耳边低语一条虚假指令,员工可能会利用那把万能钥匙打开不该打开的门。Mastyf Guard 系统则完全从员工口袋里拿走了那把万能钥匙。相反,每当员工想要开门时,都必须向一名保安请求许可。保安不会倾听员工的故事,也不会试图解读其语气;保安只是检查一份严格的名单,查看该员工在此时此刻是否有权打开哪些门。如果请求不在名单上,门就会保持锁定状态。这种方法解决了“困惑代理人”的问题,确保即使 AI 被诱骗去请求错误的事物,系统也无法执行,因为它缺乏授权。
研究人员还解决了更微妙的问题:当 AI 被允许使用某种工具,但试图修改请求的细节以造成伤害时该怎么办?例如,AI 可能被授权发送电子邮件,但攻击者可能会诱骗它将该邮件发送到不同的地址或带有不同的主题行。为了处理这种情况,团队增加了第二层防御,其作用类似于一名细心的校对员。这一层会根据原始权限检查请求的具体细节。如果 AI 试图向一个新账户汇款或访问它不该触碰的文件,系统就会捕捉到这种变化。在涉及三千个复杂商业场景的测试中,这种结合了严格权限检查和详细校对的机制拦截了 97.5% 的攻击,同时保持了零百分比的误报率(在 2,000 次良性企业操作中的统计上限为 0.19%)。该系统的精确度极高,在两千次正常业务操作中,未触发过一次误报。
该研究的一个重要发现是,系统并不需要超智能 AI 也能发挥效用。研究人员发现,一个小型且专门的计算机程序可以处理绝大多数微秒级的安全检查,只有在请求存在歧义或可疑时,才会调用更大、更复杂的 AI 模型。这种混合方法保持了系统的快速运行和低成本。在常规业务流量中,复杂的 AI 模型从未被调用,使得系统能够以快速、简单检查的速度运行。当系统确实需要调用大型模型来调查棘手的请求时,耗时约为 18 毫秒,这对于大多数实时应用来说仍然足够快。这种设计确保了安全性不会以牺牲速度或可用性为代价,让企业能够在不减慢日常工作进度的前提下使用强大的 AI 智能体。
研究还探讨了如何防止数据通过一系列授权工具进行泄露。即使攻击者无法强迫 AI 使用禁止的工具,他们也可能尝试将敏感信息从一个允许的工具转移到另一个工具,从而实现数据的隐蔽外传。在仅使用标准能力检查的情况下,研究人员发现攻击者可以通过在授权工具之间移动信息,在很大比例的测试案例中成功窃取数据。为了阻止这一点,研究人员实施了一个追踪系统,追踪信息的流动,类似于银行追踪现金流动以确保资金不会失踪。该系统会对敏感数据(如密码或财务记录)进行标记,并确保此类数据只能流向明确获准接收该数据的目的地。在涉及一千多次使用这种特定追踪方法窃取数据的测试中,系统拦截了每一次尝试,确保敏感信息无法移动到未经授权的位置。
尽管该系统表现出了卓越的成功,但研究人员也谨慎地指出了其局限性。安全保障的前提是假设安全监控器本身是在一台受信任的计算机上运行且未被黑客入侵。如果监控器本身被攻破,整个系统就会失效。此外,虽然该系统在阻止试图以未经授权的方式使用工具的攻击方面表现出色,但在捕捉每一种可能的诡计变体方面并非完美,特别是那些涉及旨在迷惑系统的复杂多步操作的诡计。研究人员发现了一些系统被绕过的案例,主要涉及非常特定的金融技巧或域名伪装,并且已经提出了更新方案来修复这些漏洞。他们将这项工作描述为“预生产架构”,这意味着它已准备好在现实环境中进行测试,但在被视为最终的商业产品之前,仍需要经过独立专家的进一步验证。
这项工作的意义不仅在于提高 AI 的安全性,更在于它改变了我们构建智能系统的方式。通过将 AI 视为一个可能不可信、必须受到持续监督的组件,而非一个可以自我监管的可靠伙伴,研究人员创建了一个更难被攻破的框架。这种视角的转变使得在医院、银行和政府办公室等错误代价极高的敏感环境中使用强大的自主智能体成为可能。该系统证明了高安全性并不需要牺牲速度或要求昂贵的硬件,这为未来的人工智能提供了一个实用的解决方案。随着这些智能体在我们的日常生活中变得越来越普遍,将“思考”与“行动”分离,并对允许执行的操作实施严格规则的能力,对于保障我们的数字世界安全至关重要。
研究人员向公众开放了他们的工具和数据,允许其他科学家测试并改进他们的成果。他们发布了安全监控器的代码和训练好的 AI 模型,邀请全球社区寻找弱点并提出改进建议。这种开放性是科学进程的关键部分,确保了该系统不仅仅是一个理论构想,而是一个可以被审视和完善的实用工具。研究结论指出,通过将严格的确定性规则与智能、灵活的检查相结合,构建一个安全的自主智能体环境是可能的。未来的路径包括继续在现实场景中测试这些系统,完善规则以应对新的诡计,并确保随着威胁的演变,该技术能保持稳健。这项工作代表了在使自主 AI 的承诺成为每个人都能享有的安全且可靠的现实方面迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。