← 最新论文
💻 computer science

Mastyf Guard 1.5B: Cognitive Harvard Architectures for Sub-Millisecond AI Agent Perimeter Defense and Capability-Based Access Control

本文介绍了 Mastyf Guard 1.5B,这是一个轻量级的、基于能力的安全性框架,它通过实现一种“认知哈佛架构”来在物理上将数据摄取与动作执行解耦,从而在实现 99.33% 威胁召回率和标准 CPU 硬件上亚毫秒级延迟的同时,在数学上保证了对间接提示注入的免疫力。

原作者: Rudraneel Das

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Rudraneel Das

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机被赋予自主行动能力的场景,它们不仅能回答问题,还能执行任务,如发送电子邮件、管理数据库或控制智能家居设备。这些自主智能体功能强大,但由于其构建方式的原因,面临着一个根本性的安全问题。几十年来,计算机系统的设计理念是:告诉机器该做什么的指令与机器正在处理的数据存放在同一个内存空间中。这种安排虽然灵活,但也创造了一个漏洞:如果恶意攻击者能在数据流中混入一条隐藏指令,计算机可能会将该数据误认为是一条命令并照令执行。在人工智能领域,这一缺陷以一种新的形式回归了。因为这些 AI 智能体会同时读取自身的指令和从互联网获取的不可信信息,因此很容易被欺骗。攻击者可以将一条命令隐藏在看似无害的产品评论或电子邮件中,而 AI 由于无法区分安全数据与隐藏指令,可能会遵循该指令去执行它本不该执行的操作,例如删除文件或窃取密码。

一位来自印度加尔各答 Mastyf AI 研究实验室的研究员针对这一特定问题提出了一个解决方案,称之为“认知哈佛架构”(Cognitive Harvard Architecture)。他们在题为《Mastyf Guard 1.5B》的研究中,介绍了一种保护这些自主智能体的新方法。研究人员并没有让 AI 自由混合其指令和数据,而是设计了一个物理上分离两者的系统。在这种新设置下,AI 被允许读取不可信信息并思考该做什么,但它本身无法执行任何实际动作。在 AI 执行任务(如打开文件或发送消息)之前,其请求必须通过一个严格的安全检查点。这个检查点充当守门人的角色,根据特定的允许操作列表来检查智能体的权限。如果请求来自受信任的来源且符合权限,则予以通过;如果请求试图进行超出其范围的操作,或者看起来像是伪装成数据的隐藏命令,守门人会立即拦截。这种方法基于一个旧有的计算机硬件概念,即指令内存和数据内存被保存在不同的物理位置,以防止发生此类混淆。

研究人员构建了一个名为 Mastyf Guard 的软件工具来测试这个想法。他们训练了一个专门的 AI 模型,该模型规模较小且效率极高,用作这个安全守门人。为了验证其有效性,他们通过了包含五万个不同场景的严格测试。其中一半是真实的开发者安全命令示例,例如更新数据库或合并代码;另一半则是精心设计的攻击,旨在欺骗 AI 执行有害操作。这些攻击包括埋藏在文本中的隐藏指令、绕过安全过滤器的尝试,以及窃取敏感信息的请求。结果令人瞩目:Myster Guard 系统成功识别并拦截了 99.33% 的恶意尝试。相比之下,当时其他领先的安全工具未能拦截超过一半的此类攻击。该系统不仅更准确,而且速度极快。它可以在不到五微秒的时间内做出安全决策,这种速度使其能够在标准计算机处理器上运行,而无需昂贵的专用图形硬件。

该研究还强调了为什么以往保护 AI 的方法会失效。许多现有的安全工具旨在识别聊天对话中明显的威胁,如仇恨言论或暴力内容。它们并非为了识别一段看似礼貌的句子是否包含删除服务器或解锁门的隐藏命令而设计的。因为这些旧工具寻找的是“坏词”而非“危险动作”,所以让复杂的攻击轻易溜走。然而,Mastyf Guard 系统不仅仅是在寻找坏词,它还会检查上下文和权限。它理解即使是一个措辞完美的礼貌句子,如果试图使用智能体未被授权使用的工具,也可能是危险的。通过强制执行一项严格的规则,即智能体只能使用其拥有明确权限的工具,该系统防止了 AI 被误导成为一个“困惑的代理人”(Confused Deputy)——这是一个用于描述被攻击者诱导执行有害操作的受信任程序的术语。

尽管取得了成功,研究人员仍谨慎地指出了其工作的局限性。该系统在阻止试图获取智能体不应拥有的工具访问权的攻击方面非常有效。然而,如果攻击者设法诱导智能体修改其已经拥有权限的工具的具体细节,系统则依赖于 AI 识别细微含义差异的能力。在这些特定情况下,系统的拦截率约为 78.5%,虽然依然很强但并不完美。研究人员还强调,他们的解决方案旨在保持轻量化和经济实惠。由于它在标准计算机内存上高效运行,因此不需要大型 AI 模型所需的海量电力和昂贵硬件。这使得公司可以在不承担巨大财务负担的情况下,保障其自主智能体的安全。

研究结果表明,我们构建安全 AI 系统的方式需要改变。与其依赖 AI 足够聪明以识别什么是安全的,不如让架构本身来强制执行安全性。通过将 AI 的思考部分与行动部分分离,并在两者之间放置一个严格的、基于权限的闸门,研究人员创建了一个既比现有替代方案更安全、也更快速的系统。该研究为构建能够在现实世界中运行且无需时刻面临灾难风险的自主智能体提供了一条清晰的路径。它证明了通过将计算机架构的基本原理应用于人工智能的新挑战,可以创造出既在数学上严谨又在实践中有效的防御体系。这项工作是让自主智能体成为安全可靠的数字基础设施的一部分的重要一步,证明了安全性并不一定非要以牺牲速度或效率为代价。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →