Agent Guard: Kernel-Enforced Damage Boundaries for AI Agents via Human-Authorized Contracts
本文提出了 Agent Guard,这是一种 Linux 参考监视器,它通过使用基于 eBPF 的 LSM 来确定性地拒绝未经授权的文件和网络访问,并在进程层级间传播严格的“无出口”状态,从而为 AI 智能体执行人类授权的损伤边界,且其开销显著低于现有基准。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字领域,人工智能已从简单的文本生成器演变为能够规划复杂任务、运行程序并与计算机上的文件和网络进行交互的主动型工作者。然而,这种新的自主性带来了一种特定的风险:如果人工智能犯了错、被恶意提示词误导,或者仅仅是产生了一个危险指令的幻觉,它可能会执行破坏其原本旨在协助的系统的命令。传统的安全措施通常就像俱乐部的门卫,在允许进入前只检查工具的名称,但它们难以追踪一旦该工具打开了一个 shell、派生了一个子进程或写入了一个随后会被另一个程序读取的文件后所发生的情况。一旦人工智能绕过了初始检查,它的行为可能会在操作系统中产生连锁反应,导致安全团队无法分辨哪些执行部分是经过授权的,而哪些部分造成了损害。
为了解决这个问题,研究人员开发了一个名为 Agent Guard 的系统,它像一个位于计算机核心(即内核)内部的持续、不眨眼的监控器。该系统并不信任人工智能遵循规则,也不依赖人工智能来建议应该允许什么,而是要求人类在人工智能被允许运行之前确认边界。人类授权一组特定的规则来规范人工智能的行为,然后计算机操作系统会以绝对的确定性来执行这些规则。如果人工智能试图做出超出其授权范围的行为,系统会立即将其阻止,早在任何损害发生之前。这种方法将重点从尝试预测人工智能可能犯下的每一种错误,转向为人类决定安全的资产周围建立一道坚固、不可逾越的围栏。
研究人员通过创建一个位于人类授权与人工智能执行之间的特殊闸门来构建这个系统。在人工智能被允许运行任何代码之前,人类必须审查提议的计划,并明确确认人工智能被允许访问哪些文件和网络连接。这种确认不仅仅是一个建议;它是一份由计算机操作系统锁定的正式合同。系统随后将这份合同与人工智能即将执行的具体任务绑定在一起。如果人工智能尝试运行违反此合同的命令,操作系统会立即拒绝该请求。至关重要的是,该系统不仅检查初始命令,还会监控整个事件链。如果人工智能写入一个文件,随后该文件被另一个程序读取,限制也会随之传递。如果人工智能开启一个网络连接,系统会确保即使在限制完全应用之前已经建立了连接,也不会有数据离开计算机。
为了实现这种程度的控制,研究人员使用了一种技术,使系统能够直接挂载到操作系统的内部钩子(hooks)上。他们创建了一个数据平面,为每个进程、文件和通信通道都贴上特定的状态标签。当一个进程读取受限文件时,它会继承该限制。当它向管道(pipe)或套接字(socket)写入数据时,限制会传递到另一端。这种传播是单调递增的,这意味着一旦应用了限制,人工智能无法通过仅仅重启程序或重命名文件来移除限制。系统确保“禁止通行”的状态像污渍一样在进程网络中扩散,且无法被洗掉,从而防止人工智能通过中间步骤进行“洗钱”式操作来绕过规则。
团队对该系统进行了严格测试,以观察它是否真的能阻止其旨在预防的损害。他们运行了数百个正式的安全测试,涵盖了 19 种不同的场景,包括人工智能试图访问不应访问的文件、在受到限制后发送数据、或将限制传递给其他程序等情况。在全部 570 条测试记录中,系统的表现完全符合预期。它成功地拒绝了未经授权的操作,正确地在不同类型的文件和通信通道间传播了限制,并确保没有发生超出约定边界的副作用。该系统证明了它能够在无需依赖人工智能自身的判断或其政策建议的情况下,维持一个严格的、由人类授权的损害边界。
除了证明其有效性外,研究人员还测量了这一额外安全层对计算机速度的影响。他们将自己的系统与一种名为 ActPlane 的先前方法(一种类似的安全性工具)进行了比较。在涉及文件读写的测试中,新系统相比于没有任何安全措施的计算机,仅增加了约 12% 的延迟。相比之下,旧系统会导致计算机减速 33% 到 61%,具体取决于任务。这种显著差异表明,新方法不仅更安全,而且更高效,使其在注重速度的实际应用场景中具有可行性。研究人员发现,检查规则和追踪数据流的成本极低,尤其是与上一代工具沉重的开销相比。
这项研究还强调了该系统“不做”的事情,这与它“做”的事情同样重要。该系统并不声称能解决人工智能安全的所有问题,也不保证人类最初的决策是完美的。它仅仅确保:只要人类决定了规则,计算机就会毫不失败地执行该规则。它不对从未声明过的资产提供保护,也不会在人类明确授权危险行为时阻止人工智能造成伤害。它是一个执行工具,而非人类判断的替代品。它将“安全 AI”这一复杂且往往模糊的概念,转化为一个由人定义边界、由机器强制执行的技术现实。
最后,这项工作表明,创建一个既严格又高效的人工智能安全网是可能的。通过将“建议行动”的人工智能角色与“授权行动”的人类角色分离,并利用操作系统来执行这些授权,研究人员创建了一个损害可被界定且可预测的模型。该系统不依赖于人工智能的表现好坏,而是依赖于操作系统来防止人工智能表现恶劣。这种从“信任代理”到“执行合同”的转变,代表了我们如何保障自主计算未来安全的一个根本性变化,确保即使人工智能犯了错,其后果也会被限制在人类构建的围墙之内。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。