← 最新论文
🤖 AI

Bounded Agents: Delegation Security for Multi-Agent AI Systems

本文介绍了代理主体链(Agentic Principal Chain, APC),这是一种通过执行动态、状态感知的授权检查来降低基于大语言模型的多智能体系统风险的安全架构,旨在防止提示词注入攻击、未经授权的委托以及禁止性的动作组合,从而在保持低延迟的同时,将数据外泄和篡改的风险降至接近于零。

原作者: Xabier Muruaga

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xabier Muruaga

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字化办公场所,一种新型的劳动者已经出现:软件智能体(software agent)。这些是由大型语言模型驱动的程序,它们可以阅读文档、发送电子邮件、在系统之间移动数据,甚至调用其他程序来完成任务。它们代表人类员工行事,接受指令并将其转化为一系列行动。其带来的效率提升是巨大的,但风险也同样高昂。如果一名人类员工被诱骗将秘密文件发给错误的人,其损害仅限于该个人的判断失误;但当一个软件智能体被诱骗时,它能以完美的执行速度,在所有它被允许触及的系统中执行这一错误。安全专家的核心挑战不仅在于让这些智能体变得更聪明以防受骗,还在于构建一个即使它们受骗了也无所谓的系统,因为届时造成的破坏在物理上是不可能发生的。

这正是独立研究员 Xabier Muruaga 在一项新研究中解决的核心问题。他提出了一种保护这些数字劳动者的方法,其核心不在于试图让智能体的“大脑”更加稳健,而是通过收紧智能体被允许执行的操作规则。研究认为,软件智能体被操纵的危险主要是一个权限架构问题,而非人工智能模型本身的问题。即使一个智能体在抵御诱骗方面表现完美,如果它被赋予了过多的自由去将无害的行为组合成危险的结果,它仍然可能造成伤害。例如,一个智能体可能被允许读取一份机密文档,也被允许发送一封电子邮件。单独来看,这两项操作都是安全的。但如果智能体被诱骗先读取该文档,紧接着将文档发送到外部地址,这种行为的组合便造成了一次数据泄露,而这并非任何单一权限的初衷。

为了解决这个问题,Muruaga 开发了一个名为“智能体委托链”(Agentic Principal Chain)的系统。想象一个指挥链:一位人类老板将任务委派给一名经理,经理再将该任务的一部分传递给一名初级助理。在传统的安全系统中,一旦老板给予许可,该权限就会在链条中向下传递且保持不变。初级助理可能会拥有与老板同样广泛的权力,如果该助理遭到破坏,就会产生巨大的风险。而“智能体委托链”通过确保每一步向下传递时,权限都变得更小、更具体,从而改变了这一现状。它就像一个坐在智能体思考过程之外的严格门卫。在智能体执行任何动作之前,这个门卫不仅会检查智能体是否有权执行该特定动作,还会检查智能体在此次会话期间过去做了什么。

该系统通过追踪“会话状态”(session state)来运作,即智能体所采取的每一个动作的运行日志。如果一个智能体被授权读取文件并被授权发送电子邮件,系统会查看历史记录。如果该智能体刚刚读取了一个秘密文件,即使发送电子邮件通常是被允许的,系统也会拦截下一次发送邮件的尝试。这防止了智能体将两个安全的操作组合成危险的操作。研究人员称之为“组合闭包”(composition closure)。这是一条规则,规定某些动作的组合是被禁止的,无论单个步骤是否被允许。此外,该系统还限制了单个智能体的“爆炸半径”(blast radius)。如果一个子智能体遭到破坏,它所能造成的破坏在数学上被限制在其继承的权限之内,而这些权限严格小于创建它的那个智能体的权限。这确保了系统某一部分的漏洞不会扩散并控制整个组织。

为了测试这种方法是否奏效,研究人员构建了一个该系统的运行版本,并对其进行了系列严苛的试验。他们利用已有的安全基准对数千次模拟攻击进行了测试。在一次涉及 1,000 多个旨在窃取数据的场景测试中,该系统拦截了每一次尝试。在另一组测试中,研究人员模拟了人工智能模型本身被完全接管并完全受攻击者控制的情况,系统依然阻止了攻击。当模型试图发送窃取的数据时,门卫拒绝了请求,因为该组合动作违反了会话规则。该系统还成功阻止了智能体破坏文件或以非原定任务的方式操纵数据,将此类攻击的成功率从 90% 以上降低到了仅 12%。

研究还测量了这层额外的安全保障在多大程度上减慢了智能体的速度。结果显示,该系统运行极快,在决策所需的时间上增加不到四分之一毫秒。这意味着安全检查几乎是瞬间完成的,用户不会察觉到明显的延迟。然而,研究人员也发现存在权衡。在某些情况下,严格的规则阻止了智能体完成合法的任务,因为系统对于动作组合过于谨慎。在测试中,当应用最严格的规则时,合法任务的成功率下降了约 8.6 个百分点。这表明虽然该系统在阻止攻击方面非常有效,但需要进行仔细的微调,以确保它不会因过于严苛而阻碍正常工作。

研究人员仔细界定了其系统的功能边界。他们从数学上证明,如果规则设置正确,智能体是不可能执行被禁止的组合动作的。他们还证明,来自被破坏智能体的潜在损害不会随着任务在指挥链向下传递而扩大。然而,他们也指出该系统无法解决所有问题。如果某个单一动作本身就在允许的规则之内(例如智能体拥有删除文件的权限,那么它被诱骗删除文件),该系统无法阻止其造成伤害。它也无法阻止智能体在允许的范围内做出错误的决策。这些问题需要不同的解决方案,例如更好的 AI 训练或对特定处理数据的更详细检查。

最终,这篇论文展示了我们看待人工智能安全方式的转变。与其试图构建一个不可破解的“大脑”,重点转向了构建一个不可破解的“笼子”。通过强制执行严格的动作组合规则,并确保权限在任务委派过程中不断缩小,该系统创造了一个即便智能体的判断力失效也能提供保护的安全网。研究表明,通过正确的架构控制,我们可以允许这些强大的数字劳动者在复杂的环境中运行,而不必担心瞬间的混乱会导致灾难。研究结果表明,实现安全人工智能的路径不仅在于开发更聪明的模型,还在于构建更聪明的系统——那些即使在模型说“是”的时候,也知道如何说“不”的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →