← 最新论文
🤖 AI

A Policy Algebra for Trust-Preserving Agentic AI Execution

本文引入了一种策略代数,通过形式化组合安全约束与运行时义务,为代理式人工智能定义了一个保持信任的可靠性包络,从而使系统能够在保持高任务完成率并确保审计完整性的同时,对几乎所有的策略违规行为进行干预。

原作者: Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界中,一场显著的变革正在发生。多年来,研究重点一直在于构建能够生成文本、回答问题或总结文档的系统。这些系统就像知识渊博的图书管理员,他们能阅读任何书籍,却被禁止触摸书籍或移动家具。而今天,新一代的软件——通常被称为“智能体”(agents)——已经被授予了进入大楼并使用钥匙的权利。这些智能体不仅会交谈,它们还会行动。它们可以搜索公司的私有文件、发送电子邮件、更新数据库、调用外部服务,甚至将任务的一部分移交给其他软件程序。这种从“思考”到“执行”的能力使它们对企业而言极其强大,但也引入了一种新型危险。错误不再仅仅是一个错误的句子,而是一个被删除的文件、一个泄露的秘密,或者是一笔花在从未完成的任务上的预算。

核心问题在于,智能体可能会在达成目标的同时违反规则。想象一下,一名员工成功送达了包裹,但却是通过闯入一个他们不被允许进入的锁闭房间来实现的。过去,安全系统主要检查一个人是否有进入大楼的证件。但对于这些智能体,安全检查需要在旅程中的每一步都进行,而不仅仅是在大门口。如果允许一个智能体做出决策,那么该决策必须根据请求者是谁、他们正在使用什么工具、他们还剩多少预算,以及是否有人类批准了该行动来进行核查。如果没有这种持续的监督,一个强大的工具很容易造成伤害,即使发起这个过程的人初衷是好的。

大众汽车数字服务部(Volkswagen Digital Services)和斯堪尼亚(Scania CV AB)的研究人员开发了一种管理这种风险的新方法,他们称之为“策略代数”(policy algebra)。不要将其视为一份规则清单,而应将其视为一种将不同的安全要求组合成单一、不可破解的决策的数学系统。研究人员意识到,要信任一个智能体,你不能只看它产生的最终答案,你必须观察它到达那里的整个路径。他们的系统将智能体想要采取的每一个行动都视为一个必须通过一系列“门禁”的转换。这些门禁会检查智能体的身份、其角色、它正在接触的数据敏感性、它使用的工具、剩余的预算,以及是否有人类签署了该动作。如果任何一个门禁失败,行动就会被停止。

这种方法的精妙之处在于它如何处理复杂性,特别是当一个智能体请求另一个智能体执行任务时。在许多现有系统中,当任务向下传递时,安全规则可能会意外地变弱,导致子智能体能够执行原智能体不被允许的操作。新系统通过确保权限在向下传递的过程中绝不会扩张来防止这种情况。相反,安全配置会变得更加严格或保持不变。如果一位高级经理要求一名初级员工提供帮助,初级员工突然间无法获得经理的私人文件访问权。该系统还能精细管理资金。它确保如果一个智能体消耗了大量的计算能力或资金,它必须产生实质性的结果,例如保存的文档或完成的记录。如果一个智能体在没有留下任何有用输出的情况下耗尽了预算,系统就会停止它,以防止公司在毫无进展的任务上浪费资源。

为了测试其效果,研究人员运行了数千个模拟场景,涉及智能体尝试完成各种任务。他们将新系统与旧方法进行了对比,旧方法依赖于简单的允许工具列表和用户角色。结果显示出明显的安全性差异。新系统拦截了 94.8% 的旧系统未能察觉的不安全行为。这包括防止智能体访问不该看到的数据、使用不被允许触碰的工具,或以绕过安全规则的方式将任务传递给其他智能体。该系统还消除了一种特定的失败类型,即智能体耗尽所有资金却未留下任何有用结果的情况。在追踪方面,新系统记录了 98.6% 的必要细节用于审计,而旧方法仅为 71.9%,这使得在出现问题时更容易理解发生了什么。

这种额外的安全性是有代价的。新系统的决策速度略慢,平均每次需要约 71 毫秒,而旧方法为 38 毫秒。此外,它偶尔会误停一个安全的动作,误报率约为 4.2%,而旧系统为 2.1%。由于这些额外的检查,智能体成功完成任务的总速率略有下降,从 90.7% 降至 86.9%。然而,研究人员认为这种权衡是必要的。目标不是构建最快或功能最全的智能体,而是构建最可靠的智能体。一个虽然完成迅速但涉及未经授权的数据访问或浪费资金的任务,并不是一次成功的任务。

这项研究证实,智能体的安全必须是整个旅程的属性,而不仅仅是终点。通过使用这种组合规则的方法,企业可以允许其软件拥有更多的行动自由,同时确保每一步都保持经过授权、可追溯且符合经济效益。该系统并不试图猜测智能体可能做错什么;相反,它创建了一个框架,使智能体只能在每一时刻都做那些被明确允许的事情。这种方法将人工智能的原始力量转化为企业可以真正信任、能在现实世界中运行的工具,因为在现实世界中,错误会带来真实的后果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →