← 最新论文
🤖 AI

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

CAGE 是一个针对使用工具的 LLM 智能体的认证框架,它通过直接认证联合邻域,确保授权操作在离散绑定故障与连续数值漂移并存的情况下依然有效,从而消除了因将类别通道与数值通道分开处理而产生的误报。

原作者: Blaise Delattre, Cong Wang, Yang Cao

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Blaise Delattre, Cong Wang, Yang Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:CAGE(基于类型返回不确定性的认证授权)

1. 问题陈述

本文针对工具使用型大语言模型(LLM)智能体中的一个关键漏洞进行了研究。虽然部署的智能体宿主环境越来越多地采用运行时权限门控(runtime permission gates)来授权工具调用,但这些门控通常仅在单一时间点评估观测到的工具返回结果和提议的操作。它们未能考虑到残余绑定不确定性(residual binding uncertainty):即由于微小的组装故障(例如:过时的溯源标签、模式不匹配或竞态条件)以及有界数值漂移,导致智能体观测到的验证记录 (z~\tilde{z}) 可能与“正确绑定”的返回结果 (zz^\star) 存在差异。

核心问题在于:一个操作在观测记录下看起来是安全的,甚至在针对离散(类别型)和连续(数值型)扰动的独立检查下也是安全的,但在这些扰动共同发生时却可能变得不安全。作者将此称为联合间隙攻击(joint-gap attack)。现有的防御措施通常侧重于清洗不可信文本或评估单点操作,这使得决策边界在面对这类特定的语义不确定性时处于无保护状态。

2. 方法论:CAGE

作者提出了 CAGE(执行认证门控,Certified Authorization Gate for Execution),这是一种运行时监控器,它将授权的对象从观测点 (z~,a)(\tilde{z}, a) 转向联合邻域 Bd,ϵ(z~)B_{d,\epsilon}(\tilde{z})。只有当操作 aa 对于该邻域内所有可能的正确绑定的返回结果都保持安全时,才会被授权。

联合邻域

该邻域由两个预算定义:

  • 离散预算 (dd): 允许最多 dd 个可容忍的绑定故障(例如:单个溯源交换或策略包混淆)。
  • 连续预算 (ϵ\epsilon): 允许在标准验证后,数值字段(例如:风险评分、金额)出现有界的 2\ell_2 漂移。

非组合定理

一个核心的理论贡献是证明了通道的单独认证无法进行组合

  • 定理 1: 一个安全谓词可能在原始离散状态的所有连续扰动下是安全的,并且在原始连续值的所有离散交换下也是安全的,但在离散交换与连续偏移结合的情况下却是非安全的。
  • 启示: 边际证书(分别检查文本和数字)是不完备的。防御机制必须对离进制和连续制扰动的笛卡尔积进行认证。

CAGE 算法

CAGE 通过精确枚举离散邻域,随后进行可靠认证连续分支来运行:

  1. 枚举: 计算有限离散邻居集合 Nd(s)={s:Ddisc(s,s)d}N_d(s) = \{s' : D_{disc}(s, s') \le d\}
  2. 认证分支: 对于每个离散邻居 ss',认证该操作对于 ϵ\epsilon-球内的所有连续扰动 xx' 都是安全的。
  3. 决策: 仅当每一个分支都通过其连续认证测试时,才允许该操作。

假设阶梯(后端)

CAGE 根据策略的性质(可执行型 vs. 学习型)支持不同的后端:

  • CAGE-Exact (第一层): 用于策略为可执行谓词(例如:Rego 中的仿射约束或决策表)的情况。它在 ϵ\epsilon-球上对约束进行精确的数学验证。这是策略认证(policy-certified)
  • CAGE-Lip (第二层): 用于学习型门控(隐式策略)。它采用 1-Lipschitz 神经网络架构。它根据 Lipschitz 裕度(hθ>Lcertϵh_\theta > L_{cert}\epsilon)对门控的决策进行认证。这是门控认证(gate-certified),并在测量的门控策略保真度假设下是可靠的。
  • CAGE-RS (第三层): 用于黑盒门控。它应用随机平滑(Randomized Smoothing),在连续球上提供概率保证。这同样属于门控认证。

3. 核心贡献

  1. 形式化鲁棒授权: 本文将工具返回后的授权形式化为一种基于有界语义不确定性的决策,并证明了返回依赖型安全性需要检查实际的返回结果(命题 1)。
  2. 非组合证明: 作者证明了类别通道和数值通道的边际证书并不意味着其联合乘积的安全性,从而识别了“联合间隙见证者”(joint-gap witnesses)的存在(定理 1)。
  3. 带有假设阶梯的认证监控器: CAGE 提供了一个统一框架,通过精确枚举离散空间并使用分层后端(Exact, Lipschitz, Smoothing)来认证连续空间,确保即使对于学习型门控也能提供可靠的底线保障。
  4. 测量的安全性案例: 该工作提供了一个基于注入故障校准的严谨安全性案例,证明了 CAGE 在移除在预算内的错误允许(false allows)的同时,保留了有用的自主性。

4. 实验结果

评估涵盖了合成设置、策略即代码(Open Policy Agent, GoRules)、监管框架(PSD2/AML)以及真实交易数据(IEEE-CIS)。

  • 联合间隙见证者的存在性: 研究确认了联合间隙见证者的存在,其自然发生频率为 3.5% 至 12%
  • 可靠性(Soundness): 在所有设置中,CAGE 实现了 0 的认证错误允许(CFA)率。相比之下,单点门控和边际组合基准线在高频率下会允许这些不安全见证者的进入(通常达到见证集比例的 100%)。
  • 自主性: 尽管具有严格的安全保证,CAGE 仍保留了显著的自主性:
    • 在策略即代码设置中,CAGE-Exact 自动通过了 22–34% 的鲁棒安全决策;在自然流量中为 57%
    • 学习型后端(Lip/RS) 根据操作点的严格程度,保留了 6.5–37% 的自主性。
  • 端到端验证: 在实时系统测试(Kubernetes, MCP 写路径, AML 引擎)中,CAGE 成功拦截了被未加防护或仅加单点防护的智能体所允许的不安全副作用(例如:未经授权的部署、超额配额写入)。
  • 自适应攻击: CAGE 对已知策略和预算的自适应攻击保持可靠,而学习型单点门控在某些合成攻击下错误允许率高达 98%。

5. 重要性与声明

本文声称 CAGE 提供了一种校准的授权机制,适用于决策依赖于不确定类型返回的情况。其重要性在于:

  • 弥补逻辑鸿沟: 它是第一个正式认证类型返回联合邻域的系统,解决了单点防御和边际防御遗漏的漏洞。
  • 实际可部署性: 通过提供“假设阶梯”,它架起了理论完美的执行策略与实用的学习型门控之间的桥梁,在明确的保真度条件下为后者提供了形式化保证。
  • 操作现实性: 该工作明确区分了形式化保证与操作前提条件(例如:数据的实时性、构造器的完整性)。它量化了当这些前提条件失效(例如:数据陈旧程度超过声明预算)时的“残余风险”,而不是声称绝对免疫。

作者对其外部有效性的声明是审慎的:他们展示了在部署型流水线中联合间隙攻击的存在性、可实现性和机制,但并未声称已测量出这些特定故障在所有现实世界智能体系统中的普遍程度。他们得出结论:凡是可以通过测量和强制执行来处理类型返回不确定性的地方,CAGE 都是一种必要的运行时控制手段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →