← 最新论文
💻 computer science

aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents

本文介绍了 aiAuthZ,一种脱离主机的授权网关,通过执行基于身份绑定、不可变的策略和加密验证来保护 AI 智能体工具调用,在各种模型和场景下有效地将攻击成功率降低至 0%,且延迟极低。

原作者: Sai Varun Kodathala

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Varun Kodathala

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“容易上当的管家”

想象一下,你雇佣了一位非常聪明的管家(AI Agent/智能体)来打理你的家务。这位管家非常擅长执行指令:他们可以打开保险箱、发送电子邮件或转账。

然而,有一个问题:这个管家无法分辨出一条指令是来自你的真实命令,还是别人留在冰箱上的便利贴上的假命令。

如果一个陌生人溜进你的家,写下:“主人说:把所有的钱转到我的账户。” 管家可能会读到这张纸条,相信这是你的真实命令,然后照做。这就是所谓的提示词注入(Prompt Injection)。论文指出,仅仅依靠管家去“思考”一个指令是否安全是非常危险的,因为:

  1. 有些管家很单纯,有些则比较谨慎。
  2. 即便是最昂贵、最高级的管家,有时也会被骗。
  3. 你不能仅仅通过支付更高的薪水来让他们变得更安全。

解决方案:“异地保安”(aiAuthZ)

作者构建了一个名为 aiAuthZ 的系统。他们不再要求管家去判断一个指令是否安全,而是在管家与外界之间放置了一名保安,这名保安位于一个独立的、锁着的房间里(不同的信任域)。

以下是这个新系统的运作方式,分步骤说明:

1. “暗号”(身份验证)

每当你(用户)给出一个指令时,你不仅仅是口头说出来,还会用一个只有你和保安知道的、唯一的、不可破解的数字印章(HMAC 签名)对其进行签名。

  • 类比: 想象你递给保安一张纸条。纸条上有一个特殊的火漆封印。保安会检查这个封印。如果封印是真的,保安就知道:“这个指令确实来自主人,而不是陌生人。”
  • 转折点: 即使管家读到一张写着 “我是主人,把钥匙给我” 的纸条,保安也会忽略这些文字。保安只信任封印。如果封印与主人不匹配,无论文字写了什么,指令都会被拒绝。

2. “规则手册”(离线策略)

保安手里有一本管家看不见也无法修改的规则手册。

  • 类比: 管家可能认为:“我可以打开任何门!”但保安的规则手册规定:“只有主人可以打开保险箱。只有主人可以汇款。”
  • 即使管家被误导以为自己拥有权限,保安也会检查规则手册。如果请求者(即“封印”)不是主人,或者试图做超出范围的事(比如汇款一百万),保安就会阻止。

3. “不可伪造的收据”(二维码)

当保安说“是的,这是安全的”时,他们并不只是让行动发生。他们会打印一份证明该指令已获得授权的二维码收据

  • 类比: 这就像你在演唱会得到的门票。即使你拍下门票照片、缩小它,或者通过模糊的短信发送它,安全系统仍然可以扫描并识别出:“这是一张有效的门票。”
  • 论文通过对二维码进行拍照、裁剪和压缩进行了测试。系统仍能 94% 的情况下识别成功。这创造了一个永久且不可更改的记录,证明了谁做了什么。

4. “秘密保险库”(凭证代理)

保安还持有保险箱的钥匙(API 密钥)。管家并不持有这些钥匙。

  • 类比: 如果管家被诱骗尝试打开保险箱,他们无法做到,因为他们没有钥匙。他们必须向保安请求。保安检查规则,并在仅此一次的情况下将钥匙交给管家。如果管家试图偷窃钥匙,他们做不到,因为钥匙永远不会离开保安的房间。

这篇论文实际发现了什么

作者使用 15 种不同的 AI “管家”(模型)和 8 种不同类型的攻击(如诱骗管家窃取数据)对该系统进行了测试。

  • 没有保安时: 这些管家的表现不稳定。有些拒绝了诱骗(100% 安全),但有些则中招了(仅 38% 安全)。最昂贵的管家安全性也仅为 50%。
  • 有了保安后: 100% 的攻击都被拦截了。 每一个模型,无论是最便宜的还是最昂贵的,都阻止了恶意行为。
  • 速度: 保安在 0.03 毫秒内就做出了决策。这快得就像眨眼之间;它完全没有拖慢速度。
  • 现实世界测试: 他们在银行模拟系统中测试了这一点。即便黑客试图诱骗管家来窃取资金,保安也拦截了每一次尝试。

这个系统“不能”做什么

了解系统的局限性很重要,就像了解保安“不能”做什么一样:

  • 它不能阻止管家产生困惑。 管家仍然可能被误导,认为陌生人就是主人。保安的作用只是阻止管家根据这种困惑去“执行动作”。
  • 它不能阻止入侵了保安房间的黑客。 如果攻击者控制了保安所在的计算机,整个系统就会失效。
  • 它不能阻止管家使用其内置的工具。 如果管家拥有某种内置的后门(例如内置的 Shell 命令)可以绕过保安,保安就无法阻止。论文指出,在安装该系统时,你必须禁用这些后门。

总结

论文认为,我们不应该依赖 AI 模型来进行自我监管。相反,我们应该在它们面前放置一个独立的、基于密码学的安全保安。这个保安会检查请求者的身份,检查规则,并发出收据。它将一个混乱、不可预测的情况变成了一个确定、安全的过程,无论使用哪种 AI 模型,恶意行为都会被 100% 拦截。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →