Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems
本文介绍了分布式信任框架(DTF),这是一种验证架构,通过以动态、共识驱动的模型取代基于静态身份的授权来保障主权人工智能系统的安全,在该模型中,执行权限严格源自可密码学验证的证明确认和不可篡改的证据链。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在运营一家规模庞大、安保严密银行。在过去,你给保安(即 AI 智能体)一把能打开所有门的万能钥匙。你信任他们,因为他们持有正确的身份徽章。但问题在于:这些保安现在是 AI。他们速度快、聪明,但有时会困惑、产生幻觉或被欺骗。他们可能会在不需要时尝试打开金库门,或者试图挪动他们不该碰的资金,而他们手中却握着一张完全有效的身份徽章。
旧系统说:“如果你有徽章,你就可以通行。”而本文描述的新系统则说:“仅有徽章是不够的。在移动半步之前,你需要一份针对确切这一项任务的、经过法官小组审批的、带有签名的许可单。”
本文介绍了一种名为**DTF(分布式信任框架)**的系统来解决这一问题。其工作原理分解为以下几个简单部分:
1. 问题:“常驻权限”陷阱
目前,如果一个 AI 智能体想要删除服务器或更改财务设置,它只需使用其永久登录凭证。只要这些凭证有效,系统就会回答“是”。
- 风险:AI 可能会犯错(例如,误以为服务器是空的,而实际上它正在运行公司的网站),并将其删除。系统允许这种情况发生,因为该 AI 拥有“正确”的身份标识。
2. 解决方案:“许可单”系统
DTF 系统不再让 AI 依据其永久身份采取行动,而是强制执行一个新流程。这就像是一个高风险的建筑工程项目:
- 步骤 1:意图(蓝图)
AI 智能体不会直接“执行”操作。它首先提交一份提案:“我想关闭服务器 X。” - 步骤 2:理由证明(安全报告)
在任何人批准之前,系统会自动生成一份理由证明。这不是 AI 思考过程的聊天记录。这是一份结构化的、机器可读的文件,说明:- 我们要做什么?(关闭服务器 X)
- 为什么它是安全的?(服务器 X 没有流量,它由 B 团队所有,且不属于关键依赖项。)
- 限制是什么?(仅限此服务器,仅限 5 分钟。)
- 步骤 3:共识(法官小组)
这份证明不是由一个人或一台计算机批准的。它会被发送给一个评估者集群。想象一个由不同专家组成的小组:- 一位检查规则(策略)。
- 一位检查服务器是否真的为空(状态)。
- 一位检查风险是否过高(风险)。
- 对于重大决策,其中一位可能是人类。
他们都查看同一份证明。如果他们全部同意(或达成特定共识),该操作即获批准。如果其中一人说“等等,那台服务器实际上很关键”,整个流程就会停止。
- 步骤 4:执行身份(临时通行证)
一旦小组批准了证明,系统就会创建一个临时的、一次性的通行证。该通行证受到严格限制。它规定:“你只能关闭服务器 X,且仅限接下来的 5 分钟。”它无法触碰其他任何事物。 - 步骤 5:证据链(黑匣子)
每一个步骤——提案、证明、法官的投票、临时通行证以及最终结果——都被记录在一个不可更改的永久账本中。如果日后出现问题,审计人员可以回放整个故事,以确切了解决策是如何做出的。
3. 为什么这很重要
本文声称,该系统改变了信任的规则:
- 旧方式:信任智能体(持有徽章的人)。
- 新方式:信任流程(证明、法官和记录)。
即使 AI 智能体感到困惑或被黑客攻击,它也无法造成损害,因为如果没有小组的批准,它无法获得“许可单”。而且,即使它获得了许可单,它也只能执行上面列出的那一项具体任务。
4. 结果(本文的发现)
作者在模拟云环境中测试了该系统,涉及 10,000 次操作。
- 安全性:它阻止了**100%**的“不安全”操作(例如尝试删除实际上正在使用的服务器)。旧系统允许约 14% 的此类危险错误溜走。
- 遏制范围:它减少了“爆炸半径”。AI 不再能访问 450 台服务器,而仅能访问一台被批准触碰的服务器。
- 速度:整个过程(检查证明、获取法官投票、签发通行证)平均耗时约58 毫秒。这足够快,不会拖慢业务。
- 可审计性:通过查看记录,他们可以完美地回放 99.9% 的决策,而旧系统的记录中留下了巨大的故事空白。
总结比喻
想象一个银行金库。
- 旧系统:保安拥有一把万能钥匙。如果他说“我需要打开金库”,他就会打开它。如果他心情不好或被欺骗,金库就会被打开。
- DTF 系统:保安必须填写一份表格。由三位不同的经理组成的团队审查该表格,以确保金库确实需要被打开且是安全的。如果他们达成一致,一台机器会打印出一把单次使用、激光切割的钥匙,这把钥匙仅在 5 分钟内适用于那扇特定的金库门。保安使用这把钥匙,摄像头会记录过程的每一秒。如果保安试图用这把钥匙打开另一扇门,锁根本转不动。
本文认为,对于运行我们关键系统(如银行、电网或云服务器)的 AI 智能体,我们需要停止信任“保安”,转而信任“流程”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。