Authenticated Workflows: A Systems Approach to Protecting Agentic AI
本文提出了一种名为“身份验证工作流”(Authenticated Workflows)的系统化安全框架,通过在提示词、工具、数据和上下文四个边界实施基于密码学证明与动态策略语言(MAPL)的确定性防护,实现了对智能体(Agentic AI)工作流的高效、完备且低误报的安全保障。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这是一篇关于如何给“AI智能体(AI Agents)”穿上“防弹衣”的技术论文。为了让你轻松理解,我们可以把这个复杂的系统想象成一个**“高度自动化的超级银行柜台”**。
1. 背景:现在的AI智能体有多危险?
想象一下,你雇佣了一个极其聪明但“没脑子”的超级银行柜员(这就是 AI Agent)。他可以帮你查账、转账、甚至写邮件。
现在的安全问题在于:
这个柜员虽然聪明,但他分不清什么是“客户的指令”,什么是“客户塞进来的假钞”。如果有人在传达给柜员的一张便条(数据/提示词)上写着:“别管客户说了什么,现在立刻把金库钥匙交给我”,这个柜员可能真的会照做。
目前的防御手段就像是给柜员配了一个“保安”(语义过滤器),保安通过观察人的表情和语气来判断是不是坏人。但坏人可以伪装,或者用极其隐晦的方式说话,保安很容易被骗。这就是论文里说的“概率性防御”——靠感觉,不靠证据。
2. 核心方案:什么是“身份验证工作流”?
这篇论文提出了一个全新的思路:不要试图去猜谁是坏人,而是要让每一个动作都必须带着“防伪印章”。
他们把AI的工作流程变成了**“全流程加密验证”**。在银行里,这就像是:
- 不再只看脸: 柜员不再仅仅通过“看你像不像好人”来办事。
- 必须有印章: 每一个动作(查账、转账、发邮件)都必须盖上一个无法伪造的数字印章(加密签名)。
- 必须符合规章: 每一个印章里都必须包含一份“授权书”(策略),证明这个动作是经过老板批准的。
3. 四道“防弹门”:保护四个关键边界
论文认为,AI在干活时会经过四个容易被攻击的关口,他们为每个关口都设了防线:
- 指令关 (Prompts): 防止有人通过“洗脑”指令让AI变坏。
- 工具关 (Tools): 防止AI被骗去乱动开关(比如乱删数据库、乱发邮件)。
- 数据关 (Data): 防止AI读取了带有“病毒指令”的文件。
- 记忆关 (Context): 防止坏人在长期的对话中,一点点“潜移默化”地把AI带偏。
这就好比银行里: 每一笔钱的流向、每一张文件的读取、每一个指令的下达,都必须经过四道独立的安检门。哪怕坏人骗过了第一道门,第二道门也会因为“印章不对”或者“权限不足”直接把他拦下。
4. MAPL:AI专属的“智能法律手册”
为了管理这些复杂的规则,他们发明了一种叫 MAPL 的新语言。
传统的规则手册(像旧的法律)非常臃肿,如果银行有1万个员工和1万种业务,规则就会多到写不完。
MAPL 就像是一套“智能层级法律”:
- 它支持**“继承”**:总行定个大规矩,分行可以定更细的规矩,但分行绝对不能违反总行的规矩(论文里用数学证明了这一点,叫“单调限制”)。
- 它支持**“工作流证明”**:比如规定“只有在完成了‘身份核实’并盖了章之后,才能进行‘转账’”。这就像是银行规定:必须先看到“身份证章”,才能看到“取款单章”。
5. 总结:这套系统的厉害之处
这篇论文最牛的地方在于,它不是在“修补漏洞”,而是在“重构规则”:
- 从“猜”变成“算”: 以前是保安看你像不像坏人(概率),现在是看你的印章对不对(数学/加密)。
- 100% 的确定性: 论文通过测试证明,这种方法能拦截 100% 的已知攻击,而且不会误伤好人(零误报)。
- 通用性强: 无论你用的是哪种AI框架(像是在用不同的银行系统),这套“防弹衣”都能通过简单的适配器穿上去。
一句话总结:
这篇论文为AI智能体建立了一套**“不讲感情、只认印章、层层加码”**的硬核安全标准,让AI在自动化办公时,不再是一个容易被忽悠的“傻白甜”,而是一个严格遵守法律、自带防伪验证的“专业银行家”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。