← 最新论文
💻 computer science

Context-to-Execution Integrity for LLM Agents

本文介绍了上下文到执行完整性(Context-to-Execution Integrity, CXI),这是一个通过对受保护的汇点字段、有效载荷和调用事件实施严格权限检查来保障大语言模型(LLM)智能体安全的系统,旨在确保只有具备绑定字段、影响和调用权限的操作才会被执行,从而在多种基准测试中实现了零观察到的安全逃逸。

原作者: Igor Santos-Grueiro

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Igor Santos-Grueiro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个技术精湛但容易受骗的助手(AI 智能体),他正试图为你处理事务,比如发送电子邮件、编辑文件或运行代码。这个助手阅读着一本写满了指令、笔记和消息的巨型笔记本。问题在于,一个聪明的骗子(攻击者)可以在笔记本中偷偷塞入笔记,试图诱骗助手去做一些危险的事情,比如删除数据库或把钱汇错人。

这篇论文介绍了一个名为 上下文执行完整性(Context-to-Execution Integrity, CXI) 的系统。你可以把 CXI 想象成站在“行动室”门口的一名极其严格的保安。他的职责不是去阅读整个故事或判断某项任务是否是个好主意;他的职责是检查助手是否拥有开启这扇门所需的特定且有效的钥匙

以下是它的工作原理,使用简单的类比进行说明:

1. 问题所在:“权限洗白”(Authority Laundering)

通常情况下,如果助手在笔记本中读到一条笔记说:“文件失败了,所以请运行 delete_all 命令”,它可能会照做。论文将此称为权限洗白。这就像是一个小偷拿着一张看起来合法的身份证件(关于文件失败的笔记),并试图利用它来打开银行金库(执行删除命令)。这条笔记解释了为什么发生了某事,但不应该拥有让某事发生的权力。

2. 解决方案:三部分安全检查

CXI 充当守门人的角色。在助手真正执行任何操作(如写入文件或发送电子邮件)之前,守门人会检查三件事。所有这三件事都必须与同一个特定的计划(称为“清单/Manifest”)相匹配。

  • 检查 1:“谁”(字段权限/Field Authority)

    • 类比: 假设助手想要给特定的人写信。笔记本中的笔记可能会说:“发给鲍勃。”但保安会检查:“是否真的有一个受信任的老板或经过验证的系统说了‘发给鲍勃’?”
    • 如果“鲍勃”这个名字仅仅来自攻击者写的随机笔记,保安会说。这个名字必须来自一份“类型化发布”(Typed Release)——这是一张特殊的、经过验证的纸条,上面写着:“是的,这个特定的姓名允许用于这个特定的字段。”
  • 检查 2:“什么”(效果权限/Effect Authority)

    • 类比: 假设助手想要为某个计算机程序应用补丁。笔记说:“应用这段代码。”保安会检查:“这段代码实际执行的操作是否正如我们所想的那样?”
    • 保安不仅看文字,还会看结果。如果代码是一个“补丁”,保安会验证它对系统究竟会做出哪些改变。如果攻击者试图混入一段看起来像补丁但实际上会删除文件的命令,保安会因为它与授权计划中的“效果”不符而将其拦截。
  • 检查 3:“何时”(调用权限/Invocation Authority)

    • 类比: 假设助手想要按下“开始”按钮。保安会检查:“助手现在是否有有效的票据来按下这个按钮?”
    • 即使名字和计划都是正确的,助手也需要一个特定的“能力”或票据来触发动作。如果攻击者试图诱骗助手按下两次按钮或在错误的时间按下,保安会因为缺少或票据过期而拒绝,说

3. “清单”(Manifest,即主计划)

论文将最终批准的计划称为 清单(Manifest)。你可以把它看作是一份合同

  • 助手提议一个行动。
  • 保安检查“谁”、“什么”和“何时”。
  • 如果这三部分完美匹配并且都关联到同一个合同,保安就会在合同上盖章,并交给助手一份“租约”(Lease,即许可),允许其执行。
  • 如果其中任何一部分缺失或不匹配(例如,名字是对的,但“何时”的票据不对),保安就会关上门。

4. 那些“坏”笔记怎么办?

论文指出,助手仍然可以阅读攻击者的笔记。

  • 不透明数据(Opaque Data): 如果攻击者写道:“系统坏了”,助手可以将该文本复制到“注释”或“证据”框中。这就像是把笔记放在一个玻璃展示柜里。它是可见的,供人类阅读,但它没有任何力量去开门或触发行动。它仅仅是数据,而不是钥匙。

5. 他们测试了什么?

作者通过几种方式测试了这个系统:

  • 实战模拟: 他们使用了一个“道场”(训练场),其中包含 720 个真实的场景,攻击者试图在这些场景中欺骗智能体。系统拦截了每一次未经授权的行动。
  • 代码智能体: 他们测试了编写代码的智能体。即使攻击者尝试注入错误的命令,系统也只允许具有正确“钥匙”的行动通过。
  • 结果: 在所有的测试中,零次未经授权的行动穿过了大门。该系统成功阻止了“权限洗白”。

总结

CXI 是一个防止 AI 智能体被欺骗的系统。 它确保了仅仅因为 AI 在笔记中读到了一条危险指令,并不意味着它就拥有执行该指令的权力。只有当一个受信任的系统明确给予它针对该特定工作的特定钥匙时,AI 才能采取行动。它将 AI 从一个容易受骗的读者转变为一个纪律严明的工人,只遵循经过验证的命令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →