← 最新论文
🤖 AI

SecureClaw: Clawing Back Control of LLM Agents

SecureClaw 是一种针对使用工具的 LLM 智能体的双边界安全架构,通过为读取操作强制执行受信任网关,并为写入操作强制执行 PREVIEW-to-COMMIT 协议,来防止未经授权的外部操作和敏感数据泄露,在保持任务效用的同时,在多个基准测试中实现了近乎为零的攻击成功率。

原作者: Yuhan Ma, Stefan Schmid

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhan Ma, Stefan Schmid

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位非常聪明但不可靠的私人助理(即 LLM Agent/大语言模型智能体)来处理你的敏感任务,比如支付账单、阅读私人邮件或管理你的日程。

问题在于,这位助理有点“不受控”。如果你给他们一份包含你银行账号的文件,他们可能会无意中(或恶意地)向陌生人读出这些数字,或者被电子邮件中隐藏的笔记所诱骗,从而把钱转给骗子。

目前的安保人员通常试图阻止助理坏事(比如转账),但往往无法阻止助理在第一时间看到秘密。一旦助理看到了秘密,他们可能会在安保人员拦截之前,就把秘密悄悄告诉其他程序,或者记录在自己的笔记里。

SecureClaw 是一款旨在同时解决这两个问题的全新安全系统。它将“看”和“做”视为两项不同的工作,并需要两把不同的锁。

以下是它的工作原理,我们使用一个简单的类比:

SecureClaw 的两把锁

1. 用于阅读的“眼罩”(网关/Gateway)

想象你的助理需要查看一份秘密发票以了解应支付金额。

  • 旧方式: 你把真实的纸质发票交给助理。他们可以读取数字、抄写下来,甚至在大声读给正在偷听的黑客听。
  • SecureClaw 方式: 你不给他们纸质发票。相反,你给他们一个神秘盒子(“不透明句柄/opaque handle”)和一个经过脱敏的小纸条(“受限摘要/bounded summary”)。
    • 纸条上写着:“来自供应商 A 的发票,金额 4,200 美元,截止日期为本周五。”
    • 神秘盒子是一个只有安全保险库才知道如何打开的代码。
    • 助理可以使用纸条和代码来规划他们的工作,但他们无法打开盒子去查看真实的账单详情。他们无法抄写真实的数字,因为他们从未见过这些数字。

2. 用于执行的“双重检查”(执行器/Executor)

现在,假设助理想要发送一封电子邮件来支付那笔发票。

  • 旧方式: 助理写好邮件并点击“发送”。如果黑客诱骗助理将收件地址改成了骗子的地址,钱就会转给骗子。
  • SecureClaw 方式: 助理只能提议发送邮件。他们写好草稿并说:“我想发送这个。”
    • 一个可信卫兵(执行器)会拿起这份草稿。
    • 卫兵会检查:“你确实要求发送这个吗?收件人正确吗?金额对吗?”
    • 至关重要的是,卫兵会根据一份密封且不可更改的收据,对精确细节进行核对。
    • 如果助理在获得批准后试图偷偷将电子邮件地址改为骗子的地址,卫兵会发现不匹配并拦截该邮件。只有卫兵才有权实际按下“发送”键。

为什么这很重要

论文测试了该系统在三个不同的“黑客游乐场”(AgentDojo、AgentLeak 和 ASB)中的表现,在这些场景下,攻击者试图诱骗智能体窃取数据或将钱转给错误的人。

  • 结果: SecureClaw 是唯一成功阻止了 100% 未经授权转账(0% 攻击成功率)并将秘密数据泄露降至几乎为零的系统。
  • 核心秘诀: 论文证明了仅靠一把锁是不够的。
    • 如果你只使用“双重检查”(阻止发送),助理仍然可以读取秘密并通过其内部笔记泄露出来。
    • 如果你只使用“眼罩”(隐藏秘密),如果助理没有拿到秘密,他们可能仍会被诱骗向错误的人发送信息。
    • SecureClaw 同时使用了两者。 它既让秘密对助理保持隐藏,又确保他们在没有经过信任检查的情况下无法强制执行动作。

当系统说“不”时会发生什么?

有时,系统拦截请求是因为看起来很可疑。在过去,这可能会直接停止整个工作流,让用户感到沮丧。SecureClaw 拥有一个**“安全恢复”(Safe Recovery)**功能。

如果卫兵拦截了一个请求,它不会仅仅显示“错误”,而是会给助理一条安全的、预先批准的路径来尝试重新操作。

  • 示例: “我无法向那个陌生人发送邮件。但我可以起草一份消息供您先行审阅。”
  • 这让工作得以继续进行,而不会降低安全标准。

总结

SecureClaw 就像雇佣了一名保镖:他在阅读你的日记时戴着眼罩(这样他就不会记住你的秘密),同时他还握着你汽车的钥匙(这样他就不能在未查看地图的情况下把你开车带往危险的地方)。它将规划的能力与行动的能力分离,确保即使助理受到了诱骗,损失也会被控制在范围内。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →