← 最新论文
🤖 AI

Agent Security Needs Redefinition through a Holistic Framework

本文认为智能体安全性本质上是一个上下文问题而非基于内容的问题,并提出了一个由来源授权、任务对齐、动作对齐和数据隔离构成的整体框架,以应对当前侧重于内容的防御机制与基准测试的结构性局限。

原作者: Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位非常聪明、速度极快的飞船舰长。这艘飞船配备了一种新型自动驾驶系统:一个 AI 智能体。这个智能体不仅能操纵方向,它还能与其它计算机对话、打开舱门、移动货物,甚至修理引擎。但棘手的地方在于,你的飞船正穿行在一个充满噪音的星系中。有时,是友好的船员在下达指令,而有时,是狡猾的外星人试图通过将虚假指令隐藏在看似无害的信息中来欺骗飞船。

长期以来,研究这些 AI 飞船的科学家们认为,保持安全的唯一方法是观察指令中的“词汇”。如果指令听起来很可怕,比如“炸毁引擎”,他们就会阻止它。如果听起来很友好,比如“修理引擎”,他们就会放行。但这就像是一个夜总会的保安,只看你的衣服颜色。如果一个窃贼穿着红衬衫,保安就会让他进去;如果一个消防员穿着红衬衫,保安就会拦住他。问题在于,同样的词汇,根据说话的人是谁以及所处的环境不同,既可以是一个来自上司的友好请求,也可以是一个来自黑客的致命陷阱。这篇论文认为,我们不能只盯着词汇本身,而应该开始观察这些词汇背后的整个故事。


大混乱:词汇 vs. 谁说的

这篇论文的作者们(来自加州大学圣克鲁兹分校和加州大学伯克利分校的研究团队)指出,我们在测试和保护 AI 智能体方面犯了一个巨大的错误。他们说我们一直问错了问题。我们不应该问:“这条命令看起来危险吗?”而应该问:“这条命令在这个特定情境下是被允许的吗?”

为了理解为什么这很重要,请想象一个“删除文件”的指令:

  • 场景 A: 你的老板(他拥有大楼的钥匙)说:“删除去年的旧文件。”这是一件好事。
  • 场景 B: 一个黑客(他在公共公告栏里塞了一张便条)说:“删除去年的旧文件。”这是一场灾难。

两者的词汇完全相同,动作也完全相同。但在第一种情况下,它是常规清理;而在第二种情况下,它是一场犯罪。目前的安保系统就像一个只读便条的机器人。它看到“删除”就惊慌失措,或者看到“删除”就觉得“哦,没问题”,却完全没有检查是谁写的。作者认为,这就像是通过看电影的一个单帧画面来评判整部电影。你会错过剧情、角色和背景。

四部分安全检查

为了解决这个问题,论文建议我们不要只看动作本身,而是开始检查四项具体的事项,就像一支安全小组在允许飞船移动前运行清单一样。他们称之为“整体框架”(holistic framework),这只是一个高级说法,意思就是“观察全貌”。

以下是作者认为我们必须为 AI 采取的每一个动作检查的四条规则:

  1. 来源授权(谁在说话?): 这在问:“是否有持有正确钥匙的人真的说了这句话?”如果指令来自一个随机网页或 AI 正在阅读的一份文档,这就像是一个陌生人在街上对着你大喊大叫。即使指令是“汇款”,如果这个陌生人不是银行经理,答案也是“不”。
  2. 任务对齐(任务是什么?): 这在问:“这个指令是否属于 AI 被雇佣来完成的工作内容?”想象一个被雇佣来送披萨的送餐机器人。如果有人告诉它“去抢劫银行”,那就是另一份工作了。即使机器人可以开车去银行,它也不应该去,因为它不在其任务范围内。
  3. 动作对齐(这一步是否符合任务?): 这在问:“这个特定的动作是否有助于完成任务?”如果机器人在送披萨,它可能需要开门。但如果它决定“砸碎门”来通过,那就做得太过头了。目标(送披萨)没问题,但动作(砸门)不对。
  4. 数据隔离(秘密是否泄露?): 这在问:“AI 是否混淆了私人信息?”想象一位医生的助手。如果他们先帮助病人 A,然后再帮助病人 B,他们不应该在帮助病人 B 时意外提到病人 A 的病史。AI 需要将不同人的“文件”分开处理。

为什么旧的测试正在失效

论文指出,我们今天用来测试 AI 是否安全的许多测试都是有缺陷的,因为它们忽略了这四条规则。研究人员查看了两个流行的测试集——AgentDojoWASP,其中包含 45 个不同的“攻击”场景。

他们发现了一个令人惊讶的事实:这 45 个“攻击”中的每一个,也可以是正常的、合法的请求。

  • 攻击行为: “分小额多次转账 3 万美元。”
    • “坏”的版本: 一个试图偷钱的黑客。
    • “好”的版本: 一个合法的会计师,在支付房款时试图避开每日限额。
  • 攻击行为: “添加一名新用户作为所有者(Owner)。”
    • “坏”的版本: 一个试图接管项目的黑客。
    • “好”的版本: 一位正在为新合伙人办理入职手续的老板。

目前的测试仅仅看到了动作(“转账”或“添加用户”)并判定“这是攻击!”作者说这是错误的。测试无法区分差异,因为它没有检查要求这样做,或者为什么这样做。这就像一位老师因为学生在关于电影的故事里写了“炸弹”这个词,就判定学生不及格,却根本没读完剩下的故事。

“快照”问题

作者还批评了我们测试 AI 的方式。大多数测试就像是“快照”。它们给 AI 一个指令,观察结果,然后重置一切。它们擦除 AI 的记忆并重新开始。

但现实生活不是快照,而是一部电影。黑客可能不会立即发动攻击。他们可能会在今天在 AI 的记忆中植入一个“中毒”的便条,然后在三天后,当 AI 阅读该便条时,它会认为这是一个真实的指令。因为快照测试会重置记忆,它们永远无法发现这些缓慢且隐蔽的攻击。作者认为,我们需要观察 AI 的整个旅程,而不是仅仅看每一步。

解决方案:构建防御的新方式

那么,我们该怎么做?论文建议我们停止尝试构建“内容过滤器”(即仅仅扫描词汇是否有“坏感觉”的程序),转而构建“上下文检查”。

  • 与其问: “这句话看起来像是在黑客攻击吗?”
  • 我们应该问: “来源是否获得授权?任务是否被允许?动作是否过大?数据是否泄露?”

这改变了我们构建防御的方式。如果一个防御系统擅长检查“来源授权”,它就不需要完美地猜测某个词是否“不好”。它只需要知道说话的人是否持有钥匙。这是一项更容易且更可靠的工作。

作者承认这是一个巨大的变化。这意味着我们不能仅仅依赖 AI 去“了解”什么是坏的。我们必须建立系统,在 AI 工作时不断检查这四条规则。他们建议,虽然我们不可能做到完美的追踪,但我们可以建立能够很好地检查这四项内容的系统,以阻止重大的错误。

底线

这篇论文并不声称已经解决了 AI 安全的所有问题。它并没有说:“我们解决了一切!”相反,它说的是:“我们看待问题的方式错了。”

通过将安全视为一个关于在做什么以及为什么的故事,而不仅仅是一份“坏词”清单,我们可以构建出真正安全的 AI。这就像是一个保安不仅看你的脸,还会检查你的身份证、你的票据、你的目的地以及你的行李。论文指出,如果我们希望我们的 AI 智能体能在星系中安全飞行,我们就必须开始检查整张票据,而不只是那张脸。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →