← 最新论文
💻 computer science

PolicyFaultBench: Mutation-Based Assurance of Policy Mediation and Proposal-Interface Conformance for Tool- Using AI Agents

PolicyFaultBench 是一个基于变异的基准测试,用于通过严格测试运行时策略调解(runtime policy mediation)和提议接口一致性(proposal-interface conformance)来验证工具使用型 AI 智能体,揭示了尽管智能体可以实现极高的执行成功率,但由于存在需要通过针对性探测才能检测到的细微接口偏差,它们仍可能无法满足严格的验收标准。

原作者: Hasan Fadhil Qasim, Sarah Abdulzahra Kadim

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Hasan Fadhil Qasim, Sarah Abdulzahra Kadim

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你最喜欢的 AI 助手就像一个超级聪明、积极主动的实习生。它可以编写代码、发送电子邮件,甚至在你要求时转账。但问题在于:这个实习生非常有创意,有时还特别爱唠叨。如果你对它说,“给我的老板发封邮件”,它可能会在发送邮件之前加上一个有趣的笑话、一个奇怪的表情符号,或者讲一段关于它周末生活的长篇故事。在计算机安全的高风险世界中,这种额外的闲聊不仅令人烦恼,而且非常危险。如果检查实习生工作的系统没有查看精确的消息,它可能会错过隐藏的陷阱,或者误批准一个危险的操作。这就是“策略仲裁”(policy mediation)的问题:确保当 AI 建议执行某个动作时,一个严格的安全卫士会在该动作被执行前,按照其原本书写的内容进行精确检查。大问题不在于“AI 是否聪明”,而在于“安全卫士是否在 AI 变得有点古怪时,依然能完美地履行职责?”

这篇题为 PolicyFaultBench 的论文,就像是对那个安全卫士进行的一次严苛检查。研究人员 Hasan Fadhil Qasim 和 Sarah Abdulzahra Kadim 并没有只是让 AI 做一些随机的事情;他们设置了一个受控的游戏,要求 AI 扮演一名“转录员”。AI 没有被要求规划复杂的任务,而是被赋予了一个特定的、固定的任务(例如“转账 10 美元给 Bob”),并被要求以一种非常特定的格式将其记录下来。研究人员随后测试了安全卫士(即“仲裁者”),看它是否能发现错误、奇怪的格式或隐藏的诡计。他们使用了一种被称为“变异测试”(mutation testing)的巧妙技巧,这就像是故意在微小的层面破坏安全卫士的规则手册,以观察卫士是否能察觉到。例如,他们可能会假装卫士忘记检查转账是否已获批准,或者假装卫士允许了一笔向不同人员转账的操作。

研究发现,虽然这些安全卫士(来自 OpenAI 和 Anthropic 等公司的系统)通常擅长阻止不良行为,但它们并不完美。在对一个供应商进行的 400 次试验中,卫士拦截了每一次错误的尝试。然而,当他们测试另一个供应商时,在 400 次中有 9 次,AI 在其消息中添加了一小段额外的文本(例如添加了一个并未被要求的“scope”字段)。遵循“消息必须完全匹配”这一严格规则的安全卫士拒绝了这 9 条消息。这是一种“失效关闭”(fail-closed)的设计,意味着由于一个微小的拼写错误而拒绝一条安全的消息,比意外接受一个危险的消息要好。研究人员表明,尽管在这 9 个案例中 AI 的意图是安全的,但严格的检查对于确保系统不会因额外的文本而产生混淆是必要的。

论文还发现,安全卫士的规则手册中存在一些隐藏的漏洞。当研究人员故意破坏规则(即“变异”部分)时,卫士在第一轮中漏掉了 12 种诡计中的 5 种。直到研究人员加入了专门设计用于寻找这些缺失漏洞的“探测”(probe)测试后,卫士才抓住了剩下的部分。这表明,仅仅因为一个系统目前运行良好,并不意味着它在面对明天可能出现的每一种诡计时都是安全的。研究人员还尝试观察这些结果在换用另一套任务(源自名为 AgentDojo 的基准测试)和另一套安全系统时是否依然成立。结果喜忧参半:在处理新任务时,AI 成功通过了 400 次中的 391 次,失败的原因同样是那个“额外文本”的问题。

简而言之,这篇论文表明我们不能仅仅依赖 AI 模型本身是完美的。我们需要一个独立的、严格的安全层,以极高的精度来检查 AI 的提议。如果 AI 添加了哪怕一个请求之外的单词,系统也应该停止并请求澄清,而不是进行猜测。这项研究证明,虽然目前的系统很强大,但它们需要不断的、严苛的测试,以确保不会错过细微的错误。研究人员总结道,安全性不仅仅是一个单一的“通过”或“失败”等级;它是一系列不同的检查——检查消息格式、检查规则以及检查最终结果——所有这些环节共同协作,守护着数字世界的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →