← 最新论文
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

本文介绍了行为完整性验证(BIV),这是一个将确定性代码分析与大语言模型辅助提取相结合的框架,用于检测 AI 代理技能中声明能力与实际能力之间的差异,结果表明虽然大多数偏差源于开发者的疏忽而非恶意,但该框架能有效识别恶意威胁,并在大规模基准测试中优于现有基线。

原作者: Yuhao Wu, Tung-Ling Li, Hongliang Liu

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhao Wu, Tung-Ling Li, Hongliang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个数字助手(一个 AI 智能体),它可以为你做事,比如检查你的电子邮件、管理你的文件,或在社交媒体上发帖。为了让这个助手更智能,你可以安装“技能”——即赋予它新能力的小型第三方应用程序或插件。

将这些技能想象成雇佣一名承包商来为你家完成某项工作。

问题:“简历与现实”之间的差距

当你雇佣一名承包商时,他们会给你一份简历(即元数据),上面写着:“我会粉刷你的客厅。”但一旦他们开始工作,他们可能会秘密决定顺便闯入你的保险箱,复制你的珠宝,并将其在网上出售(即实际代码)。

在 AI 领域,这是一个巨大的问题。一个技能可能声称自己是一个无害的“天气工具”,但其隐藏的代码却可能正在窃取你的密码,或将你的私人数据发送给黑客。现有的安全工具擅长捕捉试图欺骗 AI 的黑客,但它们并不检查技能本身是否对其功能进行了虚假陈述。

解决方案:BIV(“真相侦探”)

本文的作者创建了一个名为**行为完整性验证(Behavioral Integrity Verification, BIV)**的系统。将 BIV 想象成一位超级聪明、会进行双重检查的 inspector,在允许承包商进入你家之前,他会同时检查承包商的简历和他们的实际工具箱。

以下是 BIV 的工作原理,使用简单的类比:

  1. “菜单”与“厨房”:

    • 菜单(声明的行为): 这是技能声称会做的事情(例如,“我可以读取文件”)。
    • 厨房(实际行为): 这是技能在运行时实际做的事情(例如,“我可以读取文件、删除文件,并将它们通过电子邮件发送给陌生人”)。
    • 检查: BIV 将菜单与厨房进行比较。如果厨房中存在菜单上未列出的隐藏暗门,BIV 就能发现它。
  2. “通用翻译器”:
    为了比较两者,BIV 使用了一份包含 29 个项目的检查清单(一种分类法)。它将复杂的计算机代码和自然语言指令翻译成简单的类别,例如“它能接触我的银行账户吗?”或“它能发送秘密消息吗?”。这确保了 inspector 与承包商使用同一种语言。

  3. “双人团队”:
    BIV 使用两种类型的 inspector 协同工作:

    • 机器人(确定性代码分析器): 这是一个严格的机器人,逐行读取代码。它非常擅长发现精确匹配,但可能会被巧妙的伪装所迷惑。
    • 人类(LLM 助手): 这是一个智能 AI,它阅读技能的书面说明和描述。它擅长理解上下文和隐藏含义,但有时会“产生幻觉”(编造内容)。
    • 团队协作: 它们互相交叉验证。机器人发现确凿的事实;人类发现狡猾的指令。它们共同构建了一份关于该技能真正在做什么的完整报告。

他们的发现(“审计结果”)

研究人员在来自公共注册表(OpenClaw)的近50,000 个技能上测试了该系统。以下是他们的发现:

  • 大多数技能是“笨拙的”,而非“犯罪的”:
    大约80%的技能在其声称会做的事情与实际做的事情之间存在差距。然而,研究人员发现,这些差距中的81%仅仅是错误或糟糕的文档记录(疏忽)。开发者忘记更新他们的简历,并非因为他们邪恶,而是因为他们粗心大意。
  • 真正的危险是隐藏的:
    剩余的19%实际上是恶意的。这些是试图窃取数据或夺取控制权的技能。
  • “复合威胁”的发现:
    最危险的技能不仅仅是做一件坏事;它们会做一连串的坏事
    • 类比: 单个坏行为就像一个小偷撬锁。而“复合威胁”则是一个撬锁、更改警报密码,然后呼叫 getaway 司机的小偷。
    • BIV 发现了四种新的此类“链条”,例如“窃取凭证 → 编码它们 → 将它们发送出去”。如果你一次只看一步,这些链条很难被发现,但 BIV 能看到整部电影。

结果:更优秀的安保人员

作者利用该系统构建了一个“恶意技能检测器”。当他们在已知恶意技能列表上测试它时:

  • 它拦截了**94.6%**的恶意技能(得分非常高)。
  • 它对良性技能犯的错误很少(误报率低)。
  • 其表现远优于仅依赖规则或仅依赖 AI 的先前方法。

核心结论

本文证明,我们可以自动审计 AI 技能,以查看它们是否在说真话。通过比较“简历”(它们所说的)与“工作”(它们所做的),我们可以区分那些只需修正其文书工作的笨拙开发者与试图窃取我们数据的真正黑客

该系统不仅仅会说“这是坏的”;它还会解释为什么(例如,“这是文档错误”与“这是数据窃取链条”),从而帮助安全团队决定是仅仅要求更新,还是立即禁止该技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →