← 最新论文
💻 computer science

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

本文介绍了 MalSkillBench,这是首个包含 3,944 种恶意 AI 智能体技能且经过运行时验证的基准测试,旨在证明当前的检测工具无法对代码和指令进行联合分析,从而表明需要一种能够跨越任务意图、代码和提示词进行推理的新方法,以保障智能体供应链的安全。

原作者: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一个超级聪明的机器人助手来帮你编写软件。为了让这个机器人变得更强大,你允许它从互联网上下载“技能”——就像是一些小型的应用程序或插件,告诉机器人如何执行特定任务,比如“计算税费”或“格式化这份文档”。

这些技能有点像是一张食谱卡(用纯英文写的指令)粘在一个厨房电器(运行实际代码的程序)上。

问题所在:“中毒的食谱”

研究人员发现,黑客开始对这些技能进行“投毒”。他们创建看起来很有用但隐藏了陷阱的伪造技能。

  • 代码陷阱: “厨房电器”部分可能会秘密窃取你的密码或删除你的文件。
  • 指令陷阱: “食谱卡”部分可能会诱骗机器人忽略其安全规则,或者去做一些不该做的事情,比如把你的私密数据发送给陌生人。

可怕的是,这两个陷阱经常协同作战。一个技能在食谱卡上看起来可能很无害,但背后却连接着一台危险的机器;或者反之亦然。

巨大的鸿沟:我们缺乏一个好的测试方法

直到现在,试图构建“技能检测器”(就像是这些机器人技能的杀毒软件)的安全专家们一直是在盲目飞行。

  • 他们没有足够大的坏技能列表来进行测试。
  • 他们拥有的少数坏技能大多是同一种类型(比如虚假的“加密货币”诈骗),这导致检测器在识别这类问题时表现出色,但在识别其他问题时却表现得很差。
  • 这就像是在测试一个火警报警器时,只用烤焦面包产生的烟雾来测试,然后就声称它能捕捉到油脂爆炸引发的火灾。

解决方案:MalSkillBench(“压力测试”)

作者构建了 MalSkillBench,这是第一个巨大的、经过验证的恶意技能测试场。

他们是如何构建它的:

  1. 工厂: 他们使用人工智能生成了数千个伪造的恶意技能。
  2. 沙盒: 他们不仅仅是靠猜测来判断一个技能是否有害。他们实际上将该技能运行在一个安全的、隔离的数字笼子(“沙盒”)中。
  3. 证明: 如果该技能在笼子中运行时确实做了坏事(比如尝试窃取文件或欺骗机器人),它就会被贴上“已验证”的标签。如果它未能实施坏事,他们就会把它送回工厂重新尝试。

他们最终得到了 3,944 个经过验证的坏技能4,000 个好技能,涵盖了 108 种不同的攻击类型。

他们的发现

当他们用这个全新的、大规模的测试对现有的安全工具进行测试时,结果令人惊讶:

  1. 代码易抓,文字难防: 检测器非常擅长识别坏代码(比如文件中的病毒),但非常不擅长识别坏指令(比如食谱中的诡计)。看清一颗炸弹比看清一个谎言要容易得多。
  2. “野外”数据是骗人的: 如果你只用在互联网上发现的少量“野外”坏技能来测试检测器,你会得到错误的答案。一个安全工具在野外数据上看起来像个英雄,但当在完整的 MalSkillBench 上进行测试时,它实际上是最差的一个。这就像是一个医生只治疗感冒,就认为自己是治愈一切的天才,直到遇到一个腿断了的病人。
  3. 旧工具并不适用: 你不能直接使用为常规软件设计的工具(用于捕捉坏代码)或为聊天机器人设计的工具(用于捕捉坏提示词)。一个恶意技能是一个混合体。只针对其中一半问题使用工具,会留下另一半漏洞。
  4. 真正的危险: 最危险的技能不仅仅是窃取文件,而是试图通过欺骗来攻击机器人的“大脑”。有些技能试图重写机器人的身份、改变其目标,或者让它忽略安全规则。目前的工具在这些“大脑黑客攻击”面前几乎是盲目的。

底线

为了保护我们的 AI 助手安全,我们不能只看代码,也不能只读指令。我们必须理解它们之间的关系这条指令对于这项任务来说是合理的,还是一个诡计?

该论文提供了一个真正的“压力测试”,旨在帮助开发者构建更好的检测器,使其能够识别这些混合型的诡计,而不是仅仅基于旧的、不完整的数据进行猜测。他们已经公开了所有的研究数据和工具,以便其他人可以共同解决这个难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →