Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems
本文介绍了 SkillVetBench,这是一个针对开放智能体技能生态系统的两阶段安全基准测试,它将对技能规范的语义分析与在受控沙箱中的运行时执行相结合,以有效地检测并验证静态方法所遗漏的恶意行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的个人 AI 助手不仅仅是一个单一的机器人,而是一个可以由社区任何人升级的瑞士军刀。你可以下载新的“技能”(比如一把新刀片或一把螺丝刀)来让你的 AI 协助你完成任务,例如检查银行余额、编写代码或预订机票。这就是**开放式智能体技能生态系统(Open Agentic Skill Ecosystems)**的世界。
问题在于?就像一把真正的瑞士军刀一样,如果有人在看似“无害的”螺丝刀里藏了一把隐藏的剃须刀,你可能直到它割伤你时才会察觉。这被称为供应链攻击(supply-chain attack)。
这篇论文介绍了一个名为 SkillVetBench 的全新安全测试系统,旨在这些危险伤害你的 AI 之前将其拦截。以下是它的工作原理,通过简单的解释说明:
问题所在:“好得令人难以置信”的技能
想象你下载了一个名为“天气检查器”的技能。它看起来很无害。它声称:“我会告诉你天气情况。”
- 陷阱: 指令(文本)说的是一套,但隐藏的代码做的却是另一套。也许它在秘密窃取你的密码或安装病毒。
- 旧方法: 之前的安全工具就像拼写检查器。它们只检查文本或代码结构。如果代码看起来很干净,但其“意图”是邪恶的(隐藏在指令中),拼写检查器就会漏掉它。它们也无法看到这个技能在运行时实际做了什么。
解决方案:SkillVetBench(两阶段侦探)
作者构建了一个两步走的安全检查机制,就像一个保镖和一名警察协同工作。
第一阶段:“聪明读者”(语义分析)
首先,系统使用一个超级聪明的 AI(大语言模型,LLM)来阅读技能的“简历”(其自然语言描述和指令)。
- 它做什么: 它不仅仅是在寻找坏词;它在问:“这个技能声称要做什么?它的故事与其行为是否一致?”
- 类比: 想象一场求职面试。一名候选人说:“我是个面包师。”但“聪明读者”注意到他戴着厨师帽,手里拿着枪,还在谈论“爆炸面团”。即使简历看起来很干净,读者也会标记此人可疑。
- 为什么重要: 它能捕捉到隐藏在指令中的威胁(例如“提示词注入”),而旧工具完全会错过这些。
第二阶段:“安全沙箱”(运行时验证)
如果“聪明读者”产生了怀疑,该技能就会被移交给沙箱(Sandbox)。
- 它做什么: 这是一个虚拟的、隔离的房间(数字游乐场),在这里技能被迫运行。系统会监视它的每一个动作:它是否尝试打开文件?它是否尝试拨打电话?它是否尝试安装其他软件?
- 类比: 这就像把嫌疑人关进一个玻璃隔绝的审讯室。你观察他们尝试撬锁。如果他们真的撬开了锁,你就有了证据证明他们是小偷。如果他们只是谈论撬锁但从未动手,你就知道他们只是在虚张声势。
- 结果: 这将“也许有坏心”的怀疑转化为了“我们抓了个现行”的定论。
他们的发现(“啊哈!”时刻)
研究人员使用现实世界中发现的恶意技能(包括最近的一次名为“ClawHavoc”的攻击活动)对该系统进行了测试。以下是他们的发现:
- 旧工具是盲目的: 旧的安全扫描器漏掉了高达 89% 的恶意技能。它们就像只看身份证件却忽略了那个人正拿着炸弹的安全警卫。
- “高权限”工具是危险区: 论文发现,大多数攻击发生在技能使用特定、强大工具的时候。
- 类比: 给孩子一把前门钥匙没问题。但给他们一把银行金库的钥匙(
exec)、删除房屋的能力(write_file)或雇佣自己保安的能力(spawn)则是危险的。研究表明,攻击高度集中在这些“超级工具”上。
- 类比: 给孩子一把前门钥匙没问题。但给他们一把银行金库的钥匙(
- 指令是薄弱环节: 许多坏技能并没有坏代码;它们只有坏的“故事”。它们误导 AI 认为:“噢,为了完成工作,我需要偷这个密码。”新系统之所以能捕捉到这些,是因为它阅读了“故事”,而不只是代码。
核心结论
SkillVetBench 是检查 AI 技能的新标准。它结合了阅读指令(以捕捉隐藏的诡计)与观察行动(以捕捉实际的犯罪)。
论文得出结论:为了保持 AI 安全,我们不能仅仅观察代码了。我们必须观察 AI 在运行时实际做了什么,因为真正的危险往往隐藏在技能“所言”与“所做”之间的差距之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。