Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation
本文介绍了 SkillSec-Eval,这是一个全面的框架,用于识别并评估可重用大语言模型智能体技能在整个生命周期中的安全漏洞,证明了风险显著超出了传统的运行时执行关注点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的电脑不仅仅是听从指令,它还能真正出门为你办事。这就是 AI Agent(人工智能智能体) 的领域:这些聪明的程序可以规划步骤、使用浏览器或文件系统等工具,并独立解决复杂问题。为了让这些智能体变得超级强大,开发者开始用“技能”来构建它们。把这些技能想象成乐高积木或预制的食谱。你不需要每次都教 AI 如何从零开始烤蛋糕,而是给它一个“烘焙技能”,这样它就可以在需要时从数字架子上取用。这些技能是可复用的,这意味着一个技能可以被成千上万个不同的 AI 智能体共享。
但问题在于:就像一个物理图书馆可能会充斥着被篡改过的书籍一样,一个 AI 技能的数字图书馆也可能充满危险。如果坏人将一个“中毒”的技能混入图书馆,AI 可能会抓取它,因为它看起来外表完好无损,从而误以为它是安全的,接着就会在无意中删除你的文件或窃取你的密码。长期以来,科学家们只担心你对 AI 说的话会误导它(就像咒语失灵一样)。但这项新研究表明,真正的危险不仅在于你对 AI 说了什么,还在于 AI 从周围世界中 捡起了什么。
论文:《智能体技能安全》
这篇题为 《智能体技能安全:威胁模型、攻击、防御与评估》(Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation) 的论文,就像是一个关于这些数字乐高积木如何被黑客攻击的侦探故事。作者们意识到,当大家都在盯着 AI 的“嘴巴”(它在说什么)时,却忽略了 AI 的“双手”(它在捡起和执行什么)。他们构建了一个全新的测试框架,名为 SkillSec-Eval,旨在审视一个技能从诞生到数年后更新的整个生命周期。
技能生命的六个阶段
作者将技能的生命分解为六个不同的阶段,就像一场接力赛,接力棒在不同的跑者之间传递。如果在任何一个环节接力棒被换成了假货,整场比赛就会毁于一旦。
- 创作阶段(创造过程): 这是开发者编写技能的阶段。这里的危险在于,创造者可能会在看似有用的技能中隐藏恶意指令。
- 存储阶段(图书馆): 编写完成后,技能进入数字仓库(图书馆)。攻击者可以在这里潜入,将安全的技能替换为有害的技能,或者欺骗图书馆接受一个旧的、原本安全的技能的伪造版本。
- 检索阶段(搜索): 当 AI 需要执行某项任务时,它会搜索图书馆。攻击者可以通过“关键词堆砌”将他们的恶意技能填充大量热门关键词,使搜索引擎认为它们是最相关的结果,从而将它们推向列表顶端。
- 选择阶段(抉择): AI 的“大脑”(规划器)查看搜索结果的前几名并进行选择。攻击者可以通过编写虚假评论或误导性描述,诱导 AI 选择那个坏的技能而非好的技能。
- 执行阶段(行动): AI 实际运行该技能。即使技能被正确选中,它也可能尝试做一些不被允许的事情,比如打开一扇不该打开的门。
- 演进阶段(更新): 技能会随着时间的推移而更新。攻击者可能会等待一个技能获得信任并流行起来后,再将病毒植入“2.0 版本”的更新中。
重大发现:并非单一问题
研究人员测试了 327 个真实的技能,发现漏洞存在于每一个阶段。他们发现的不只是单一类型的黑客攻击,而是一个完整的攻击生态系统。
- 图书馆是“漏水”的: 他们发现,简单的规则(例如检查文件是否具有有效的签名)是不够的。坏人可以创建在纸面上看起来完美无缺、但在代码中隐藏恶意指令的技能。虽然他们使用了聪明的 AI 来检查代码的“含义”,但即便如此,仍有一些技能成功溜了过去。
- 搜索被“操纵”了: 在测试中,攻击者使用“关键词堆砌”(在坏技能中加入大量热门词汇)和“女巫攻击”(创建 15 个相同的坏技能副本)来进行攻击。如果没有特殊的过滤器,这些坏技能会占据搜索结果的主导地位。例如,在一次测试中,在没有防御措施的情况下,93.20% 的情况下坏技能出现在前 5 个结果中。在使用他们的新防御措施后,这个比例有所下降,但并未达到完美。
- AI 极易被骗: 当 AI 需要根据描述来选择技能时,很容易被虚假的“官方”徽章或误导性文本所欺骗。在一项测试中,45.64% 的情况下,AI 仅仅因为附带了一个虚假推荐就选择了坏的技能。
- 行动是危险的: 一旦坏的技能开始运行,它可能会尝试窃取数据。研究人员发现,如果没有运行时防护(runtime guard),他们测试的所有攻击(100%)都能成功到达目标。然而,即使有了防护,他们也发现了一个棘手的漏洞:如果 AI 在发送数据之前,先用自己的语言对被窃取的数据进行重写(改写/释义),防护措施有时会失效。
数据说明一切
论文提供了硬性的数字来展示这个问题有多难:
- 仓库准入: 当他们结合了简单规则与智能 AI 检查时,将进入图书馆的坏技能比例降低到了 7.9%。然而,这也导致 20.0% 的好技能被误拒,这表明过于严格的审查会阻碍真实开发者的工作。
- 检索: 对于“女巫攻击”(虚假克隆),在应用新防御后,排在靠前结果中的坏技能数量从平均 2.84 个降至 0.27 个。
- 规划器欺骗: 当坏技能带有虚假推荐时,AI 会在 45.64% 的情况下选中它们。使用防御措施后,这一比例降至 8.72%。
- 运行时: 即使有强大的运行时监控器,仍有 23.0% 的攻击成功了,因为 AI 设法将其数据窃取行为隐藏在自身的思考过程中。
他们未知的领域(以及他们排除的情况)
作者非常明确地说明了他们没有发现的内容。他们并没有找到一个能解决所有问题的“万能药”。他们明确排除了“仅检查代码结构(如查看签名)就足够了”的观点;你还需要理解其含义。他们还表明,没有任何一种防御措施可以单独发挥作用。如果你只保护图书馆,黑客就会操纵搜索;如果你只保护搜索,黑客就会欺骗 AI 的选择。
他们也承认研究存在局限性。他们是在一个包含 327 个技能的受控环境中进行的测试,而非整个互联网。他们也没有测试跨越多年发生的攻击(长期信任衰减)或直接试图破坏 AI 大脑的攻击(越狱/Jailbreaking)。他们指出,尽管该框架是一个巨大的进步,但保持这些数字乐高积木的安全仍然是一个开放性的挑战。
总结
这篇论文的主要教训是:我们不能只盯着 AI 的“嘴巴”,我们还必须盯着它的“手”、它的“图书馆”以及它的“更新”。安全不是一道单一的锁,而是一条由多重守卫组成的链条。作者构建了 SkillSec-Eval 来帮助我们测试这些守卫,其结果表明,虽然我们可以让系统变得更安全,但我们也必须小心,不要让系统变得过于严苛以至于无法正常运作。通往安全 AI 智能体的道路不在于寻找一个完美的盾牌,而在于构建一套观察旅程中每一步的层级化防御体系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。