← 最新论文
🤖 AI

ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

本文介绍了 ColluSkill,这是一个通过将恶意意图分解为相互依赖且局部良性的子负载,从而规避现有技能扫描器的对抗性框架,并提出了 ChainGuard,一种通过分析工作流级风险来有效缓解这些跨技能组合攻击的上下文感知防御机制。

原作者: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你的电脑不仅仅是听从指令,而是拥有了一个可以拿起并使用的“技能”工具箱。把这些技能想象成乐高积木或手机上的 App:一个“搜索文件”积木、一个“发送电子邮件”积木,或者一个“阅读文档”积木。这些被称为智能体技能(Agent Skills),它们让聪明的计算机程序(被称为 AI Agent/人工智能智能体)能够通过将这些工具组合在一起来完成复杂的任务。但就像现实生活中一样,工具箱里的每一个工具并不都是安全的。有些工具可能隐藏着陷阱,旨在窃取你的秘密或删除你的作业。为了保持安全,我们拥有技能扫描器(Skill Scanners)——数字安全卫士,它们会在你把新工具放入工具箱之前检查每一个工具。它们会检查指令和代码,以确保里面没有隐藏任何诡计。研究人员提出的核心问题是:如果坏人不是试图隐藏一个巨大的、显而易见的陷阱,而是巧妙地混入三四个看起来微不足道且无害的小部件,只有当它们组合在一起时才会变得危险,那会发生什么?

这正是 ColluSkill 这篇论文所探讨的内容。作者发现了一种欺骗这些安全卫士的聪明方法。他们发现目前的扫描器就像是在夜店门口检查每个进入的人。如果一个人单独看起来很无辜,他就能进去。但研究人员展示了你可以将一个危险的计划拆分为几个微小的、看起来无害的部分。每一个部分单独来看都能通过保安的检查。但一旦它们全部进入内部并按正确的顺序工作时,它们就会重新拼凑在一起,形成一次危险的攻击。这篇论文将其称为 ColлоSkill,这是一个将恶意计划分解为一系列“串通(colluding)”技能的框架。它使用一种聪明的 AI 来规划这些部件如何组合,然后不断调整它们,直到它们在扫描器面前看起来完全安全,尽管它们已经准备好在开始工作时制造麻烦。

为了反击,论文引入了一个新的防御者叫做 ChainGuard。ChainGuard 不仅仅是孤立地检查新工具,它还会观察全局:“工具箱里已经有哪些工具了?这个新工具是如何与它们连接的?”这就像是一个保安不仅检查你的身份证,还会询问:“你要和谁见面,以及你们打算一起做什么?”研究人员在六种不同的安全扫描器上测试了他们的想法,发现这种技巧非常有效。ColluSkill 攻击平均 96.0% 的时间成功绕过了扫描器,而旧的攻击方式成功率仅为 37.8%。然而,当他们使用 ChainGuard 时,攻击的成功率大幅下降至 22.5%,同时仍让 99.5% 的良好、无害工具顺利通过。

隐形乐高套装的故事

让我们深入了解这一切是如何运作的,用一个关于特定类型劫案的故事来展开。

问题所在:“太聪明”的安全卫士
想象一下,你正试图将一个禁忌的“数据外泄脚本”(一个窃取你秘密的程序)带入一栋高安全性大楼。大门口的安全卫士配备了一个扫描仪。如果你带进一个贴着“被盗数据”标签的大红箱子,扫描仪会尖叫:“拦截!”并阻止你。

研究人员发现,目前的安全扫描器正是这样工作的。它们一次只检查一个技能。它们检查其指令、权限和代码。如果单个技能看起来是安全的,它就会获得“通过”。问题在于,这些卫士并不看整个团队。它们没有意识到,如果你带进三个人,每个人都带着一个微小的、无害的拼图碎片,那么这三个人一旦进入内部,就可能组装出那个禁忌的拼图。

攻击手段:ColluSkill(伪装大师)
作者创建了一种名为 ColluSkill 的方法来利用这个盲点。把它想象成一个大师级的窃贼,他决定不带一个大炸弹进来,而是带进三个独立的、看起来无害的物品:

  1. 技能 A(侦察兵): “我只想看看房间里的文件。”(看起来很无害)。
  2. 技能 B(记录员): “我只想记录我看到的东西。”(看起来很无害)。
  3. 技能 C(信使): “我只想向外界发送一条消息。”(看起来很无害)。

单独来看,安全扫描器检查每一个并说:“当然,没问题。”但诀窍在于:ColluSkill 使用一种聪明的 AI 来精确规划这三个技能如何连接。

  • 技能 A 找到一个秘密文件。
  • 技能 A 将该文件传递给技能 B。
  • 技能 B 将文件的内容写入一条消息。
  • 技能 B 将这条消息传递给技能 C。
  • 技能 C 将消息发送出去。

ColluSkill 的魔力在于两个步骤:

  1. 链条规划(Chain Planning): AI 找出完美的顺序,使得“危险”被分散开。没有任何一个单一技能本身在做坏事;它们只是在传递信息。
  2. 扫描器反馈(Scanner Feedback): AI 尝试将技能混入。如果扫描器标记了其中一个(例如,“技能 C 看起来有点可疑”),AI 就会重写它使其看起来更无辜,然后再次尝试。它不断重复这个过程,直到每一个部件都通过了检查。

在测试中,这种方法极其有效。当他们尝试将这些链条绕过六种不同的现实世界扫描器时,ColluSkill 成功率达到了 96.0%。相比之下,那些仅仅是拆分代码而没有这种智能规划的旧方法,成功率仅为 36.7%。研究人员发现,仅仅拆分代码是不够的;正是这种规划重写才成就了差异。

防御手段:ChainGuard(侦探)
那么,我们该如何阻止它呢?论文提出了 ChainGuard。ChainGuard 不再是一个一个检查人的保安,而是一个观察整体群体的侦探。

当一个新的技能想要进入时,ChainGuard 会问:“房间里已经有哪些人了?他们在做什么?”

  • 如果技能 C(信使)试图进入,ChainGuard 会查看已安装的技能,并发现技能 A(侦察兵)和技能 B(记录员)已经在那里了。
  • 它意识到:“等等。如果 A 寻找秘密,B 记录它们,而 C 发送它们,这就是一条窃取链!”
  • 尽管 C 单独看起来很无辜,但 ChainGuard 因为它可能与其他人一起做出的行为而拦截了它。

结果令人印象深刻。当研究人员使用 ChainGuard 时,ColluSkill 攻击的成功率从 96.0% 下降到了 22.5%。至关重要的是,ChainGuard 并没有拦截一切;它仍然让 99.5% 的良好、无害的工作流顺利通过。它学会了区分一群朋友在盖房子和一群小偷在策划劫案之间的区别。

它在现实世界中真的有效吗?
研究人员并没有止步于安全扫描器。他们测试了这些隐形链条是否能在真实的 AI 编程工具如 OpenCodeClaude CodeCodex 上运行。他们发现这些链条运行得非常完美。在 OpenCode 上,攻击链条成功激活了 89.5% 的时间(配合 GPT-5.5)。这证明了威胁不仅仅是理论上的;如果坏人使用这种方法,他们实际上可以在真实的计算机上执行这些攻击。

总结
论文得出结论,我们面临着一种新型的安全问题。我们不能仅仅检查单个工具是否安全,我们必须检查一组工具在协同工作时是否安全。ColluSkill 攻击表明,将一个坏计划拆分为细小的、无害的部分是一种绕过现有防御的非常强大的方式。但好消息是,ChainGuard 展示了一条前进的道路:如果我们开始观察工具如何连接和交互,我们就能在这些隐形链条造成任何伤害之前抓住它们。研究人员指出,AI 安全的未来不仅仅在于更好的扫描器,而在于更聪明的、具备上下文感知能力的卫士,他们理解整个故事,而不仅仅是单个章节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →