Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills
本文介绍了 SkillGuard-Robust,这是一个将不受信任的代理技能预加载审计转化为鲁棒性三方分类任务的框架,在多样化的包评估中实现了近乎完美的恶意风险召回率和攻击一致性,同时凸显了外部来源迁移中持续存在的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为一份复杂的工作招聘一位新助手。这位助手并非只带着一份简历(即“提示词”)前来,而是带来了一整套工具包:一本手册(SKILL.md)、一套脚本、参考文档,以及记录其构建历史的仓库上下文。
问题在于,恶意行为者可能将危险指令隐藏在参考手册或脚本中,伪装成普通工具。如果你只阅读简历,就会错过这个陷阱;如果你只是将所有文件堆成文本堆,并让一个聪明的 AI“通读一切”,AI 可能会因信息量过大而困惑,或被精心重写的指令所欺骗。
本文介绍了SKILLGUARD-ROBUST,这是一种全新的安全系统,旨在允许这些“工具包”运行之前对其进行审查。以下是其工作原理,辅以简单的类比:
问题所在:“扁平化”视图与“结构化”视图
- 旧方法(扁平化): 想象将一台复杂的机器砸成一堆废铁,然后让一名警卫在这堆废铁中寻找隐藏的炸弹。由于零件之间缺乏有意义的连接,警卫可能会漏掉炸弹。在论文中,这被称为“将包扁平化”。它丢失了结构,因此隐藏的攻击(例如参考文件中的隐藏覆盖)会被遗漏。
- 新方法(结构化): SKILLGUARD-ROBUST 不会砸碎机器,而是保持部件的有序组织。它知道哪个文件是手册,哪个是脚本,哪个是历史记录。它会寻找跨文件线索——例如,脚本中写着“调用此远程助手”,而该说明仅在参考手册中解释。
攻击者使用的三种主要手段
论文指出了攻击者在这些工具包中隐藏身份的三种具体方式:
- 隐藏覆盖: 就像贴在手册上的一张便签,写着“忽略第 1 页的安全说明”。
- 伪装转移: 就像一辆标有“备份”字样的送货卡车,实际上却在走私违禁品。
- 远程引导: 就像一个“设置向导”,它秘密安装后门,而不仅仅是安装软件。
SKILLGUARD-ROBUST 的工作原理(四阶段流程)
该系统并非要求一个超级聪明的 AI 立即做出最终决定,而是采用四阶段流水线来捕捉其他系统会遗漏的错误。
阶段 1:侦探(结构化证据提取)
系统首先整理文件。它不只是阅读文件,而是绘制出谁与谁交互的地图。它会问:“这个脚本是否依赖那个参考文件?”它构建工具包结构的地图,确保不遗漏任何隐藏的连接。
阶段 2:专家(选择性语义验证)
大多数工具包要么明显安全,要么明显危险。但有些是“模糊”的——它们看起来可疑,但可能是无辜的。
- 创新点: 系统不会浪费时间让强大的 AI 审查每一个工具包。它只将那些“模糊”的工具包发送给专家 AI。
- 类比: 想象一个安检口。如果你的包看起来正常,你就可以通过。如果它看起来奇怪,专家就会打开它并仔细检查内容。这节省了时间,并将力量集中在需要的地方。
阶段 3:法官(冲突感知链仲裁)
有时,一个工具包包含两个相互冲突的信号:一部分看起来像“远程设置”(可疑),另一部分看起来像“数据传输”(危险)。
- 问题: 简单的 AI 可能只会说“这有风险”然后止步于此,或者对哪个风险是真正的风险感到困惑。
- 解决方案: 这一阶段充当权衡证据的法官。它会问:“这是一个无害的设置,还是一个伪装的盗窃数据行为?”它对哪条“事件链”占主导地位做出最终裁决。
阶段 4:一致性检查器(锚点一致性整合)
攻击者经常试图通过轻微重写指令(例如将“窃取数据”改为“移动文件”)来欺骗系统,同时保持相同的恶意意图。
- 解决方案: 系统会同时查看工具包的原始版本及其重写版本。如果重写版本明显危险,但原始版本被标记为“可疑”,系统会将原始标签修正以符合事实。它确保系统不会仅仅因为措辞改变而被欺骗。
结果:为何这很重要
作者在数百个工具包上测试了该系统,其中包括一些从未见过的工具包(如新的、现实世界的开源项目)。
- “强基线”(智能 AI): 即使是最聪明的现有 AI 模型(如 Qwen2.5-14B)也能很好地识别某些风险,但它们经常无法正确识别最危险的那些。它们会说“这看起来可疑”,却错过了这实际上是一次确认的攻击。
- SKILLGUARD-ROBUST: 通过采用四阶段流程,该系统在识别危险工具包方面取得了近乎完美的分数(准确率约为 97-99%),并且至关重要的是,它能识别出被重写的攻击仍然是攻击。
核心结论
论文总结道,要保护这些“代理技能”,不能仅仅依赖更大、更聪明的 AI 一次性阅读所有内容。你需要一个结构化流程,能够:
- 尊重文件组织。
- 仅在模糊案例中使用重型 AI 能力。
- 解决不同类型风险之间的冲突。
- 在攻击者试图重写其伎俩时检查一致性。
论文承认,虽然这种方法在已知和“冻结”的数据集上表现极佳,但现实世界仍然充满挑战,该系统并非应对所有未来攻击的灵丹妙药。但对于在运行前审计这些工具包这一特定问题而言,这种结构化方法相比现有方法是巨大的进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。