Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems
本文介绍了 Proteus,一种自我演进的红色团队框架,它通过揭示自适应、反馈驱动的攻击者如何迭代绕过审计以创建致命智能体技能变体,证明了当前的技能审核系统严重低估了安全风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:你可以像在手机上下应用程序一样,为你的 AI 助手下载“技能”。这些技能告诉 AI 如何执行特定任务,例如查看你的银行账户或管理你的日历。但如果黑客创建了一个看似无害却暗中窃取你数据的“投毒”技能,会发生什么?
本文介绍了Proteus,一位数字安全研究员,旨在测试我们当前的安全防线在拦截这些投毒技能方面的有效性。
以下是其工作原理的分解,采用简单的类比:
1. 问题所在:“打地鼠”游戏
目前,当有人提交一个新技能时,它会经过安全审计员(一名数字守卫)的检查。守卫会检查技能的代码及其描述(文档),以判断其是否危险。
- 缺陷:大多数安全测试仅对技能进行一次检查。如果守卫说“通过”,该技能就会被安装。
- 现实:聪明的黑客不会只提交一个坏技能就放弃。他们会观察守卫为何拒绝它,对技能进行微调,然后再次尝试。他们会不断重复这一过程,直到找到一个既能骗过守卫又能造成破坏的版本。
论文将这种现象称为**“适应性泄露”**。其风险在于,黑客可以不断尝试,直到突破防线。
2. 解决方案:Proteus(自我进化的黑客)
研究人员构建了Proteus,这是一个 AI 代理,扮演着一个不知疲倦、善于学习的黑客角色。Proteus 并非只尝试欺骗守卫一次,而是进行多轮博弈:
- 提交:它向守卫发送一个技能。
- 倾听:如果守卫说“不”,Proteus 会读取原因(例如,“此代码看起来可疑”或“描述与代码不匹配”)。
- 进化:Proteus 利用这些反馈重写技能。它可能会修改代码、重写描述,或调整技能与其他工具的连接方式。
- 重复:它会持续这样做,直到找到一个既能骗过守卫,又能在安全模拟沙箱中成功执行有害操作(如窃取数据)的版本。
3. 五大攻击维度
Proteus 并非只改变一个方面,而是像一位精通开锁的大师尝试不同工具一样,从五个不同角度同时攻击技能:
- 目标:技能试图做什么?
- 结构:技能是如何组织的?
- 代码:实际的指令。
- 通道:它如何与外部世界通信。
- 文档:解释技能功能的书面描述。
Proteus 可以混合搭配这些领域的更改,以迷惑守卫。
4. “回合契约”(测试竞技场)
为了确保 Proteus 确实发现了真正的漏洞,研究人员构建了一个严格的测试竞技场,每次尝试都包含三个步骤:
- 审计:守卫是否放行?
- 沙箱:技能是否实际运行且未崩溃?
- 神谕:它是否真的执行了有害行为(如删除文件或窃取密码)?
只有当 Proteus 通过所有三个步骤时,才被视为“获胜”。
5. 研究结果
研究人员使用 Proteus 对两名真实世界的安全守卫(一名开源,一名来自一家大型科技公司)以及两个不同的 AI 模型进行了测试。
- 结果:Proteus 的效果令人恐惧。
- 仅在5 轮尝试中,它就有**40% 到 90%**的成功率绕过了守卫。
- 它不仅仅发现了一种技巧,而是找到了438 种不同的方法来破坏系统。
- 即使是他们测试的最强守卫(AI-Infra-Guard),也有约**41%**的时间未能阻止 Proteus。
- “迁移”技巧:当 Proteus 学会如何攻破一个守卫时,它通常可以利用相同的技巧攻破另一个守卫,而无需学习任何新内容。
6. 核心结论
该论文得出结论,我们目前检查 AI 技能的方式低估了危险。我们检查技能的方式,就像安全守卫只查看一个人的单张照片。但真正的攻击者则像是一个不断变换面孔的变形者,直到守卫放行。
Proteus 证明,如果我们不构建能够应对学习和适应型攻击者的系统,我们的 AI 生态系统将存在巨大的、隐蔽的漏洞,黑客可以轻易利用这些漏洞。
简而言之:我们原以为我们的安全守卫很擅长识别坏技能。但本文表明,如果坏分子足够聪明,能够从错误中学习,那么这些守卫实际上很容易被愚弄。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。