← 最新论文
🤖 machine learning

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam 是一个具备安全意识的多智能体框架,它利用具有执行落地推理、结构化交互和长期记忆能力的大语言模型,通过模拟真实的红队实战工作流,在自动化漏洞发现与利用方面显著超越了现有基准。

原作者: Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一座巨大且复杂的房子(一个软件代码库),你想找出所有可能的入侵方式。传统上,你会雇佣一支人类安全专家团队,让他们走遍每一个房间,检查每一扇窗户,并尝试破解每一把锁。这既耗时又费钱,而且难以规模化。

这篇论文介绍了 Co-RedTeam,这是一个全新的系统,它利用人工智能(具体来说是大型语言模型,即 LLMs)来充当一个自动化的、超级聪明的安全专家团队。它不仅仅是让一个 AI 去猜测哪里可能有问题,而是组织了一群专门的 AI 智能体(Agents)协同工作,就像现实中的人类红队(Red-Teaming)团队一样。

以下是其工作原理的拆解,使用了简单的类比:

旧版 AI 安全工具的问题

以往尝试使用 AI 进行黑客攻击的方法,就像是给一个单一的机器人一张地图,然后对它说:“找到弱点。”

  • 问题所在: 这个机器人经常会猜错,或者陷入僵局,或者在没有测试其计划是否奏效的情况下就盲目尝试破门。它缺乏“落地性”(Grounding)——它无法观察到它的想法在现实世界中是否真的有效。它也会忘记从之前的尝试中学到的东西。

Co-RedTeam 的解决方案:一支专业的特警队(SWAT Team)

Co-RedTeam 通过扮演一个协调一致的特警队,而不是孤狼,来解决这个问题。它将任务分为两个主要阶段,并由一个“团队领导者”(编排器/Orchestrator)进行管理。

第一阶段:侦查工作(漏洞发现)

在尝试破门之前,团队需要知道去哪里寻找。

  • 分析师智能体(Analyst Agent): 这个智能体就像一个拿着放大镜的侦探。它不仅仅是阅读代码;它使用特殊的工具来浏览整个“房子”(代码库),查看蓝图(文件结构),并检查规则(如 CWE 和 OWASP 等安全文档)。它寻找那些暗示锁具可能脆弱的线索。
  • 批判者智能体(Critic Agent): 这个智能体就像一个多疑的编辑。当分析师发现一个潜在的弱点时,批判者会说:“你确定吗?拿出证据来。”如果证据不足,批判者会将分析师打回原形,让其重新仔细观察。这种反复确认的过程确保了他们不会在虚假警报上浪费时间。

第二阶段:破门而入(迭代式利用)

一旦找到了潜在的弱点,团队就会尝试真正破门,以证明该弱点的存在。

  • 规划者智能体(Planner Agent): 这个智能体是战略家。它不是盲目地向墙壁扔石头,而是编写一个分步计划:“第一步:打开窗户。第二步:爬梯子。”
  • 执行者智能体(Execution Agent): 这是负责实际执行计划的“肌肉”。它在一个安全的、隔离的沙盒(目标系统的数字模拟环境)中运行代码或命令,以观察破门是否成功。
  • 评估者智能体(Evaluation Agent): 这个智能体观察结果。窗户开了吗?警报响了吗?它会告诉规划者:“这行不通,因为窗户从内部锁上了。”
  • 循环(The Loop): 规划者听到反馈后,会更新计划(“好吧,试试后门”),然后团队再次尝试。他们不断完善计划,直到成功破门或证明这是不可能实现的。

秘密武器:“经验笔记本”(长期记忆)

Co-RedTeam 最重要的创新之一是它的长期记忆

  • 类比: 想象一位人类专家,在解决了一个案例后,会在日记中写下一条笔记:“记住,当门锁住时,尝试通过信箱的钥匙孔,而不是把手。”
  • 它是如何工作的: Co-RedTeam 保存三种类型的笔记:
    1. 模式(Patterns): “这类代码通常具有这种特定的弱点。”
    2. 策略(Strategies): “面对这种类型的系统时,先检查配置文件。”
    3. 技术技巧(Technical Tricks): “这个特定的命令成功绕过了那个防火墙。”
  • 结果: 随着处理的任务越来越多,系统变得越来越聪明。它不会每次都从零开始;它从过去的成功和失败中学习,从而变得更快、更有效。

研究发现(结果)

研究人员在几个具有挑战性的网络安全挑战(如 CyBench 和 BountyBench)上测试了 Co-RedTeam。

  • 成功率: 在测试的所有案例中,该系统成功发现并利用了超过 60% 的漏洞。
  • 提升: 它明显优于其他 AI 方法(有些方法的成功率低于 10%)。
  • 为什么有效: 论文表明,如果你移除团队中的任何部分(比如批判者、规划者或记忆模块),系统的表现都会大幅下降。其魔力在于所有这些部分都在一个包含规划、测试和学习的循环中协同工作。

总结

Co-RedTeam 就像是从一个试图黑入系统的、困惑的单一机器人,升级到了一个高度组织化、自我进化的安全团队。它使用一个团队领导者来协调专家,检查自己的工作,从每一次尝试中学习,并使用现实世界的测试来证明其发现,这使得它在寻找软件弱点方面比以往的 AI 工具有效得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →