✨ 要点🔬 技术摘要
想象一下你拥有一座巨大且复杂的房子(一个软件代码库),你想找出所有可能的入侵方式。传统上,你会雇佣一支人类安全专家团队,让他们走遍每一个房间,检查每一扇窗户,并尝试破解每一把锁。这既耗时又费钱,而且难以规模化。
这篇论文介绍了 Co-RedTeam ,这是一个全新的系统,它利用人工智能(具体来说是大型语言模型,即 LLMs)来充当一个自动化的、超级聪明的安全专家团队。它不仅仅是让一个 AI 去猜测哪里可能有问题,而是组织了一群专门的 AI 智能体(Agents)协同工作,就像现实中的人类红队(Red-Teaming)团队一样。
以下是其工作原理的拆解,使用了简单的类比:
旧版 AI 安全工具的问题
以往尝试使用 AI 进行黑客攻击的方法,就像是给一个单一的机器人一张地图,然后对它说:“找到弱点。”
问题所在: 这个机器人经常会猜错,或者陷入僵局,或者在没有测试其计划是否奏效的情况下就盲目尝试破门。它缺乏“落地性”(Grounding)——它无法观察到它的想法在现实世界中是否真的有效。它也会忘记从之前的尝试中学到的东西。
Co-RedTeam 的解决方案:一支专业的特警队(SWAT Team)
Co-RedTeam 通过扮演一个协调一致的特警队,而不是孤狼,来解决这个问题。它将任务分为两个主要阶段,并由一个“团队领导者”(编排器/Orchestrator)进行管理。
第一阶段:侦查工作(漏洞发现)
在尝试破门之前,团队需要知道去哪里 寻找。
分析师智能体(Analyst Agent): 这个智能体就像一个拿着放大镜的侦探。它不仅仅是阅读代码;它使用特殊的工具来浏览整个“房子”(代码库),查看蓝图(文件结构),并检查规则(如 CWE 和 OWASP 等安全文档)。它寻找那些暗示锁具可能脆弱的线索。
批判者智能体(Critic Agent): 这个智能体就像一个多疑的编辑。当分析师发现一个潜在的弱点时,批判者会说:“你确定吗?拿出证据来。”如果证据不足,批判者会将分析师打回原形,让其重新仔细观察。这种反复确认的过程确保了他们不会在虚假警报上浪费时间。
第二阶段:破门而入(迭代式利用)
一旦找到了潜在的弱点,团队就会尝试真正破门,以证明该弱点的存在。
规划者智能体(Planner Agent): 这个智能体是战略家。它不是盲目地向墙壁扔石头,而是编写一个分步计划:“第一步:打开窗户。第二步:爬梯子。”
执行者智能体(Execution Agent): 这是负责实际执行计划的“肌肉”。它在一个安全的、隔离的沙盒(目标系统的数字模拟环境)中运行代码或命令,以观察破门是否成功。
评估者智能体(Evaluation Agent): 这个智能体观察结果。窗户开了吗?警报响了吗?它会告诉规划者:“这行不通,因为窗户从内部锁上了。”
循环(The Loop): 规划者听到反馈后,会更新计划(“好吧,试试后门”),然后团队再次尝试。他们不断完善计划,直到成功破门或证明这是不可能实现的。
秘密武器:“经验笔记本”(长期记忆)
Co-RedTeam 最重要的创新之一是它的长期记忆 。
类比: 想象一位人类专家,在解决了一个案例后,会在日记中写下一条笔记:“记住,当门锁住时,尝试通过信箱的钥匙孔,而不是把手。”
它是如何工作的: Co-RedTeam 保存三种类型的笔记:
模式(Patterns): “这类代码通常具有这种特定的弱点。”
策略(Strategies): “面对这种类型的系统时,先检查配置文件。”
技术技巧(Technical Tricks): “这个特定的命令成功绕过了那个防火墙。”
结果: 随着处理的任务越来越多,系统变得越来越聪明。它不会每次都从零开始;它从过去的成功和失败中学习,从而变得更快、更有效。
研究发现(结果)
研究人员在几个具有挑战性的网络安全挑战(如 CyBench 和 BountyBench)上测试了 Co-RedTeam。
成功率: 在测试的所有案例中,该系统成功发现并利用了超过 60% 的漏洞。
提升: 它明显优于其他 AI 方法(有些方法的成功率低于 10%)。
为什么有效: 论文表明,如果你移除团队中的任何部分(比如批判者、规划者或记忆模块),系统的表现都会大幅下降。其魔力在于所有这些部分都在一个包含规划、测试和学习的循环中协同工作。
总结
Co-RedTeam 就像是从一个试图黑入系统的、困惑的单一机器人,升级到了一个高度组织化、自我进化的安全团队 。它使用一个团队领导者来协调专家,检查自己的工作,从每一次尝试中学习,并使用现实世界的测试来证明其发现,这使得它在寻找软件弱点方面比以往的 AI 工具有效得多。
技术摘要:Co-RedTeam
问题陈述
尽管大语言模型(LLM)在网络安全领域展现出巨大潜力,但现有的自动化漏洞发现与利用方法仍面临显著局限。目前的系统通常依赖单智能体设置或通用的编程智能体,在处理多步推理、自适应攻击规划以及对漏洞空间进行鲁棒探索方面表现挣扎。关键挑战包括:
推理脆弱: 单次推理(single-shot reasoning)往往无法处理复杂的、多步骤的安全工作流。
缺乏执行落地(Execution Grounding): 许多系统依赖静态分析或假设性推理,而没有通过实际的代码执行来验证假设,这导致了高误报率和利用生成失败。
无法复用经验: 现有的智能体通常孤立运行,无法从先前的攻击轨迹中学习,也无法随着时间的推移积累特定领域的知识。
可扩展性: 手动红队测试(red-teaming)是劳动密集型的且难以规模化,而自动化的尝试往往缺乏处理真实世界代码库所需的深度。
方法论:Co-RedTeam
作者提出了 Co-RedTeam ,这是一个安全感知的多智能体框架,旨在模拟真实的红队测试工作流。该系统通过一个中央**编排器(Orchestrator)**管理两个协调阶段,在目标代码库和隔离的执行环境(Docker 容器)上运行。
1. 系统架构与编排
编排器 作为中央控制器,将高层级的安全目标转化为结构化的、可执行的工作流。它初始化智能体,分配特定角色的工具,并管理发现阶段与利用阶段之间的控制流。它负责验证输入,并根据是提供漏洞假设还是需要发现假设来动态路由任务。
2. 第一阶段:漏洞发现
此阶段侧重于在未提供明确描述的情况下识别潜在漏洞。
分析智能体(Analysis Agent): 配备了代码浏览工具(用于检查文件层级、入口点和代码片段)并能访问结构化的安全知识(CWE、OWASP)。它通过追踪不受信任的输入到敏感汇聚点(sinks)的过程,生成基于证据的漏洞假设。
批判智能体(Critique Agent): 充当独立的验证者,审查分析智能体的提议。它评估证据链、风险逻辑和可行性,分配风险等级(从“严重”到“信息级”),并提供反馈以进行完善或拒绝。
流程: 通过迭代循环持续进行,直到产生一组稳定的、有高置信度且有证据支持的漏洞候选集。
3. 第二阶段:迭代利用
此阶段通过在隔离环境中执行来验证已发现的漏洞。
规划智能体(Planner Agent): 维护一个显式的、多步骤的利用计划(Exploit Plan) 。它将攻击锚定在程序上下文和安全知识中,并根据执行反馈迭代地完善计划。如果某一步骤失败,规划器会插入纠正措施或修改后续步骤,而不是盲目重试。
验证智能体(Validation Agent): 一个安全门控,在执行前检查提议的操作(命令/脚本)是否符合语法正确性、安全性以及是否符合预期目标。
执行智能体(Execution Agent): 在沙盒化的 Docker 环境中执行经过验证的命令。
评估智能体(Evaluation Agent): 解析执行结果(stdout、stderr、退出码)以判断目标是否达成,识别偏差或错误,并为规划器的下一次迭代提供具体的指导。
流程: 系统在闭环(计划-执行-评估)中运行,直到漏洞被成功复现(生成概念验证 PoC)或被判定为不可行。
4. 长期记忆
为了实现持续改进,Co-RedTeam 采用了分层长期记忆 系统,在三个层面上存储经验:
漏洞模式记忆(Vulnerability Pattern Memory): 存储已确认的漏洞模式和常见的错误线索。
策略记忆(Strategy Memory): 捕捉适用于不同目标的、高层级的利用策略和工作流。
技术动作记忆(Technical Action Memory): 记录具体的、低层级的动作(命令、脚本)及其结果(成功或失败及修复方案)。 记忆通过研究计划、执行轨迹和评估反馈进行合成,并通过基于嵌入的相似性搜索进行检索,以辅助未来的推理。
核心贡献
框架设计: 引入了 Co-RedTeam,这是一个显式整合了安全领域知识、代码感知分析、执行落地迭代推理以及长期记忆的多智能体框架。
执行落地验证: 实现从静态推理向闭环“计划-执行-评估”过程的转变,通过真实的代码执行来验证漏洞,显著降低了误报率。
经验复用: 一种新颖的分层记忆架构,允许系统在不同任务间累积和复用知识(模式、策略和技术动作),模拟人类专家的学习曲线。
全面评估: 在具有挑战性的基准测试(CyBench、BountyBench、CyberGym)上进行了广泛测试,证明其性能优于强力的基线模型。
实验结果
作者在三个基准测试上使用各种骨干 LLM(包括 Gemini-2.5-Pro、Gemini-3-Pro 等)对 Co-RedTeam 进行了评估。
性能提升: Co-RedTeam 始终优于基线模型(Vanilla LLMs、OpenHands、C-Agent、VulTrail、RepoAudit)。
利用成功率: 在漏洞利用方面实现了超过 60% 的成功率(例如,在 Gemini-3-Pro 下,CyBench 上达到 63.7%)。
漏洞检测: 实现了超过 20% 的检测准确率(例如,在 BountyBench 利用任务上为 65.0%,检测准确率为 20.0%),相比最强的基线模型实现了超过 10% 的绝对提升。
消融实验:
执行反馈: 移除执行反馈会导致最严重的性能下降(例如,在 CyBench 上,ASR 从 59.1% 降至 17.5%),证实了其不可或缺性。
记忆: 禁用长期记忆会导致性能大幅下降,尤其是在长程任务中,凸显了经验复用的价值。
组件: 移除验证、代码浏览或安全文档会一致性地降低性能,证明了每个组件的必要性。
效率: 尽管采用了多轮架构,Co-RedTeam 仍表现出极具竞争力的延迟,其运行时间通常优于 OpenHands 和 C-Agent 等复杂智能体。
泛化能力: 该框架在多种模型家族(包括开源模型如 gpt-oss-20b 和 qwen3-32b)中表现出稳健的性能,表明其架构的有效性并不依赖于特定的 LLM。
重要性与主张
论文声称 Co-RedTeam 通过提供一个原则性的、执行落地的且由经验驱动的框架 ,解决了以往自动化红队测试方法的内核局限。通过将专门的智能体与结构化的工作流及长期记忆紧密结合,该系统有效地模拟了人类红队专家的行为。作者断言,这种方法能够实现鲁棒且自适应的漏洞验证,这是静态或单次推理方法无法实现的,为快速演进的软件系统提供了持续安全评估的可扩展解决方案。结果表明,结合领域知识、迭代执行和记忆驱动学习对于构建通用的网络安全智能体至关重要。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。