想象一下,你是某个庞大而混乱的仓库(即你的软件系统)的经理。每天,成千上万的扫描器就像过度热情的保安一样四处奔跑,大喊:“这里可能有问题!那里也可能有问题!”它们生成了多达 4000 多条警报。其中大多数是误报、重复项,或是实际上并不会威胁仓库安全的微小问题。
你的由人类安全专家(即分析人员)组成的团队正被这些噪音淹没。他们无法修复真正的火情,因为他们忙于阅读保安留下的成千上万条笔记。
AgenticVM 是一个全新的智能系统,旨在充当这些安全专家的“幕僚长”。它并非依赖一个试图包揽一切的巨大大脑,而是利用一组专门化的数字助手(代理)协同工作,将混乱梳理成一份可管理的待办事项清单。
以下是论文如何用简单的类比来解释该系统:
1. 专门化助手团队(代理)
AgenticVM 并非让一个机器人试图成为万事通,而是将工作分解为具体角色,就像一个运营良好的厨房或医院分诊室:
- 侦探(检测代理): 这位助手查看来自安全扫描器的原始、杂乱的笔记。有些笔记是完美的计算机代码(易于阅读),而另一些则是潦草的手写体(非结构化日志)。该代理对整洁的笔记使用严格规则,并借助一个智能语言模型(如同一位学识渊博的图书管理员)来解读杂乱的笔记,将它们全部转换为标准格式。
- 守门人(评估代理): 这位代理检查这些“问题”是否真的对你的特定仓库构成威胁。它会问:“我们库存中真的有这个物品吗?”如果扫描器说某个特定部件损坏,但你根本不使用该部件,这位代理就会将其标记为误报并丢弃。这节省了大量时间。
- 预报员(预测代理): 有时,安全报告尚未包含“危险评分”(称为 CVSS 评分)。这位代理使用一个基于 BERT(一种语言大脑)的智能 AI 模型来阅读问题描述,并预测危险评分,准确率约为89%。这就像气象预报员在官方雷达确认之前就预测风暴一样。
- 组织者(集成代理): 这位助手将所有经过清理、验证和评分的信息整理成一份整洁、标准化的文件。在传递之前,它会确保没有数据缺失。
- 优先排序者(优先级代理): 这位代理查看危险评分和“必须修复”清单(如 CISA 已知被利用漏洞清单)。它对清单进行排序,将最危险、最紧急的火情排在顶部,将次要问题排在底部。
- 顾问(推荐代理): 最后,这位代理为人类专家撰写一份简单的“如何修复”指南。它从可信来源提取信息以建议补丁,但不会自动修复。它只是向人类提供一份清晰的说明书。
2. 结果:从混乱到清晰
该论文在现实世界的软件项目(如在线商店和票务系统)上测试了该系统。结果令人瞩目:
- “噪音”减少: 在一次测试中,系统最初有3,983条原始警报。经过代理团队的工作后,人类专家只需查看82项高优先级项目。这意味着噪音减少了 98%。
- 准确性: “预报员”代理能够以**89.3%**的准确率预测缺失的危险评分,这意味着人类无需等待数天获取官方评分,即可开始处理最关键的问题。
- 效率: 与仅由人类阅读清单或由单一 AI 独自尝试完成所有工作相比,这种团队方法在过滤垃圾信息并保留重要内容方面表现更佳。
3. 为何这很重要(“人在回路”)
论文强调,该系统并非试图取代人类安全专家,而是一个放大器。
将其想象为一个高科技助手,负责处理枯燥、重复的排序和数据录入工作。它确保当人类专家坐下来工作时,他们看到的是一份简短、经过验证的真实问题清单,并附有建议的修复方案,而不是一座令人困惑的数据大山。该系统的设计初衷是让人类仍然对危险操作做出最终决定,从而确保安全性和问责制。
总结
简而言之,AgenticVM 是一个智能的多步骤工作流,它将海量的混乱安全警报进行过滤,剔除虚假警报,为缺失的警报预测危险等级,并将一份简短、清晰的优先修复清单交给人类团队。它将令人望而生畏的文件大山转化为可管理的待办事项清单,使安全团队能够更高效、更智能地工作,而不会导致职业倦怠。
技术摘要:AgenticVM——用于自适应软件漏洞管理的代理式人工智能
1. 问题陈述
现代软件漏洞管理正日益受到当代系统规模和复杂性的压力。安全运营中心(SOC)面临一个关键瓶颈:漏洞发现的速度持续超过修复工作。这主要由以下因素驱动:
- 警报数量庞大: 扫描器生成海量原始发现结果,往往导致积压持续存在。
- 工具链碎片化: 互不连通的工具和手动分类流程造成了低效。
- 上下文信息不完整: 分析师往往因缺失或延迟的官方严重性评分(CVSS)以及不完整的漏洞描述,而不得不在不确定性下进行优先级排序。
- 当前方法的局限性: 传统的基于规则的系统在面对不断演变的攻击者行为时显得脆弱,而经典的机器学习方法需要大量的特征工程和重新训练。现有的大语言模型(LLM)应用通常针对孤立的子任务进行优化,而非实现完整的运营集成,缺乏现实世界部署所需的治理和可观测性。
2. 方法论
本文介绍了AgenticVM,这是一个模块化的多代理框架,旨在自动化整个漏洞管理生命周期。该方法论分为五个阶段:文献综述、数据获取、系统架构设计、实施和评估。
A. 系统架构
AgenticVM 采用多代理编排层(使用LangGraph),协调专用代理,每个代理使用适当的技术(基于规则、学习的机器学习或 LLM 驱动)处理不同的任务:
- 检测代理 [混合式]: 摄入异构数据源(例如 Trivy、Snyk、Grype)。它使用确定性基于规则的解析器处理标准扫描器输出,并使用基于 LLM 的解析器处理非结构化日志,以确保高召回率。
- 评估代理 [基于规则]: 充当逻辑验证网关,通过将识别出的漏洞与项目上下文和本地资产元数据进行交叉引用,以减少误报。它优先考虑透明度和可重复性,而非生成式灵活性。
- 预测代理 [学习型机器学习]: 利用基于 BERT 的 Transformer 模型,从漏洞描述中推断缺失的 CVSS v3.1 指标(攻击向量、复杂性、所需权限、用户交互、范围和影响指标)。它包含一个置信度门控策略,低置信度的预测会被标记以供人工审查。
- 集成代理 [基于规则]: 整合来自先前代理的输出,执行严格的模式验证(通过 Pydantic 风格的记录),以确保数据的一致性和完整性。
- 优先级排序代理 [基于规则]: 应用确定性的基于 CVSS 的分层(例如,阈值设为 7.0),以过滤并将漏洞映射到优先级区间。它将 CISA 已知被利用漏洞(KEV)等信号作为增强信息纳入,而非不透明的乘数。
- 推荐代理 [LLM 驱动]: 使用检索增强生成策略综合修复建议,结合漏洞上下文与权威来源(NVD、CISA KEV)。它支持分析师的决策,但破坏性操作需要人工批准。
B. 数据与评估
- 数据集: 该框架使用来自国家漏洞数据库(NVD)、欧盟漏洞数据库(EUVD)和 CISA KEV 目录的 169,883 条唯一 CVE 记录进行了训练和评估。
- 场景: 实验在真实世界的开源应用程序(Online Boutique、Train Ticket、Beer Shop)上使用原始扫描器输出进行。
- 指标: 评估包括预测模型的标准分类指标(准确率、精确率、召回率、F1 分数)以及代理工作流的运营指标:任务完成时间(TCT)、成本效率率(CER)、Token 消耗率(TCR)和协作性能(Cperf)。
3. 主要贡献
本文做出了三项主要贡献:
- AgenticVM 框架: 一个模块化多代理系统,将 LLM 与传统安全工具集成,自动化从检测到修复建议的完整生命周期。
- 混合管道: 一种新颖的组合,包括基于规则的处理、基于 BERT 的 CVSS 预测模块以及专用 LLM 代理。这种方法能够在不损害风险覆盖范围的情况下,实现可靠的严重性估计和警报噪声减少。
- 实证验证与工程见解: 该研究证明了在警报减少和优先级排序效率方面的显著改进。它还提炼了关于代理分解、工具与 LLM 集成边界、故障隔离以及人在回路治理的实用设计见解。
4. 实验结果
- CVSS 预测性能: BERT-small 模型在八个 CVSS 基础指标上实现了89.3% 的总体准确率。它在预测攻击向量、攻击复杂性、用户交互和范围方面表现出特别强劲的性能。
- 警报减少: AgenticVM 成功将原始扫描器输出压缩为紧凑、可操作的队列。
- 在Train Ticket场景中,原始发现结果从3,983 条减少到 82 条高优先级项目(减少了 97.9%)。
- 在Online Boutique场景中,32 条发现结果减少到 6 条优先级项目(减少了 81.3%)。
- 基线比较: 与人工工作流(0% 减少)和单代理 LLM 工作流(适度减少,例如 Train Ticket 中为 28.5%)相比,AgenticVM 展示了更优越的噪声减少和溯源控制能力。
- 消融研究: 移除预测代理会导致对缺失 CVSS 数据的漏洞优先级排序不足。移除评估代理会增加误报。移除优先级排序代理会增加下游工作量和执行时间。
- 稳定性: 重复运行显示出稳健的稳定性,仅有 LLM 概率工作流典型的微小波动。
5. 意义与主张
本文将 AgenticVM 定位为一种分析师增强框架,而非完全自主的修复引擎。其意义在于:
- 运营可行性: 它证明了代理式人工智能可以部署在现实世界的安全运营中,在保持可靠性能的同时减少人工工作量。
- 风险可见性: 该系统在减少警报疲劳的同时不损害风险可见性,使团队能够专注于高优先级项目。
- 治理与信任: 通过将任务分解为专用代理,该框架提高了故障隔离、可观测性和可审计性。它明确纳入了人在回路的治理,确保破坏性操作需要人工批准。
- 设计见解: 这项工作提供了关于如何平衡确定性逻辑(用于验证和优先级排序)与 LLM 能力(用于解析和推荐)的实用指导,以减轻幻觉风险并确保可重复性。
作者总结道,虽然该系统显著提高了优先级排序效率,但未来的工作需要将建议与沙箱测试、回归检查以及更稳健的以人为中心的信任校准评估联系起来。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。