每天,软件开发人员和安全团队都面临着关于计算机系统缺陷的新警告的洪流。这些被称为“漏洞”的缺陷被赋予了唯一的名称和描述进行编目,形成了一个每小时都在增长的庞大列表。挑战不在于寻找这些缺陷,而在于决定先修复哪些。安全团队的时间和资源有限;他们无法立即调查每一个警告。如果等待时间过长,漏洞可能会被攻击者利用,从而窃取数据或中断服务。为了解决这个问题,专家们创建了评分系统,为每个缺陷分配一个严重程度数字,就像天气预报为风暴分配风险等级一样。然而,这些分数通常依赖于静态的技术细节,并不总能反映出某些漏洞目前正处于被积极攻击的状态,而另一些尽管得分很高却依然安全的现实。安全团队面临的问题既简单又困难:仅根据目前可获得的信息,哪些特定的缺陷应该立即进行检查以防止入侵?
西蒙弗雷泽大学的一个研究小组开发了一种解决此问题的新方法,称为 ThreatLens。ThreatLens 并不试图预测未来或依赖单一评分,而是作为一个过滤器,仅利用在做出决策时刻已存在的证据,对每日涌入的漏洞警告进行筛选。该系统查看广泛的公开信息,包括漏洞的官方描述、现有的严重程度评分、是否有黑客已经发现利用该漏洞的方法的报告,以及安全公告出现的频率。通过将这些信息组织成每周快照,该系统能够学习对那些最有可能成为紧急问题的漏洞进行排序。它通过研究过去的案例来学习,在这些案例中,缺陷最终被列入了政府的一份专门的已知被利用漏洞名单,利用这些过去的事件来教导系统识别早期的预警信号。
研究人员通过模拟安全团队面临的现实世界条件来测试他们的系统。他们构建了一个逐周推进的时间线,确保系统永远不会看到来自未来的信息。在每一步中,系统必须根据截至该特定周为止可用的数据,从数百个候选池中选出前二十个或前五十个缺陷。结果显示,该系统在官方权威机构正式标记之前,能够非常有效地发现最具危险性的缺陷。当研究人员要求系统每周仅审查前二十个缺陷时,它成功识别了随后被证实为正被积极利用的漏洞中的百分之八十。这一表现比目前依赖单一利用概率评分的标准方法高出三倍多。即使在系统被要求查看前五十个缺陷时,它也找到了近百分之九十六的关键缺陷。
这项发现之所以意义重大,不仅在于该系统有效,还在于其运作方式。研究人员发现,最有效的系统版本并不依赖于通常作为“黑箱”运行的复杂深度学习神经网络。相反,最好的结果来自于一种更简单、更透明的方法,该方法结合了具体的、可衡量的事实:缺陷已知了多久、是否存在公开的利用程序、有多少安全公告提到了它,以及它的严重程度评分。这表明,更好的优先级排序的关键不一定是更复杂的人工智能,而是通过一种严谨的方式来组织和权衡在决策时实际可用的证据。该系统还证明了其提供预警的能力,能够在许多危险缺陷被正式列入政府的被利用漏洞名单之前识别出它们。在一个具体案例中,该系统在某个网络视频录像机(NVR)的缺陷被正式认定为高优先级前四十二天就对其进行了标记,而其他标准方法未能将其排名足够高以引起安全团队的注意。
该研究还明确了该系统的性质及其局限性。它不是一个取代人类判断或保证能抓住每一个缺陷的工具。该系统依赖于公开信息,并使用一份特定的已知被利用漏洞名单作为指南,这意味着它可能会错过那些正在秘密进行或由不公开活动的群体所利用的漏洞。此外,该系统是基于全球风险而非针对单一公司独特网络的特定风险进行排序。然而,研究表明,通过严格遵守信息可获得性的时间线,安全团队可以显著提高他们专注于最重要威胁的能力。这项工作表明,漏洞管理的未来在于将优先级排序视为一个持续的、具有时间敏感性的证据整理过程,而不是一个静态的严重程度计算。通过这样做,团队可以将注意力从应对已发生的灾难转向通过利用最早、最可靠的信号来预防灾难。
技术摘要:ThreatLens —— 基于证据引导的高优先级 CVE 排序
问题陈述
现代漏洞管理面临着一个关键的可扩展性挑战:常见漏洞与披露(CVE)的持续发布速度远超安全团队调查、验证和修复的能力。现有的优先级排序信号,如常见漏洞评分系统(CVSS)、漏洞利用预测评分系统(EPSS)以及公开的利用可用性,往往是碎片化的、具有时效性的,或者仅凭自身无法提供充分的信息。
先前研究中的一个显著方法论缺陷是时间泄露(Temporal Leakage)。许多研究使用在决策时刻尚未可用的证据(例如,使用未来的利用数据来对过去的漏洞进行排名)来评估优先级模型。这种“完美标签假设”导致了回顾性的排名,从而夸大了模型的性能。本文解决的核心问题是如何在现实的时间约束下,仅使用特定决策点可用的证据,来确定哪些 CVE 将在正式进入目录前变得具有操作紧迫性(即进入 CISA 已知利用漏洞(KEV)目录)。
方法论:ThreatLens 框架
ThreatLens 是一个部署现实的框架,旨在每周分析师审查队列中对 CVE 进行排名。它将漏洞优先级排序视为一个时间感知的排名问题,而非静态的二元分类任务。
1. 数据构建与时间对齐
该框架构建了 CVE-时间快照(CVE-time snapshots),代表在特定每周截止日期观察到的特定 CVE。
- 证据来源: 系统集成了异构的公开数据,包括 NVD 描述、CVSS 元数据、EPSS 分数、GitHub 安全公告(GHSA)活动,以及来自 Exploit-DB 和 Metasploit 的公开利用信号。
- 截止有效性: 所有证据都严格对齐于每周的截止日期。例如,EPSS 分数使用在或之前于截止日期的值;公告计数通过发布/修改时间进行过滤;利用指标通过发布日期进行过滤。
- 泄露缓解: 为了防止时间泄露,系统清除可变元数据(例如,最后修改日期、原始 URL、标签)并排除精确日期。时间上下文通过相对特征(例如,CVE 年龄、距离首次利用的天数)而非绝对时间戳进行编码。
- 标签化: 系统使用未来进入 CISA KEV 目录作为弱监督信号。如果一个 CVE 在截止日期后的 30 天窗口期内进入 KEV,则该快照被标记为正样本;否则为负样本。这反映了操作上的紧迫性,而非仅仅是利用的存在。
2. 模型表示
ThreatLens 评估了两种不同形式的截止有效证据:
- 证据文本: 漏洞上下文、严重性摘要、EPSS 值、公告证据和相对时间信息的序列化表示。
- 结构化特征: 编码了 EPSS 分数/百分位数、CVSS 基础分数、公告计数、利用可用性、CVE 年龄以及交互特征(例如,结合了利用证据的 EPSS)的表格化表示。
3. 评分模型
该框架在相同数据上训练并比较了三类排序器:
- 神经文本排序器 (TL-NR): 使用 BGE-large-en-v1.5 编码器配合 MLP 评分头,采用成对监督进行训练(将来自同一截止日期的正向快照排在负向快照之上)。
- 结构化逻辑回归排序器 (TL-LR): 在结构化表格特征上训练的类别加权逻辑回归模型。
- 浅层文本排序器 (TL-TF-IDF): 在证据文本上训练的基于 TF-IDF 的逻辑回归模型。
4. 评估协议
评估设计旨在模拟实际部署:
- 前向时间切分(Forward-in-Time Split): 数据按时间顺序进行切分。训练集、验证集和测试集在时间上是分离的。
- CVE 不相交性(CVE-Disjointness): 出现在训练集中的 CVE 会从验证集和测试集中排除,以防止身份泄露。
- 指标: 性能通过每周候选池内的 Recall@K(特别是在 K=20 和 K=50 时)进行衡量,这反映了安全分析师有限的预算。同时报告全局和宏观 PR-AUC,以应对类别不平衡问题。
核心贡献
- 问题形式化: 作者将 CVE 优先级排序形式化为一个周期性的、时间感知的每周分析师审查队列中的排名问题,超越了静态的严重性评分。
- 数据构建: 他们引入了一种构建截止对齐的 CVE 快照的方法,这些快照捕捉了不断演变的公开证据,同时严格减轻了时间泄露。
- 框架开发: 提出了 ThreatLens,这是一个证据引导的框架,它整合了多种来源(NVD、EPSS、GHSA、Exploit-DB),并支持多种排名架构(神经、结构化和浅层文本)。
- 严谨评估: 论文通过大规模、前向时间、CVE 不相交的评估,证明了学习到的排序器在识别未来 KEV 条目方面显著优于标准基准模型。
结果
在包含 11,779 个快照(正样本率为 2.50%)的留出测试集上进行评估,ThreatLens 展示了相对于非学习型基准模型的实质性提升:
- Top-K 优先级: 结构化逻辑回归排序器 (TL-LR) 实现了 80.0% 的 Recall@20 和 95.9% 的 Recall@50。这比 EPSS 基准(24.7% Recall@20)的性能高出三倍以上,并且显著优于 CVSS 和基于规则的融合方法。
- 模型效率: 与复杂神经模型占据主导地位的预期相反,轻量级且具有可解释性的 TL-LR(基于结构化特征的逻辑回归)是表现最强的综合评分器。这表明其价值在于高质量的截止对齐证据表示,而非模型复杂度。
- 预警能力: ThreatLens 可以在 CVE 正式进入 KEV 目录之前发现未来的 KEV CVE。在严格的前向时间设置下,TL-LR 在这些 CVE 进入 KEV 目录之前,就在前 50 名中识别出了 97.8% 的留出 KEV CVE,中位预警时间为 25 天。
- 消融实验: 从模型中移除 EPSS 或 CVSS 等主导信号会降低性能,但并未消除其相对于基准模型的优势。这证实了 ThreatLens 受益于多种证据来源的集成,而非依赖单一的快捷信号。
意义与主张
论文声称,ThreatLens 证明了漏洞优先级排序应该被视为一个操作性的预警问题,而非静态的严重性排名任务。
- 部署现实性: 其主要贡献不在于一种新型的神经架构,而在于一种符合部署现实性的形式化方法,该方法强制执行了时间纪律。通过确保模型仅在决策时的可用证据上进行训练和评估,本文为未来的利用预测系统建立了更高的标准。
- 互补信号: 结果表明,虽然 EPSS 和 CVSS 非常有用,但仅靠它们是不够的。将结构化信号(如 EPSS 变化和利用可用性)与文本上下文(公告语言和漏洞描述)相结合,可以提供稳健的优先级排序信号。
- 分诊压缩(Triage Compression): ThreatLens 的定位不是一个自主的修复预言机,而是一个分诊压缩层。它将庞大的每周 CVE 池缩小为更小的、有证据支撑的审查队列,使分析师能够将有限的资源集中在那些显示出新兴操作风险、且尚未被广泛识别为紧急情况的漏洞上。
- 局限性: 作者坦诚地指出,KEV 是一个弱代理指标(反映了编目决策和报告实践,而非仅仅是利用本身),且该系统估计的是全局相关性而非组织特定的风险。未来的部署需要将 ThreatLens 与本地资产暴露度和补丁状态相结合。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。