How Reliable Are NVD CWE Labels? A Large-Scale Semantic Audit with Seclometry
本文通过使用经过验证的 CWEAgent 工具进行大规模语义审计,揭示了国家漏洞数据库(NVD)中近半数的 CWE 标签与基于代码的漏洞语义并不完全匹配,识别出了结构性错误模式,并证明了标签可靠性随分配机构和缺陷类型的不同而显著变化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,每一个可能被恶意攻击者利用的软件缺陷,都应该被记录在一个名为国家漏洞数据库(National Vulnerability Database)的海量公共图书馆中。可以将这个数据库想象成世界上软件问题的中央档案系统。当发现一个缺陷时,它会被赋予一个唯一的 ID 和一个描述导致该错误之种类的标签。这个标签至关重要,因为它就像是安全团队、研究人员和自动化工具的分类标签。如果一个标签说问题是“锁坏了”,安全团队就知道要检查身份验证是否薄弱;如果它说“水桶溢出了”,他们就会寻找内存错误。多年来,所有人都假设这些标签是准确且可靠的,将其视为构建更好安全系统以及衡量新工具效能的绝对真理。
然而,仅仅因为存在一个标签并不意味着它是正确的。挑战在于,最初编写报告的人通常描述的是发生了什么——即症状,比如数据被窃取——而不是根本原因,例如允许窃取的特定编码错误。一份报告可能会说“攻击者窃取了数据”,从而导致一个通用的标签,而实际的代码可能揭示了一个非常具体的机制,例如重复使用的加密密钥。如果标签错了,它会误导所有依赖它的人,导致工具错过真正的危险或在虚假警报上浪费时间。直到现在,还没有人系统性地在大规模范围内检查这数百万个标签的准确性,这主要是因为这样做需要阅读实际的代码和补丁以理解错误的真实本质,这项任务对于简单的自动化检查来说过于复杂。
一组研究人员致力于通过构建一种新型审计工具来解决这个问题。他们创建了一个系统,该系统不仅阅读漏洞报告的文本,而是检查修复该问题的实际代码变更。该系统将漏洞本身和官方标签都转化为一种关于底层机制的结构化描述:什么触发了错误、违反了哪项安全规则以及代码是如何失效的。通过将官方标签与这种基于代码的描述进行对比,系统可以确定标签是完全正确的、是一个虽然可辩护但更宽泛的描述,还是仅仅是错误的。研究人员在一百个已知的漏洞上测试了这个工具,以确保其工作正确,并达到了很高的准确度。随后,他们将该工具应用于 2017 年至 2026 年间发现的超过一万五千个开源漏洞的大规模集合中。
结果揭示了一个比简单的“对或错”列表更为微妙的景象。研究发现,近一半的官方标签与代码证据完美匹配。还有很大一部分虽然在技术上不算错,但不精确,提供了一个虽然可以辩护但比证据本身更宽泛的类别。然而,有一小部分但却至关重要的标签——约 3.6%——与证据直接不一致,这意味着标签所描述的弱点类型与代码中实际存在的类型不同。研究人员发现,标签的可靠性很大程度上取决于谁分配了它。有些机构始终如一地提供精确、准确的标签,而有些机构则经常使用宽泛或错误的标签。令人惊讶的是,漏洞的严重程度并不能预测标签的准确性;最危险的缺陷与较轻微的缺陷一样,都有可能被错误标记。
随着时间的推移,这些标签的质量发生了变化。虽然完美匹配的比例保持相对稳定,但近年来与代码证据相矛盾的标签数量有所增加,从研究初期约 1% 到 3% 的比例,上升到后期研究中的 3% 到 6%。研究人员识别出了六种常见的错误模式。最常见的错误是将缺陷的后果与原因混淆,例如将一个漏洞标记为“信息泄露”,而其根源实际上是特定的加密错误。其他频繁发生的错误涉及混淆相似类型的内存错误,或混淆不同类型的注入攻击。这些错误并非随机发生的;它们通常源于标签系统本身的结构,即分配宽泛类别比分配具体类别更容易,或者初始报告缺乏做出正确选择所需的详细技术信息。
研究还强调,这些错误并非孤立事件,而是元数据生态系统中的结构性问题。有时,原始报告添加了一个正确的标签,但随后由数据库管理员进行的更新引入了一个冲突的、错误的标签,并保留在记录中。在其他情况下,原始报告仅仅省略了必要的详细技术信息,迫使标记者进行猜测,从而导致一个虽然与报告一致但基于代码却是错误的标签。研究人员得出结论,虽然数据库是一个重要的资源,但用户不能将每个标签都视为绝对真理。相反,他们应该观察是谁分配了标签,并意识到很大一部分数据需要人工验证或对代码进行更深入的查看才能真正可靠。这项工作表明,虽然自动化工具可以帮助管理日益增长的漏洞积压,但对于一个缺陷究竟是什么的最终判断,必须始终基于代码本身的证据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。