Conflict inherits the frame: bin geometry and BPA construction in evidential fusion of quantised continuous evidence
本文表明,在量化连续数据的 Dempster-Shafer 证据融合中,分箱框架的几何结构会人为地使冲突度量与证据位置产生混淆,据此提出了一种用于纠正该偏差的过度冲突统计量,同时揭示了标准组合规则往往退化为贝叶斯乘积,且在预测软件漏洞利用方面功效差异微乎其微。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图通过询问三位不同的专家来决定一个软件漏洞有多危险。每位专家都会给出一个数字,但他们很少达成一致。有时,一位专家认为该漏洞只是个微小的麻烦,而另一位则称其为严重的威胁。为了理清这种分歧,研究人员经常使用一种旨在将不确定的意见结合成一个更清晰图景的数学系统。这个系统通过将一个连续的可能范围——比如从零到十的刻度——切分成不同的“桶”,如“低”、“中”、“高”和“严重”,来进行工作。其核心思想是,一旦这些数字被归类到这些桶中,系统就可以计算专家之间的分歧程度,并利用这种分歧来判断风险。几十年来,这种方法一直是医疗诊断、安全分析等领域的标准工具,被认为能够将混乱、冲突的数据转化为可靠的结论。
然而,一项新研究表明,这些“桶”的大小可能会在暗中扭曲结果。来自瓦拉希亚大学的 Elena Udrescu、Alexandru Udrescu、Ana-Maria Suduc 和 Mihai Bîzoi 研究人员利用现实世界中的软件漏洞数据调查了这一过程。他们查看了数千条记录,在这些记录中,不同的组织对相同的安全缺陷分配了严重性评分。他们的目标是观察使用标准的数学规则结合这些评分,是否真的有助于识别哪些漏洞正被黑客积极利用,或者这种方法是否仅仅是在制造一种洞察力的幻觉。他们的发现是,桶本身的形状承担了大部分工作,往往导致系统在专家实际达成一致的地方报告高分歧,而在专家实际存在分歧的地方报告低分歧。
研究人员首先检查了作为描述软件缺陷标准语言的通用漏洞评分系统(CVSS)的数据。该系统将评分分为四个区间:低、中、高和严重。问题在于,这些区间的宽度并不相等。“低”区间覆盖了一个很宽的数值范围,而“严重”区间则非常狭窄。当研究人员将数据输入到标准的结合系统中时,他们发现其中隐藏着逻辑缺陷。系统将桶的狭窄性视为冲突的标志。如果两位专家给出的评分落在狭窄桶的边缘附近,即使两人的评估实际上非常接近,系统也会计算出高水平的分歧。相反,如果评分落在宽阔桶的中间,即使两者的得分相差甚远,系统也会报告低分歧。桶的几何形状压倒了专家的实际意见。
为了证明这一点,该团队创建了一种新的衡量分歧的方法,剥离了桶大小的影响。他们将标准方法与这个修正后的版本进行了对比。结果令人震惊。标准方法显示,专家对最严重漏洞的分歧比对较轻微漏洞的分歧更大,这在表面上看起来似乎合乎逻辑。但修正后的方法显示了完全相反的情况:专家对中等程度的漏洞分歧更大,而在最严重的漏洞上反而更容易达成一致。原始方法之所以产生误导,是因为“严重”类别过于狭窄,以至于任何微小的分数差异都会将计算推向高冲突状态。通过消除这种几何偏差,研究人员表明,标准工具报告的是类别的形状,而非证据的真实状态。
研究还探讨了专家的评分是如何转换为系统输入的。一种常见的做法是取一个特定的分数,并将其完全归入它所属的单个桶中,忽略了该分数其实是连续线上的一个点。研究人员发现,这种“清晰”(crisp)的处理方式将整个分歧的概念简化为了一个简单的“是或否”的标记。如果专家落在同一个桶里,系统就看到零冲突;如果他们落在不同的桶里,系统就看到最大冲突。这种二元视角忽略了中间所有的细微差别。当研究人员使用一种“梯度”(graded)方法——即将分数分布到相邻的桶中以反映不确定性——时,系统重新获得了观察微妙差异的能力。然而,即便有了这种改进,除非应用新的修正方法,否则桶的底层几何形状仍然会扭曲结果。
当团队测试结合专家的观点是否真的有助于预测现实世界中正在被利用的漏洞时,结果令人清醒。他们分析了超过 13,000 对来自不同组织的评估,检查结合后的评分是否比仅仅信任单一的最佳专家更能识别出那 70 个已知的被利用漏洞。答案是否定的。无论他们如何结合评分,无论是使用标准规则还是新的修正方法,融合后的结果都没有优于单一的最佳来源。唯一稍好一点的方法是采用一个简单的技巧,即取两个评分中的较低值,但研究人员警告说,这可能只是数据收集过程中的一种人工痕迹,而非真正的洞察。事实上,研究发现标准结合规则在许多情况下在数学上等同于简单平均值,这意味着复杂的机制并没有增加任何实际价值。
研究的很大一部分还揭示了一个隐藏在眼前的统计问题。数据库中的许多“第二意见”实际上并不是来自最初报告漏洞的组织的独立评估。相反,它们是来自政府机构的自动化更新,这些更新通常只是复制了原始评分。当研究人员将这些数据过滤掉后,真正独立来源之间的分歧显著上升。这表明,之前的研究可能低估了专家之间的分歧程度,因为他们无意中是在将一个来源与其自身的副本进行比较。
研究人员总结道,用于融合不确定证据的工具对类别的设计要敏感得多,其程度超出了人们的预期。他们表明,标准的冲突度量往往是桶大小的镜像,而非人类分歧的反映。虽然在这一特定案例中,复杂的数学规则并未提高预测现实危险的能力,但这项研究为如何解读数据提供了至关重要的修正。通过针对桶的大小进行调整,分析师现在可以观察到来源之间真实的歧见水平。教训是,在寻求结合不确定信息的过程中,我们如何定义类别与信息本身同样重要。如果不关注桶的形状,我们可能会看到那些仅仅是测量工具所投射出的影子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。