Reliable AUC Evaluation for Positive-Unlabeled Classifiers: Calibrated Confidence Intervals under an Unknown Class Prior
本文提出了一种通过从可观测指标中精确恢复目标 AUC 并传播估计的正样本比例不确定性,从而推导出正向无标签学习中真实曲线下面积(AUC)的校准双侧置信区间的计算方法,旨在解决当前性能评估中存在的偏差和可靠性不足的问题。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在机器学习领域,计算机通常通过向它们展示目标的示例以及非目标的示例来学习识别模式。想象一位医生试图教算法识别一种特定类型的肿瘤。计算机需要看到清晰的肿瘤图像和清晰的健康组织图像,才能学会区分两者。但在许多现实世界的情况下,获取这些清晰的“健康”示例是非常困难的。通常,研究人员只有一份确定的阳性病例清单,以及一大堆杂乱无章、未标记的数据,其中混合了阳性病例和阴性病例,且无法将它们区分开来。这被称为正向-未标记学习(positive-unlabeled learning)。其目标是构建一个系统,即使坏病例隐藏在人群之中,该系统仍能将好的病例排在前面。衡量系统表现的标准方法是计算一个代表其区分两组之间能力的得分。然而,当阴性组被隐藏并混合在一起时,标准得分就会产生误导。它衡量的是系统相对于这个杂乱堆集的排名能力,而非相对于真实阴性病例的排名能力,并且它通常将这个数字作为一个单一、精确的点呈现出来,而没有说明由于偶然性导致该数字可能存在多大的误差。
研究人员文森特·卢顿(Vincent Looten)通过开发一种能够解释隐藏混合情况并提供可靠置信范围的新型性能衡量方法,解决了这一问题。这项工作的核心是一个数学修正项,它通过剥离未标记数据的污染,从而揭示出针对阴性病例的真实性能。研究人员发现,你不能仅仅观察这个杂乱的堆集并猜测答案;你必须首先估计该堆集中实际包含多少你正在寻找的阳性病例。一旦有了这个估计值,你就可以使用特定的公式来调整性能得分。但研究人员进一步意识到,仅仅调整数字是不够的。因为对混合比例的估计本身具有不确定性,这种不确定性必须贯穿整个计算过程。研究表明,如果你忽略这种不确定性,你的最终得分将会是错误的。通过仔细追踪混合比例估计中的不确定性如何影响最终得分,研究人员推导出了一个生成校准区间的方法。这个区间就像一个安全网,告诉用户真实性能几乎肯定存在的范围,而不是仅仅给出一个单一的、可能具有误导性的数字。
研究显示,当正向和负向病例足够清晰、可以被区分开时,这种方法运作得非常出色。在这些清晰的情况下,新方法产生的双侧区间能像标准统计规则所预期的那样,几乎精确地捕捉到真实性能。然而,研究人员也发现了一种方法的硬性限制。当正向和负向病例如此相似以至于模糊在一起时,混合比例变得无法被确定地锁定。在这种特定场景下,双侧区间会失效,因为数学上无法支持它。相反,该方法会切换到单侧界限。这个界限提供了一个保证的性能最低底线,承认虽然精确的分数是未知的,但系统至少达到了这个水平。这种切换并非方法的失败,而是其特性之一,确保了即使在数据过于模糊无法支持精确估计时,报告依然保持诚实。
为了测试这些想法,研究人员将该方法应用于现实世界的数据,具体使用了乳腺癌的医疗记录,其中真实的标签已知,但在模拟该问题时被视为隐藏状态。结果非常显著。一种忽略隐藏混合情况并报告单一数字的传统方法完全失败了,从未能在测试中捕捉到真实性能。另一种尝试修正数字但使用简单混合比例估计的方法也表现挣扎,尤其是在数据不遵循完美的钟形曲线分布时。只有这种结合了修正项、稳健的混合比例估计以及对不确定性进行仔细计算的新方法取得了成功。它一致地产生了包含真实性能的区间,前提是正向和负向病例不是过于相似。研究证实,获得可靠答案的关键不仅在于算法执行排序的能力,还在于用于描述隐藏混合情况的估计质量。如果该估计存在偏差或不准确,那么无论排序系统多么先进,最终的性能得分都会是错误的。
这项工作还阐明了研究人员何时应该信任双侧区间,以及何时应该接受单侧底线。转换点取决于两组之间的区分程度相对于可用数据量的关系。如果两组分得很开,则完整的区间是有效的。如果两组非常接近,该方法会正确识别出精确的双侧区间是不可能的,并提供更安全的单侧保证。这种区分对于需要知道不仅系统运行得如何,还需要知道对该数字有多大把握的从业者来说至关重要。研究人员将整个过程封装进一个工具中,该工具可以包裹在任何现有的评分系统之上,允许用户输入数据并获得去污染后的得分以及置信区间或安全底线。该工具不需要数据遵循特定的数学形状,因此适用于那些无法用简单模型描述的杂乱现实世界数据集。
最终,这项研究将焦点从单纯构建更好的分类器,转向了如何在数据不完整时正确衡量它们。它证明了在缺乏清晰阴性示例的情况下,最关键的信息是对隐藏在未标记堆集中的阳性病例数量的估计。研究证明,通过适当的数学调整,是有可能恢复真实的性能度量并为其附加可靠误差范围的。然而,它也设定了一个明确的边界:当信号微弱到无法分离两组时,该方法拒绝猜测,而是提供一个保守的下限。这种对已知信息极限的诚实,或许是其中最有价值的发现,它确保了基于这些得分所做的决策是建立在对潜在不确定性的清晰理解之上的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。