Singular model selection for trustworthy label-free classifier evaluation
本文证明了无标签分类器评估是一个奇异统计问题,其中经典的模型选择准则会因退化的费舍尔信息量而失效,并提出使用奇异且广泛适用的贝叶斯信息准则,以在没有地面真值标签的情况下准确恢复潜在结构并确保性能估计的可信度。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,我们经常信任机器做出决策,但却很少知道如何去信任那些对这些决策进行评判的机器。当一个新的计算机程序被构建用于识别医学影像中的疾病或识别照片中的鸟类时,其性能通常是通过将其答案与一个已知的“金标准”(即由人类专家提供的正确答案集)进行比较来衡量的。但如果没有这样的完美答案时,该怎么办?这在医学等领域是一个普遍的现实,在这些领域中,诊断可能是不确定的;或者在大型数据项目中,人类专家太贵或太慢,无法为每一项都进行标注。在这种情况下,研究人员依赖一种巧妙的变通方法:他们要求几个不完美的评判者观察相同的项目并比较他们的意见一致性。如果一群医生或一群工人对某个诊断表现出高度一致,我们就假设他们很可能是正确的。然而,这种方法隐藏了一个危险的陷阱。用于决定数据中存在多少种不同类型答案的数学工具,其建立的假设在数据最难以解释时往往会失效。当信号微弱或病情罕见时,这些标准的工具可能会悄无声息地抹除真相的复杂性,将不同的答案组坍缩为一个具有误导性的平均值。
一位研究人员现在表明,这种坍缩不仅仅是计算上的微小误差,而是我们在计数方式上的一个根本性缺陷。他们研究了一种用于评估这些不完美评判者的特定统计模型,称为潜在类别模型(latent class model)。在这种设定下,“真实”类别是隐藏的,我们试图根据几个评判者嘈杂且有时存在冲突的投票来推测它。研究人员发现,这个问题的几何结构是“奇异的”(singular),这是一个技术性说法,意指可能答案的景观存在一个平坦的、退化的点,在那里标准的统计规则不再适用。在这个奇异区域,通常用于选择正确隐藏类别的方法会系统性地失败。它们倾向于选择过少的类别,将不同的数据组合并为一个。这不仅仅是计算机出了点小错;这是一种结构性的失败,模型判定两种不同的现实实际上是同一件事。
为了证明这一点,研究人员运行了数千次他们预先知道确切真相的计算机模拟。他们创建了一些场景,其中明显存在两种不同类型的项目,但来自评判者的信号很弱或项目非常罕见。当他们应用被称为贝叶斯信息准则(BIC)的广泛使用的标准方法时,该方法几乎总是无法识别出第二个组。相反,它报告说只有一个类型的项目,有效地抹除了这种区别。即使研究人员拥有大量数据,这种情况依然发生。标准方法由于过于渴望保持模型的简洁,完全忽略了第二个组存在的证据。相比之下,研究人员测试了两种专门为这些棘手的奇异情况设计的较新方法。这些新方法使用一种不同的衡量复杂性的方式,能够成功找到第二个组。它们不仅找到了该组,而且在真相简单时不会凭空创造虚假组,而后者是其他更宽松的方法所面临的问题。
这种计数错误带来的后果是严重的。在医学背景下,如果一个模型将两组不同的患者合并为一组,它就无法报告准确的灵敏度(sensitivity)或特异度(specificity)——即测试检测疾病与避免假警报的能力衡量指标。研究人员表明,当标准方法强制进行坍缩时,报告的测试准确性会退化为一个仅仅反映人口中疾病总体发生率的无意义数字。人们将无法判断一个测试是优秀的还是无用的。为了用真实数据证明这一点,研究人员重新分析了一个著名的皮肤癌切片数据集,该数据集由七名病理学家进行分级,且没有人拥有可以与之对比的金标准。当他们在较小的数据子集上使用标准方法时,该方法始终无法发现第三个独特的切片组,即医生感到困惑或产生分歧的部分。而那些新的、具备奇异意识(singular-aware)的方法立即找到了这个困惑组。这个第三组代表了一个真实的、困难的病例层级,而标准方法曾悄无声息地将其合并到了清晰的“是”与“否”类别中。
研究人员还在一个机器学习数据集中测试了这种方法,该数据集包含众包人员对鸟类图像进行的标注。在这里,标准方法坚持认为只有两种类型的图像,而新方法则揭示了存在第三个有争议的图像组,这些图像确实更难分类。通过使用这些新方法,研究人员可以隔离这些困难案例,并证明它们不仅仅是噪声,而是数据中真实且可识别的一部分。这项研究证实,选择如何计数这些隐藏组不仅是一个微小的技术细节,更是信任的前提。如果计数方法有缺陷,那么对机器学习系统的整个评估都是建立在一个坍缩的基础之上的。研究人员得出结论,对于任何缺乏完美参考标准的评估,我们必须停止使用旧的标准工具,转而采用这些新的、具备奇异意识的方法。只有这样,我们才能确保我们报告的性能数据是诚实的,并且我们不是在将复杂的现实误认为简单的现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。