H-XAI-Cervix: conditional hierarchical learning for cervical-cell classification on Herlev and SIPaKMeD
H-XAI-Cervix 研究表明,在区分 Herlev 数据集上的宫颈细胞类别时,条件分层 EfficientNet-B3 模型显著优于扁平分类器,尽管这种优势在 SIPaKMeD 数据集上并未观察到,因为其性能已接近接近天花板水平。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,都有数百万女性接受一种简单的筛查测试,以检查宫颈癌的早期迹象。技术人员从子宫颈采集细胞样本,用特殊的染料进行染色,然后将其置于显微镜下。随后,由人类专家观察这些细胞,寻找可能预示疾病的形状、大小和颜色方面的细微变化。这一过程被称为巴氏涂片(Pap smear),它是现代医学的基石,然而它过程缓慢、劳动强度大,且高度依赖于观察者通过镜头看东西时的技术水平。为了帮助提高速度并减少人为错误,科学家们多年来一直致力于教计算机识别这些细胞模式。其目标是构建一种人工智能,使其能够观察单个细胞并判断该细胞是健康的还是显示出异常迹象,从而作为病理学家的“第二双眼睛”。
挑战在于这些细胞是如何组织的。在现实世界中,医学标签不仅仅是一个无关选项的扁平列表;它们构成了一个自然的家族树。存在着宽泛的类别,例如“正常”或“异常”,而在这些宽泛的组别内,又存在着更具体、更细微的细节。一个将每个类别都视为平等、无关选项的计算机程序,往往会忽略其中的逻辑联系。它可能会正确地识别出一个细胞是异常的,但却无法识别出它属于某种特定的、程度较轻的异常类型,反之亦然。研究人员想要了解,如果教计算机去尊重这种家族结构——即理解一种特定类型的细胞必须首先属于一个更广泛的组别,然后才能被识别为该特定类型——是否会使其成为更好的诊断工具。
一位研究人员决定使用两个著名的细胞图像集来测试这个想法。他们构建了一个旨在模仿这种层级化思维的计算机模型。该模型不再是要求计算机同时从所有可能的细胞类型中做出选择,而是强迫它分步做出决策。首先,模型必须决定细胞是正常的还是异常的。只有在做出这个宽泛的选择后,它才能继续识别该组别内的特定细胞类型。这种方法被作者称为“条件层级结构”(conditional hierarchy),它被用来与一种标准的计算机模型进行对比,后者试图直接猜测特定的细胞类型,而不会先将其归入宽泛的类别。研究人员在两个数据集上进行了测试:一个包含917张细胞图像,另一个包含超过4,000张图像。
结果表明,教导计算机的方式确实很重要,但这种益处完全取决于任务的复杂程度。当研究人员在包含七个不同类别的较小数据集上测试该模型时,层级化方法表现得显著更好。理解了家族结构的模型比标准模型更频繁地正确识别出宽泛类别和特定细胞类型。在这次特定的测试中,层级化模型的准确率有了明显的提升,它正确分类了近93%的二元(正常对异常)案例,以及约74%的七种特定类型。而忽略了家族结构的标准模型,在这两个领域都表现欠佳。这表明,当任务涉及区分许多看起来相似且复杂的类别时,强迫计算机遵循逻辑路径有助于它避免混乱。
然而,当研究人员将同样的测试应用于更大的数据集时,故事发生了变化。这个集合包含了超过4,000张图像,但类别较少且更为清晰。在这种情况下,标准的计算机模型本身就已经处于极高的水平,几乎总能正确识别细胞。当研究人员向这个模型加入层级结构时,它并没有提升结果。遵循家族树的模型表现得与不遵循的模型一样好,但并没有变得更好。研究人员发现,当任务对于计算机来说已经很容易解决时,层级化方法保留了标准模型的高准确度,但并未增加任何额外价值。
研究还观察了计算机对其答案的信心程度。在规模较小、难度较大的数据集中,层级化模型在细胞类型之间的区分做得更好,但其置信度得分有时并不像标准模型那样与现实完美契合。在较大的数据集中,两个模型的校准都非常好,这意味着它们的置信水平与其实际准确度相匹配。研究人员强调,虽然层级化方法帮助计算机更逻辑化地思考较小且更复杂的细胞集,但它并不是一种能自动提升所有医疗AI系统的“万能灵药”。该方法的成功取决于数据的具体性质以及分类任务的难度。
最终,这项工作证明了计算机学习过程的结构与其学习的数据同样重要。通过强迫人工智能尊重不同类型细胞之间的自然关系,研究人员有时可以构建出更聪明、更准确的分类器,尤其是在处理微妙且复杂的医学区别时。然而,这种进步并非普遍存在的;如果计算机已经擅长某项任务,添加复杂的结构可能并无助益。作者提醒,这些结果是基于孤立的细胞图像得出的,目前尚未证明此类系统可以在真实患者身上诊断癌症。在将这项技术投入临床使用之前,必须在完整的组织样本以及真实的医疗环境中对其进行测试。目前,这项研究提供了一个明确的教训:在教机器像医生一样观察的过程中,我们组织它们思考的方式至关重要,但合适的方法完全取决于我们试图解决的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。