Trustworthy Few-Shot Transfer Learning withExplainable AI for PCOS Ultrasound Classification
本文提出了一种基于 ResNet50 和 Grad-CAM 的可信少样本迁移学习框架,该框架能够有效地对超声图像中的多囊卵巢综合征(PCOS)进行分类,即使在数据极度匮乏的情况下也能实现高准确率和可靠的解释。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代诊所那安静且灯光昏暗的房间里,医生将探头按在患者的皮肤上,注视着一个黑白颗粒感的屏幕逐渐变得鲜活起来。这就是超声波,它是人体的一扇窗户,展示了内部器官的形状与纹理。对于育龄女性而言,医生最常寻找的病症之一是多囊卵巢综合征(PCOS),这是一种可能影响生育能力和整体健康的激素失调疾病。为了诊断这种疾病,专家必须计数并测量卵巢上微小的、充满液体的囊泡(即卵泡)的大小。这项任务非常困难,它高度依赖于医生的经验、机器的质量,甚至是探头的角度。两位专家在观察同一张图像时可能会产生分歧,从而导致治疗方案的不确定性。
多年来,科学家们一直试图构建能够像人类专家一样解读这些图像的计算机程序。这些被称为人工智能的程序,通常通过向它们展示成千上万个带有标签的示例进行训练,直到它们学会识别模式。然而,在现实世界的医学领域,收集成千上万张完美的、带有标签的图像往往是不可能的。医院可能只有几十个病例,或者数据可能分散在不同的诊所中。这造成了一个主要的障碍:当计算机可供学习的内容非常有限时,它该如何学习诊断一种疾病?此外,即使计算机做出了正确的判断,医生也需要知道原因。他们需要看到计算机正在观察图像的哪个部分,以确保它不是仅仅基于随机的噪点进行猜测。这种对清晰度的需求,正是这项探索如何构建可靠的医疗人工智能研究的核心,该研究探讨了在数据匮乏的情况下该如何应对。
来自孟加拉国达福迪尔国际大学(Daffodil International University)的一个研究小组致力于解决这个双重问题。他们想知道,计算机是否可以仅通过极少数的示例,就能学会从超声图像中识别多囊卵索综合征,以及在这些困难条件下,它给出决策的理由是否依然可靠。为此,他们使用了一个包含 11,784 张超声图像的海量集合,并将其分为两组:显示该综合征的图像和未显示的图像。他们并没有一次性在整个集合上训练模型,而是模拟了一种场景,即计算机必须从极小的图像组中进行学习。他们测试了每种情况仅有五个示例的情况,然后逐渐增加到十个、二十个、五十个,最后才是完整的数据集。
研究人员比较了两种不同类型的计算机架构,这些架构可以被视为处理视觉信息的底层引擎。其中一个引擎设计得极其高效,但被保持在基本“冻结”的状态,这意味着它在学习过程中无法大幅改变其内部结构。另一个引擎则允许调整其最终层,使其在适应医学图像的具体细节方面具有更大的灵活性。结果显示,在低数据环境下,有一个明显的胜出者。那个能够调整其深层结构的灵活引擎,表现始终优于僵硬的引擎。在仅有五个示例进行学习时,灵活系统的正确识别率约为 79%,而僵硬系统仅为 76% 左右。随着训练数据的增加,两个系统都有所提升,但灵活的系统始终保持领先地位,尤其是在示例数量较少时。在最低数据水平下,僵硬系统的性能达到了 75.5% 的准确率和 0.844 的 AUC,尽管与灵活系统相比,它在准确度和区分两类图像的平衡能力上略显逊色。
或许最令人惊讶的发现涉及计算机决策背后的“为什么”。研究人员使用了一种技术,可以高亮显示影响计算机选择的特定图像区域,从而创建一个在相关部分发光的热图。他们想看看当计算机在极少图像上进行训练时,这些热图是否会变得模糊或不可靠。他们使用了几项严格的测试来衡量这些解释的可信度,包括检查当移除高亮区域时计算机的信心是否下降,以及当图像被轻微改变时热图的稳定性如何。研究结果令人放心。虽然具体的指标因模型和数据量而异,但解释的整体质量并未随着训练数据的减少而出现统计学上的退化。即使在仅用五个示例进行训练时,它产生的热图在忠实度(fidelity)方面仍保持了统计学上的可靠,这表明无论它见过的资料多么匮乏,计算机都在真实地观察着对医生而言至关重要的卵泡和卵巢结构,即便其视觉激活模式看起来比全数据场景下更为弥散。
这种稳定性在研究人员测试系统针对噪声的鲁棒性时依然成立,他们模拟了现实诊所中因设备差异而产生的变化。灵活系统保持稳定,而僵硬系统则显示出敏感性,其解释在图像质量发生变化时更容易发生偏移。这项研究表明,对于在资源受限(即无法获得大规模数据集)的环境下真正有用的医疗人工智能而言,关键不仅在于拥有强大的模型,还在于选择一个能够针对特定任务调整其深层结构的模型。该研究证实,即使在训练数据极其有限的情况下,构建既准确又具备可解释性的系统是完全可能的。这为在那些每一张患者图像都至关重要的地区部署值得信赖的诊断工具提供了路径,确保计算机的推理过程对于依赖它的医生来说始终清晰且可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。