Exploring learning environments for label\-efficient cancer diagnosis
本研究表明,半监督学习是预测肾癌、肺癌和乳腺癌的一种极具可行性且具有成本效益的有监督学习替代方案,在多种预训练深度学习模型中,其在显著减少标注样本数量的同时,仍能达到相当的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
癌症仍然是现代医学面临的最严峻挑战之一,这种疾病夺走了无数生命,并给全球卫生系统带来了沉重负担。对抗癌症的关键一步是早期检测,即医生在显微镜下检查组织样本,以便在肿瘤扩散前发现它们。这一过程被称为组织病理学,依赖于高度专业的专家来区分健康组织与癌性生长。然而,这种手工工作既缓慢又令人疲惫;一名专家分析单张切片可能需要长达三十分钟,且对这类专业知识的需求往往超过了供应。为了加速医疗护理,科学家们转向了计算机,教导它们识别图像中的癌症模式。多年来,这些计算机系统需要大量的图像库,且这些图像必须经过人类专家的仔细标注,才能学习识别目标。收集这些经过标注的图像是一项困难、昂贵且耗时的任务,形成了一个限制这些工具开发和应用速度的瓶颈。
来自贾米亚米利亚伊斯兰大学(Jamia Millia Islamia University)和香港中文大学的研究人员的一项新研究探索了一种绕过这一瓶颈的方法。他们调查了计算机是否可以在不需要每张图像都由人类进行标注的情况下,有效地学习诊断癌症。该团队测试了三种不同的教学方法。第一种方法被称为监督学习,这是传统方法,计算机仅从经过完整标注的图像中学习。第二种方法是半监督学习,它允许计算机在利用少量标注图像的同时,通过观察大量的未标注图像来寻找模式。第三种方法是自监督学习,试图仅使用未标注的图像来教导计算机,要求它自行发现关于图像相似性的规则。研究人员希望观察这两种方法(第二和第三种)是否能达到传统全标注方法的性能水平,特别是针对乳腺癌、肺癌和肾癌这三种常见癌症。
为了测试这些想法,研究人员收集了三组不同的医学图像。一组包含近 8,000 张乳腺组织图像,另一组有超过 16,000 张肺组织图像,第三组则包括 7,000 多张肾脏组织图像。这些图像来自不同的来源且具有不同的格式,确保了结果的稳健性。随后,团队创建了七种不同的训练场景。在第一个场景中,他们仅使用完全标注的图像。在接下来的五个场景中,他们将标注图像与未标注图像混合使用,比例各异,从一半对一半到仅有 10% 的图像被标注不等。在最后一个场景中,他们仅使用未标注的图像。他们将这些不同的数据集输入到三个强大的、预先存在的用于识别图像模式的计算机模型中。随后,这些模型被要求将每张图像分类为良性(即无害)或恶性(即癌性)。
结果揭示了不同学习方法在效果上的清晰层级。正如预期,仅使用完全标注图像的传统方法产生了最准确的结果。然而,使用标注数据与未标注数据混合的半监督方法表现得非常接近。在许多情况下,仅使用极小比例标注数据进行训练的计算机模型,其表现几乎与使用全部标注数据的模型一样出色。例如,在诊断肾癌时,一个使用 30% 标注图像和 70% 未标注图像进行训练的模型达到了近 98% 的准确率,这一数字与使用全部标注数据的模型非常相似。即使标注数据的量减少到仅 10%,其性能依然保持强劲。这表明计算机可以从未标注图像中吸取有价值的教训,利用它们在专注于特定癌症特征之前,先理解组织的总体结构。
第三种方法,即完全依赖未标注图像的自监督学习,产生的准确率得分低于前两种方法。虽然它未能达到全标注或半监督方法的水平,但它仍能以一定程度的成功识别出癌症模式,证明了计算机即使在没有任何人类指导的情况下也能提取有用信息。在测试的三种计算机模型中,一种被称为 EfficientNetB0 的模型在所有三种癌症类型和所有学习方法中始终表现优于其他模型。它实现了最高的准确率,在最佳训练条件下,针对乳腺癌达到近 92%,针对肾癌则超过 98%。
研究结论指出,有效进行癌症诊断并不一定需要大量标注数据的严格要求。研究人员发现,半监督学习提供了一种极具可行性的替代方案,即使在只能获得少量标注样本的情况下,医疗团队也能构建强大的诊断工具。这是一个重要的发现,因为它降低了开发此类技术的门槛。如果一家医院或研究实验室拥有数千张未标注图像,但只有几百张标注图像,他们仍然可以训练计算机以高可靠性辅助诊断。这项工作表明,自动化癌症检测的未来并不完全取决于对每张图像进行繁琐标注的任务,而在于能够从现有的海量未标注医学档案中学习的智能方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。