Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion
本文提出了一种融合了基于 Swin Transformer 提取的图像特征与临床元数据的多模态皮肤病变分类框架,通过温度缩放校准和不确定性估计实现了高准确率与高可靠性,同时展现出强大的可解释性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探,但你的调查对象不是犯罪现场,而是某人皮肤上一个微小且棘手的斑点。在医学世界中,早期发现皮肤癌就像是在针掉进草堆之前就找到那根针,以免它造成任何伤害。长期以来,医生一直使用一种叫做皮肤镜的特殊放大镜来更清晰地观察这些斑点,但即便有了放大镜,要区分一个无害的雀斑和一个危险的肿瘤仍然极其困难。有时,两种不同类型的斑点看起来几乎一模一样;有时,同一种类型的斑点也会因为出现在身体的不同位置或患者的不同特征而看起来完全不同。这正是计算机科学介入的地方,它扮演着一个超强助手的角色。科学家们一直在教计算机通过“深度学习”来“看见”这些斑点,这是一种人工智能技术,它通过观察成千上万个案例进行学习,就像一名学生为大型考试而苦读一样。然而,仅仅看照片是不够的;计算机还需要了解照片背后的“故事”,比如患者的年龄或斑点所在的位置,才能做出最准确的判断。
这篇论文介绍了一种让计算机玩侦探游戏的新型、更聪明的方式。研究人员构建了一个系统,它不仅盯着皮肤病变的图片,还会阅读患者的临床记录,例如年龄、性别以及斑点的确切身体部位。他们称之为“多模态学习”(multimodal learning),这是一个高级说法,意指计算机正在同时使用多种感官——视觉和语境——来解开这个谜题。为了实现这一点,他们使用了一个名为“Swin Transformer”的强大工具,它就像一个非常先进的相机镜头,可以放大微小的细节,并理解图像中不同部分之间的关联,而不是仅仅看到一个模糊的色块。团队在名为 HAM10000 的大规模公开皮肤图像集上测试了他们的系统,该集合包含超过 10,000 张不同皮肤状况的照片。他们面临着一个棘手的挑战:数据集是不平衡的,这意味着有大量的常见、无害斑点的照片,而罕见、危险斑点的照片却非常少。如果计算机只是学会了每次都猜“无害”,它虽然会获得高分,但却无法捕捉到那些危险的情况。
为了解决这个问题,研究人员教导他们的模型去额外关注那些罕见的斑点,有点像一位老师确保学生不仅学习简单的题目,还要攻克那些最难的问题。他们还增加了一个特殊的“校准”(calibration)步骤,这就像是调节收音机的频率,以确保音量与实际声音相匹配。这确保了当计算机说它有“90% 的把握”做出诊断时,它确实是 90% 的把握,而不是仅仅在盲目自信地猜测。结果令人印象深刻。新系统实现了 92.55% 的测试准确率和 91.33% 的宏平均 F1 分数(macro F1-score)。这意味着它在识别所有类型的病变方面表现出色,包括那些罕见且危险的病变,而不会被常见的病变所迷惑。当我们将该系统与其他仅观察图像或仅观察患者数据的系统进行比较时,这种结合的方法显然是胜出的。仅图像模型的准确率为 88.62%,而仅数据模型的准确率则远不及此,仅为 11.13%,这证明了你确实需要图片和故事两者兼备,才能得到最好的答案。
论文还向我们展示了计算机是如何做出决策的。利用一种被称为“可解释人工智能”(explainable AI)的技术,研究人员创建了热力图,这些热力图突出了计算机正在观察皮肤图像的具体部分。这些地图显示,模型专注于实际的病变区域,忽略了毛发或周围皮肤颜色等干扰因素,这正是一个人类医生会做的事情。此外,通过应用“温度缩放”(temperature scaling)方法,他们将“预期校准误差”(expected calibration error)从 5.18% 降低到了 0.91%。这是一个巨大的进步,意味着计算机的置信水平现在更加值得信赖。虽然论文表明这是一种强大且可靠的自动化皮肤病变分类方法,但也指出未来的工作需要在不同人群中测试这些发现,并纳入更多详细的医疗信息。目前来看,这项研究表明,当你将敏锐的图像观察力与对患者背景的智能理解相结合时,你就会得到一个更加准确且值得信赖的医疗助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。