每年,全球有数百万人出现皮肤病变,其范围从无害的痣到危险的黑色素瘤等癌症不等。及早发现这些情况关乎生死;当黑色素瘤在扩散前被发现时,五年生存率近乎完美,但一旦转移到远处器官,这一机会就会大幅下降。目前,第一道防线通常是当地诊所的全科医生,而非专业的皮肤科医生。这些基层医疗提供者面临着一个艰难的现实:他们必须在没有皮肤科医生那样多年专业训练的情况下,从皮肤图像中识别出癌症的细微征兆,而且他们往往缺乏驱动最先进诊断工具的那种昂贵且笨重的计算机系统。因此,挑战在于构建一个既足够聪明能看到专家所见,又足够轻量化能在标准诊所甚至移动设备上的普通计算机上运行的数字助手。
研究团队通过创造一种专门为此类环境设计的全新人工智能系统解决了这一挑战。他们构建了一个框架,该框架可以观察一张皮肤病变的图片并同时完成两件事:判断病变的类型并围绕它绘制精确的轮廓。其系统的核心是一个轻量级的神经网络——一种受人类大脑启发的计算机程序,他们选择它是由于其能够在高性能与低能耗之间取得平衡。为了让这个系统更加敏锐,他们加入了一种机制,帮助计算机专注于图像中最重要的部分,就像人类眼睛自然地忽略繁忙的背景而专注于特定物体一样。他们还设计了让系统保持谨慎的机制;如果计算机对诊断不确定,它会被编程为将病例标记给人类医生,而不是自信地进行猜测,这是一项旨在防止危险错误的安全性功能。
研究人员使用来自公共医学数据库的大量皮肤图像测试了他们的创造物。结果显示,他们的轻量级系统能够正确识别超过84%的皮肤病变类型,这一准确水平足以媲美那些需要强大、昂贵硬件的大型复杂模型。除了对病变进行分类外,该系统还能以高度的精确度成功勾勒出图像中病变的边界。或许最重要的一点是,研究表明,教计算机同时执行这两项任务——即识别病变和绘制其形状——实际上比仅训练它完成其中一项任务时,能让它更好地识别病变。这表明这两项任务是相辅相成的,描绘病变轮廓的过程有助于计算机更深入地理解其特征。
尽管取得了这些成功,研究人员仍谨慎地指出,他们的系统尚未准备好取代医生。该模型是在理想的受控条件下拍摄的图像上进行训练的,在面对现实诊所或居家自检中那些杂乱、多变的照明和角度时,可能会表现得力不从心。此外,该系统被设计为一种筛查工具,而非最终的诊断权威。当计算机遇到困难或模糊的图像时,其内置的安全协议会指示将病例发送给人类专家进行审查。该团队设想将这项技术作为一种赋能全科医生的手段,为他们提供可靠的第二意见,从而帮助他们在专家资源匮乏的环境下更早地发现危险的皮肤癌。然而,在该工具投入医院使用之前,必须在实际临床环境中进行进一步测试,以确保其在不同肤色和医疗环境下都能安全运行。
技术摘要:一种用于多任务皮肤病变分类与分割的注意力增强型 MobileViT 框架
1. 问题陈述
本文旨在解决在资源受限的一级护理设置中部署自动化皮肤病变诊断的挑战。尽管深度学习在皮肤病变分析方面取得了进展,但在诊断准确性与计算效率之间仍存在显著的权衡。
- 重量级模型(例如标准的 Transformer、大型 U-Net)提供了强大的性能,但其参数开销过高,使其不适用于移动或边缘设备。
- 现有的轻量级网络通常缺乏鲁棒的全局特征建模和空间特征增强,这限制了它们在处理如区分模糊病变边界等细粒度任务时的可靠性。
- 安全性问题: 大多数当前模型提供确定性预测,而没有显式地量化不确定性,这可能导致在面对模糊或非典型样本时产生过度自信的输出,从而增加临床误诊的风险。
2. 方法论
作者提出了一种基于 MobileViT-XS 的轻量级、注意力增强型多任务框架,用于联合进行皮肤病变分类和语义分割。
- 骨干网络架构: 该框架使用 MobileViT-XS 作为共享骨干网络。该架构结合了用于提取局部纹理的卷积神经网络 (CNN) 与用于建模全局依赖关系的视觉 Transformer (ViT),从而有效地捕捉皮肤病变的跨尺度和边界模糊特性。
- 注意力机制 (CBAM): 在骨干网络末端、任务特定头(task-specific heads)之前,集成了卷积块注意力模块 (CBAM)。CBAM 顺序应用通道注意力(通过全局池化和 MLP 识别信息丰富的通道)和空间注意力(聚合通道信息以生成空间掩码),以精炼特征表示。
- 多任务学习 (MTL) 设计: 该架构采用双分支结构:
- 分类分支: 使用全局平均池化、Dropout 和全连接层,输出八种病变类别(AK, BCC, BKL, DF, MEL, NV, SCC, VASC)的概率。
- 分割分支: 使用轻量级解码器通过上采样特征并应用卷积,输出像素级病变掩码。
- 非对称促进: 该设计利用像素级分割监督来辅助图像级分类优化,创造了一种“非对称任务促进范式”,其中分割对分类的促进作用比反向作用更为显著。
- 损失函数: 总损失是分类损失和分割损失的加权和(Ltotal=λclsLcls+λsegLseg)。
- 分类损失: 使用加权交叉熵损失来解决类别不平衡问题,权重与类别频率成反比。
- 分割损失: 结合了 Dice 损失和二元交叉熵 (BCE) 损失,以优化区域重叠度和像素级准确度。
- 保守推理与风险分层: 为了减轻过度自信的问题,采用了面向安全的推理策略。
- 审查阈值: 如果最大类别概率 (pmax) 低于 0.50 或前两个类别之间的间距 (δ) 低于 0.15,则将样本标记为专家审查。
- 风险分层: 对于无需审查的样本,计算恶性类别(MEL, BCC, SCC, AK)的累积概率。风险分为高(预测为恶性)、中(预测为良性但 pmalignant≥0.25)和低。
3. 核心贡献
- 验证了 MobileViT-XS 的有效性: 本研究系统地验证了 MobileViT-XS 是优于纯 CNN(如 EfficientNet-B0)或重型 Transformer 的皮肤病变分析轻量级骨干网络,证明了它能更好地平衡局部纹理与全局上下文。
- 注意力增强的多任务范式: 本工作建立了一个协作学习框架,其中分割监督显著精炼了用于分类的空间特征。研究表明,当 CBAM 模块与多任务学习结合使用时,会产生实质性的性能提升,克服了在单任务框架中观察到的有限注意力增益。
- 面向安全的预测: 引入了保守预测约束和风险分层机制,解决了模型过度自信的问题,通过将不确定样本标记为人工审查,以增强诊断安全性。
4. 实验结果
实验在 ISIC 2019 数据集(25,331 张图像,8 个类别)上进行,并匹配了来自 ISIC 2018 的分割掩码。
- 性能指标:
- 分类: 所提模型实现了 84.37% 的准确率 (Accuracy)、79.46% 的宏 F1 值 (Macro-F1)、79.68% 的敏感度 (Sensitivity) 和 97.22% 的特异度 (Specificity)。
- 分割: 模型实现了 86.37% 的 Dice 系数 和 78.09% 的 mIoU。
- 效率: 该模型仅运行 2.62 百万个参数。
- 对比分析:
- 所提方法优于轻量级基准模型如 EfficientNet-B0(81.63% 准确率),并显著超越了 ResNet-50 和 GS-TransUNet。
- 虽然单任务分割模型(U-Net, DeepLabV3+)在 Dice/mIoU 指标上略高,但所提多任务模型通过同时执行两项任务且保持极低参数量,提供了更优的准确率-效率权衡。
- 消融实验:
- 将 CBAM 添加到单任务 MobileViT-XS 基准模型中仅带来了微小的收益。
- 引入多任务学习 (MTL) 显著提升了分类准确率(从约 72% 提升至约 83.6%)。
- 将 MTL 与 CBAM 结合达到了最优结果,证实了密集的分割监督激活了注意力机制的全部潜力。
5. 意义与主张
本文声称提供了一个在准确性、计算效率、视觉可解释性和临床预测安全性之间平衡良好的权衡。
- 一级护理适用性: 该框架被定位为一种可部署的、轻量级的解决方案,适用于计算资源有限的一级护理皮肤病变筛查及便携式边缘设备。
- 可解释性: 集成的 Grad-CAM 热图和叠加可视化增强了模型的可解释性,使临床医生能够理解预测背后的逻辑。
- 安全性: 通过显式处理不确定性(通过保守阈值),该系统旨在降低在模糊病例中出现危险的过度自信预测的风险。
局限性与未来展望:
作者承认,该模型完全是在受控成像条件下基于公开 ISIC 数据集训练的,这可能会导致在现实世界的一级护理或自我筛查场景中出现领域偏移(domain shifts)。目前的损失权重是固定的,且预测阈值是经验性定义的。论文结论指出,在实现现实世界的临床应用之前,需要进行前瞻性多中心临床验证。未来的工作将侧重于收集多样化的临床数据集、探索动态任务平衡机制,以及通过 ONNX 或 TFLite 实现移动/边缘端的部署。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。