← 最新论文
🤖 AI

Searching for Robust Augmentations to Improve Out-of-Domain Generalization in Dermoscopic Skin Cancer Classification

本研究表明,通过一种复合“混合”策略来寻找并应用模拟真实世界领域偏移的数据增强,能显著提高皮肤癌皮肤镜分类中的域外泛化能力,尽管由于缺乏源不相交的选择协议,所报告的性能提升可能过于乐观。

原作者: Alexander Kozachok, Ilya Latyshev, Evgeny Karpulevich, Elena Kozachok, Egor Ushakov, Oleg Samovarov

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Kozachok, Ilya Latyshev, Evgeny Karpulevich, Elena Kozachok, Egor Ushakov, Oleg Samovarov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:寻找增强方案以提升皮肤黑色素瘤分类的域外泛化能力

问题陈述
用于皮肤病变分类的深度学习模型在内部测试集上通常能取得高准确率,但在应用于新数据源(域外,即 OOD)时往往会出现显著的性能下降。这种“领域偏移”(domain shift)源于不同诊所之间在成像设备、照明、色彩处理以及采集伪影方面的差异。尽管先前的研究已广泛研究了架构选择和内部验证,但对于哪些特定类别的增强方案能有效提高对源级偏移的鲁棒性,仍缺乏系统性的分析。此外,现有的增强研究通常针对域内验证进行优化,未能解决将模型迁移到全新采集环境的具体挑战。

方法论
本研究采用以数据为中心的方法,旨在提高二分类(恶性与非恶性)分类器的 OOD 泛化能力。

  • 数据集: 训练和域内评估利用了来自 ISIC 存档(BCN20000, Derm12345, HIBA, BALD, MILK10k, ISIC 2016–2020)的多源集合以及 Derm7pt。为了确保严格的 OOD 评估,HAM10000 和 ISIC 2019–2020 数据集被完全保留作为源不相交(source-disjoint)的测试集。一个独立的封闭临床数据集(Melanoscope)仅用于最终的外部验证,不参与模型选择过程。
  • 模型架构: 使用了以 ImageNet 权重初始化的 ConvNeXt-Large 骨干网络,并带有二分类头。
  • 增强搜索: 作者在三类增强方案中进行了系统搜索:
    1. 单一增强: 单个几何和光度变换。
    2. 光度组合: 基于颜色算子的固定配对或三元组(例如 ColorJitter, PlanckianJitter, HEStain)。
    3. 复合策略: 受竞赛方案及作者自身发现启发的配置(例如 mix, kaggle_strong_hestain)。
  • 评估指标: 主要指标是受试者工作特征曲线下面积(ROC-AUC)。评估包括域内测试、源不相交的 OOD 测试以及独立的 Melanoscope 集。通过自助法(bootstrap)置信区间和 DeLong 检验进行统计显著性评估。研究还采用了 t-SNE 可视化和 Grad-CAM 来定性评估特征空间的混合情况和注意力图。

核心贡献

  1. 针对 OOD 的系统性增强搜索: 不同于以往根据域内性能对增强方案进行排序的研究,这项工作明确地寻找旨在最大化源级留出测试集性能的策略。
  2. 识别光度主导地位: 研究发现,光度变换(颜色和强度调整)是 OOD 鲁棒性的主要驱动力,其表现优于纯几何变换。
  3. “Mix”策略: 作者提出了一种名为 mix 的特定复合增强策略,该策略结合了光度变换和适度的几何变换。结果表明,该策略在保持域内准确率的同时,实现了最高的 OOD 增益。
  4. 严谨的验证协议: 本文区分了筛选结果(单次运行的点估计)和扩展评估(多种子、置信区间及独立外部数据集),从而透明地展示了发现的方差和局限性。

结果

  • 域外性能: mix 策略实现了最大的 OOD 测试集增益,相对于筛选阶段的基线,ROC-AUC 提升了 +0.0332。在扩展评估(来自留出源的 9,921 幅图像)中,提升幅度为 +0.053(95% CI: +0.045 至 +0.061, p < 0.001)。
  • 域内性能: mix 策略也对域内准确率产生了积极影响,ROC-AUC 提升了 +0.0061,证明了鲁棒性的提升并未以牺牲内部性能为代价。
  • 跨种子鲁棒性: mix 策略的 OOD 优势在四个不同的随机训练种子下均保持稳定,且 ROC-AUC 范围互不重叠(基线:0.761–0.775;Mix:0.806–0.829)。
  • 外部验证 (Melanoscope): 在独立的 Melanoscope 数据集上,单个检查点的敏感度从 0.591 增加到 0.818。然而,作者指出这一结果仅基于 22 例恶性病例,未达到 AUC 的统计学显著性(p = 0.22),且该优势在多个训练种子平均后消失。
  • 特征分析: t-SNE 可视化表明,与基线相比,mix 策略减少了特征空间中的源特定聚类。Grad-CAM 分析表明,增强后的模型更紧凑地聚焦于病变本身,而非边缘伪影。
  • 诊断特异性分解: OOD 的提升主要由良性角化细胞瘤特异性的增加(减少假阳性)驱动,而非黑色素瘤召回率的显著提高,后者的召回率在各种配置下始终处于较低水平(0.26–0.43)。

意义与局限性
论文声称,模拟真实来源领域偏移(特别是光度变化)的增强方案,对于 OOD 泛化能力的提升可能比单纯追求最大化域内准确率或改变模型架构更为关键。mix 策略被视为一个简单、可复现的基准步骤,在进行临床验证决策支持系统之前应予以考虑。

然而,作者对其结论进行了明确的限定:

  • 选择偏差: 该策略是使用与主要 OOD 评估相同的来源数据(HAM10000 和 ISIC 2019–2020)进行选择的。因此,报告的效应量可能存在乐观偏差,且结果并不构成对向完全未知来源泛化的独立确认。
  • 外部证据有限: 在独立数据集 Melanoscope 上的改进并不具备统计学显著性,且在不同训练种子间无法持续,这表明在 ISIC/HAM 来源上观察到的鲁棒性尚未被证明能迁移到完全不同的临床环境中。
  • 临床实用性: 虽然特异性有所提高,但黑色素瘤的绝对召回率仍然很低,这表明该模型目前更适合用于优先筛选待复核病例,而非进行自主诊断。

作者总结道,虽然 mix 策略提供了一个稳健的基准,但未来的工作需要采用源不相交的选择协议(例如“留一源法”,leave-one-source-out)并在更大规模、更多样化的外部队列上进行验证,以确认无偏的泛化能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →