← 最新论文
💻 computer science

Swin Transformer Based Multi-Label Chest Disease Classification

本文针对 NIH ChestX-Ray14 数据集提出了一项全面的基准测试研究,证明了通过针对类别不平衡和阈值优化策略增强后的 Swin Transformer V2-B 框架,在多标签胸部疾病分类任务中优于现有的最先进深度学习模型。

原作者: Abdullah Bakr, Ashraf Ullah, Abdul Jabbar

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah Bakr, Ashraf Ullah, Abdul Jabbar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天都有数百万人走进诊所和医院进行简单的胸部 X 光检查,这一程序已成为医生观察人体内部最常用的方式。这些图像对于发现肺炎、肺部积液或心脏肥大等病症至关重要,但解读这些图像是一项艰巨的任务。单张图像可能同时隐藏多种疾病,即使是经验丰富的专家也可能遗漏细微的征兆,或难以区分看起来几乎完全相同的病症。虽然人工智能在帮助医生解读这些扫描图像方面展现出了巨大的潜力,但一个主要的障碍仍然存在:用于教导这些计算机的数据往往是不平衡的。某些疾病在医疗记录中频繁出现,而另一些则较为罕见,这导致标准的计算机程序擅长识别常见问题,但在面对不常见的问题时却表现不佳。

一个研究小组致力于通过测试新一代人工智能来解决这个问题,并将其与旧有的、成熟的方法进行对比。他们专注于一个包含来自 3 逾 3 万名患者的 11.2 万多张胸部 X 光片的庞大集合,该数据集包含了标注有最多 14 种不同疾病的图像。其目标不仅是构建单一模型,而是对六种不同类型的深度学习系统进行一场公平的正面交锋。这些系统涵盖了从传统设计(通过类似人眼扫视页面般的微小过滤器来处理图像)到较新的架构(使用一种称为“注意力”的机制,一次性观察整幅图像并决定哪些部分最为重要)。研究人员还引入了一种特定的训练技术,旨在迫使计算机额外关注罕见疾病,确保它不会为了追求常见疾病而忽略它们。

研究结果显示,一种被称为 Swin Transformer 的新型架构显著优于所有测试的方法。不同于那些可能“只见树木不见森林”的旧模型,也不同于那些虽然能看全局但难以捕捉精细细节的新模型,这个获胜的系统结合了两者的优点。它将图像分解成小的窗口并进行局部分析,然后转移注意力将这些窗口连接起来,使其能够同时看到微小肺结节的细微细节以及心脏肥大的整体轮廓。在对同一组图像进行测试时,该模型取得了比其他五种系统更高的准确率得分,其中包括一个多年来一直作为基准的著名模型。它成功识别了各种疾病的存在,证明了这种特定的视觉信息处理方式更适合胸部 X 光片这种复杂且具有多层结构的特性。

为了确保结果可靠,研究人员采取了周密的措施以防止计算机“死记硬背”答案。他们对数据进行了拆分,确保来自同一患者的图像绝不会同时出现在训练组和测试组中,从而保证系统是在真正学习识别疾病模式,而非仅仅是识别特定的人。他们还针对每种疾病单独调整了系统的决策过程,微调了敏感度,使其不会因为某种情况罕见就漏掉它。结果表明,虽然新模型比一些简单的系统需要更长的训练时间,但这些额外的时间换来了更可靠的诊断。研究人员还使用了一种可视化工具来观察模型内部的“思维”,确认当它标记出某种疾病时,它确实是在关注肺部或心脏的相关部分,而非随机的背景噪声。

研究结果表明,自动化医学诊断的未来可能在于这些更复杂的、基于注意力的系统。虽然新模型并未解决所有挑战——一些难以察觉的疾病仍然难以应对,且整体准确率得分虽然是研究中的最高水平,但仍有提升空间——但它展示了相对于多年来主导该领域的传统方法的明显优势。通过展示一个能够理解局部细节和全局语境的系统可以更好地处理多种疾病共存的复杂现实,这项工作为构建能够协助全球医生做出更快、更准确决策的工具奠定了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →