← 最新论文
💻 computer science

Multimodal Deep Learning for Chest X-Ray Abnormality Classification and Interpretability through Demographic Feature Integration

本研究提出了一种结合了 ConvNeXt Large 骨干网络、将胸部 X 线图像与人口统计学元数据相结合的多模态深度学习框架,在 NIH ChestX-ray14 数据集上实现了 96.88% 的宏平均 AUC,并证明了其相比于现有的仅图像模型具有更优越的性能和可解释性。

原作者: Sultan Mesfer Aldossary, Samia M. Abd-Alhalem, Magda M. Algameel, Noha E. El-Attar

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Sultan Mesfer Aldossary, Samia M. Abd-Alhalem, Magda M. Algameel, Noha E. El-Attar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天,都有数百万人走进诊所和医院,只为进行一次简单的胸部 X 光检查。这种快速、低成本的影像技术是现代医学的基石,它能提供观察胸部内部的视角,从而揭示肺炎、液体积聚或其他隐藏的问题。对于放射科医生来说,解读这些影像是一项至关重要的技能,但也意味着沉重的负担。影像的数量正在激增,而且这项任务通常很困难,因为不同的疾病看起来可能非常相似,或者多种病症可能同时隐藏在同一张图片中。为了减轻这一负担,科学家们转向了人工智能,教计算机识别图像中的模式。然而,大多数这类计算机程序都被训练为仅观察图像本身,而忽略了图像背后的那个人。它们不知道患者是一个年轻男性还是年长的女性,也不知道图像是如何拍摄的。这项研究提出了一个简单而强大的问题:如果我们教计算机同时观察图像和患者的基本细节,会发生什么呢?

一个研究小组致力于构建一种新型计算机系统,将胸部 X 光片的视觉信息与患者的简单人口统计学事实(如年龄、性别以及 X 光拍摄的角度)结合起来。他们使用了一个包含超过 11.2 万张胸部 X 光片的庞大集合,该数据集来自美国国家卫生研究院(NIH),其中包括来自 3 亿多名不同患者的图像。这个集合在领域内非常有名,因为它规模宏大,但也带来了一个棘手的问题:某些疾病在图像中出现了数千次,而另一些则极其罕见。研究人员设计了他们的系统,以处理这种不平衡,并从疾病的视觉模式和患者背景提供的上下文信息中同时进行学习。他们将这种方法与几种其他著名的计算机模型进行了对比测试,以观察添加这一额外信息层是否真的能带来差异。

结果显示,这种新系统在识别疾病方面明显优于那些仅观察图像的旧模型。在对从未见过的数据部分进行测试时,新系统能够以极高的准确度正确区分 14 种不同类型的胸部疾病,达到了 96.88% 的得分。相比之下,表现最好的旧模型(仅依赖图像)的得分在 85% 到 88% 之间。研究人员发现,这种进步主要来自两个方面。首先,该系统基于一种被称为 ConvNeXt 的现代架构构建,这种架构非常擅长捕捉图像中的细节。其次,或许更重要的一点是,系统学会了利用患者的年龄、性别和 X 光机的方位作为线索。例如,知道患者是男性还是女性,或者图像是从正面还是背面拍摄的,可以帮助计算机在那些原本可能看起来完全相同的病症之间做出更敏锐的区分。

为了确保计算机不仅仅是在瞎猜,研究人员还创建了一种查看机器关注点的机制。他们使用了一种技术,可以高亮显示导致诊断结果的特定 X 光区域。当他们观察这些高亮区域时,发现计算机确实关注了正确的部位。如果系统预测肺部塌陷,高亮区域就在肺部边缘;如果它预测心脏肥大,焦点则在心脏本身。这种视觉证据表明,该系统不仅是在寻找数据中的统计规律,而且实际上正在学习以一种符合人类医生逻辑的方式来识别疾病的物理体征。研究还证实,如果忽略训练数据中的罕见疾病,会使系统性能变差,因此他们调整了学习过程,以给予这些较不常见的病症额外的关注。

研究人员承认,他们的工作是向前迈出了一步,但并非最终解决方案。该系统的训练使用的是特定数据集,其中的疾病标签是由计算机读取医疗报告生成的,这意味着训练数据中可能存在一些错误。此外,该系统目前规模较大,需要高性能计算机才能运行,这可能会使其难以立即安装到每家诊所中。团队建议,未来的工作应该在来自不同医院的数据上测试这种方法,以观察它在面对不同类型的机器和患者群体时是否同样有效。他们还提出,加入更多信息(例如患者的吸烟史或既往病历)可以使系统更加准确。目前,这项研究展示了一条清晰的路径:通过教计算机同时观察图像和人,我们可以构建出不仅更准确,而且对依赖它们的医生而言也更值得信赖的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →