← 最新论文
💻 computer science

Beyond Accuracy: A Comprehensive Evaluation of ResNet50 and Vision Transformer for Trustworthy Pneumonia Detection from Chest X-Ray Images

本研究对用于胸部 X 线片肺炎检测的 ResNet50 和 Vision Transformer (ViT-B16) 进行了全面评估,结果表明,虽然 ResNet50 在准确性、校准度和效率方面表现更优,但 ViT-B16 对图像退化表现出更强的鲁棒性,从而凸显了对可靠诊断系统进行多维度评估的必要性。

原作者: VISHAL MANTA

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: VISHAL MANTA

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探,但你寻找的不是指纹,而是在一个人的胸腔内寻找隐形的线索。这就是医学影像的世界,医生使用特殊的照相机拍摄肺部图像,以观察他们是否生病。长期以来,最好的侦探是人类医生,但他们会疲劳,而且有时线索过于微小或模糊,即使是最敏锐的眼睛也会错过它们。为了提供帮助,科学家们利用一种叫做**深度学习(Deep Learning)**的计算机科学分支,构建了“数字侦探”。把这些数字侦探想象成超级聪明的机器人,它们通过观察成千上万张图片来学习,直到它们能靠自己发现问题。

这有两种主要的机器人侦探。第一种就像一位细心的艺术家,它一次观察一个微小的笔触,注意到边缘和纹理是如何连接的。这被称为卷积神经网络(CNN)。第二种则像一只在高空飞翔的鸟;它不会盯着每一片叶子看,而是从远处观察整个森林是如何连接和相互作用的。这被称为视觉 Transformer(ViT)。两者都非常强大,但医生需要知道哪一个实际上更擅长拯救生命,才能在医院里信任它们。仅仅是快速或大部分时间得到正确答案是不够的;机器人还需要对自己的确定程度保持诚实,要足够强韧以应对糟糕的照片,并且要易于向人类医生解释。


在这项研究中,来自印度理工学院古尔गा昂分校(IIT Guwahati)的研究员 Vishal Manta 决定让这两位数字侦探进行一场公平的对决,看看谁才是识别肺炎(一种严重的肺部感染)最值得信赖的选手。两位竞争者分别是 ResNet50(那位细心的艺术家,即 CNN)和 ViT-B16(那只高飞的鸟,即视觉 Transformer)。他们不仅询问“谁答对了最多的题目?”,还设置了一个巨大的障碍赛场来测试一切:包括它们的准确性、对自身置信度的诚实度、速度,以及处理模糊或嘈 {噪} 图像的能力。

这场比赛的结果非常明确。当涉及到识别肺炎这一主要任务时,ResNet50 是冠军。它正确识别肺炎病例的概率为 84.56%,而视觉 Transformer 的识别率为 81.14%。研究人员使用了一种特殊的统计检验方法——麦克内马尔检验(McNemar's test)来确保这不仅仅是运气好,数学结果证实 ResNet50 确实显著优于对手。但故事并未就此结束。研究发现 Resent50 也是更诚实的侦探。当它说自己“有 90% 的把握”时,它通常是正确的。然而,视觉 Transformer 则倾向于过度自信,经常在并不确定的情况下表现得非常笃定。在医学领域,过度自信是危险的,因为医生可能会过度信任一个错误的答案。

然而,视觉 Transformer 也并非一无是处;它拥有一种超能力。当研究人员故意破坏测试照片(例如添加静电噪声、使图像模糊或改变亮度)时,视觉 Transformer 比 ResNet50 表现得更稳健。虽然两款模型在面对糟糕的照片时表现都会下降,但视觉 Transformer 的准确率下降幅度较小。看起来是因为“鸟”是同时观察整幅画面的,所以即使部分图像变得模糊,它仍能理清头绪。但这种超能力也付出了沉重的代价。视觉 Transformer 是一个庞然大物,需要 8580 万个可调节参数才能运作,而 ResNet50 仅需 2351 万个。它思考的时间也更长,处理一批图像需要 55.60 秒,而 ResNet50 仅需 38.57 秒,并且它运行所需的计算能力也更高。

为了确保机器人确实是在观察肺部而不是在瞎猜,研究人员使用了一个名为 Grad-CAM 的工具,它就像一张热力图,可以显示机器人在看哪里。那位细心的艺术家(ResNet50)将注意力紧紧集中在患病的肺部区域,这正是医生想要看到的。而那只高飞的鸟(ViT)的注意力则显得有些分散。当机器人犯错时,它们大多漏掉了肺炎病例,在肺部实际患病时却自信地判定为“正常”。这表明,尽管这些机器人正在进步,但它们仍然在应对那些最隐蔽、最微妙的病例方面感到吃力。

最终,这项研究表明,如果你需要的是一位可靠、快速且诚实的助手,且用于可能没有超级计算机的医院,那么这位细心的艺术家 ResNet50 目前是更好的选择。它更准确、更诚实、运行成本更低。视觉 Transformer 是一个强劲的对手,能够很好地处理糟糕的照片,但对于目前的许多现实诊所来说,它太重、也太昂贵了。这项研究的主要启示是:构建值得信赖的医疗人工智能,不仅仅是关于谁在测试中得分最高,而是关于在聪明、诚实、快速以及足以应对现实世界的韧性之间找到完美的平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →