Eliminating False-Negative Discharges in Tuberculosis Screening: Multi-Cohort Development and Independent External Stress-Testing of an Auditable Conformal AI Safety Architecture
本文提出了一种可审计且可部署于边缘端的 AI 安全架构,该架构结合了符合性预测与输入质量保障技术,旨在消除不同资源受限的国际队列中自主产生的结核病漏诊误判,同时保持高诊断准确率并减少不必要的确认性检测。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
结核病仍然是世界上最致命的传染病之一,每年夺走超过一百万人的生命。在许多该疾病最为普遍的地区,主要的筛查工具是胸部 X 光检查,这是一种能够显示肺部健康状况的快速影像。然而,最擅长解读这些影像的胸腔放射科医生往往严重短缺。这种短缺造成了瓶颈:患者可能要等待数周才能得到诊断,或者更糟的是,在未获得诊断的情况下就被送回家,从而导致感染的持续传播。为了解决这个问题,科学家们转向人工智能,希望构建能够扫描 X 光片并标记可疑病例以供人类审核的计算机程序。挑战在于,这些计算机程序往往会变得过度自信。当面对异常图像或使用不同设备拍摄的图像时,计算机可能会极其肯定地宣布患者健康,即使患者其实已经患病。这种“沉默的假阴性”是非常危险的,因为它会导致传染病患者在没有任何医疗检查的情况下被立即遣返。
一位研究人员针对这一问题开发了一种新方法,创建了一个能够防止计算机犯下此类危险错误的安全性系统。该系统并非依赖单一算法做出最终判断,而是构建了一个类似于严格看门人的框架。该系统会在分析之前先检查 X 光片的质量,确保图像清晰且没有因扫描不佳或过度压缩而导致变形。如果图像过于模糊或受损,系统将拒绝做出诊断,而是将病例转交给人类医生。此外,该系统旨在识别自身的不确定性。它不会盲目猜测,而是承认不确定性并将患者转交给临床医生。研究人员在来自印度和巴基斯坦医院的数千张 X 光片上测试了该系统,其中包括在农村诊所使用旧设备拍摄的图像,以及经过网页压缩处理的图像。他们发现,虽然单独使用计算机可能会错误地放行一些病患,但加入这些安全检查后,这些错误被完全消除了。其结果是一个可以在偏远诊所通过简单的离线计算机运行的工具,能够标记出最紧急的病例以进行即时检测,同时确保没有人会在没有专业人员进行第二次复核的情况下被送回家。
这项工作的核心解决了人工智能在视觉学习方面的特定弱点。深度学习模型(现代图像识别背后的“大脑”)是在海量的医学图像库上进行训练的。在受控环境下,这些模型可以达到近乎完美的准确率。然而,当它们遇到现实世界的条件时——例如,X 光机与训练时使用的略有不同,或者图像文件为了节省空间而被缩小——它们的表现可能会崩溃。研究人员发现,在一组测试中,一个标准的计算机模型在面对来自巴基斯坦医院、经过高度网页压缩的图像时彻底失效了。由于受到数字伪影的影响,模型变得非常混乱,以至于它判定数据集中的每一个人都是感染者,无论其是否真的患病。这凸显了一个关键缺陷:过于僵化的模型无法适应全球医疗保健中混乱的现实,即设备各异且数据质量参差不齐。
为了修复这一点,研究人员并没有试图强迫计算机去学习每一种可能的劣质图像变化,因为这种策略往往会降低模型观察高质量清晰图像的能力。相反,他们在计算机的决策过程周围构建了一系列过滤器。第一个过滤器是预检,它检查图像是否存在损坏迹象,例如由重度文件压缩引起的块状失真或图像倒置。如果图像未通过此项检查,系统就会停止并不会尝试进行诊断。第二层涉及一种衡量计算机置信度的方法。如果计算机不能百分之百确定患者是健康的,它就会被程序设定为暂停并转交病例给人类。这确保了系统除非在统计学上极度确定,且图像质量完美的情况下,否则绝不会做出让患者出院的最终决定。
研究人员在来自全球八个不同地点的超过 16,000 张胸部 X 光片上测试了这个多层系统,包括来自中国、美国、白俄罗斯和印度的医院。他们首先在大型且多样化的图像集上训练计算机,然后在一个全新的、从未见过的数据集上进行测试。在内部测试中,该系统的表现极其精准,正确识别了几乎所有的结核病病例,并正确排除了大多数健康患者。然而,真正的考验出现在他们将系统应用于印度和巴基斯坦的独立患者群体时。在印度农村地区医院的高质量图像上,系统能够自主识别约 70% 的病患,虽然较内部测试的表现有所下降,但仍具有实用价值。更重要的是,通过应用安全规则,该系统成功防止了任何病患在未经过人工审核的情况下被误送回家。在印度的样本组中,安全拦截机制确保了零例活动性结核病例在未经过临床医生查看的情况下被遣返。
在处理来自巴基斯坦的图像时,情况甚至更加剧烈。这些图像经过了极度压缩,以至于标准的计算机模型完全失效,预测该数据集中的每一个人都患病。研究人员表明,试图通过重新训练计算机来处理这些劣质图像反而会使其在处理高质量、清晰图像时表现变差。与其强迫计算机去适应,不如利用他们的安全系统直接识别出巴基斯坦的图像质量过差,无法信任。该系统标记了压缩伪影并将这些病例路由给人类医生,从而有效地成为了对抗计算机困惑的盾牌。这证明了处理低质量数据的最佳方式不是让计算机对噪声更具鲁棒性,而是建立一个知道何时说“我不知道”并寻求帮助的系统。
研究还表明,计算机有时会学习到“捷径”。在某些情况下,模型仅通过观察图像就能猜出 X 光片来自哪家医院,并利用这一线索来推测诊断结果。例如,它学到了来自白俄罗斯某医院的图像几乎总是代表患病,而来自美国某个数据库的图像则几乎总是代表健康。这是一个危险的捷径,因为如果计算机看到来自新医院的图像,它可能会得出错误的诊断。研究人员使用了一种可视化技术来观察计算机到底在看什么,他们发现虽然计算机确实注意到了这些特定于医院的线索,但其主要关注点仍然是实际的肺部组织。当他们遮盖住图像中的肺部时,计算机诊断疾病的能力便消失了,这证明它仍然是在关注正确的目标,尽管它也习得了一些额外的习惯。
最终的结果是一个为现实世界设计的系统,在这些地方资源匮乏且环境难以预测。整个软件包体积很小,足以安装在不需要高性能显卡或互联网连接的标准计算机上。它可以在没有电力或互联网的诊所运行,并在不到一秒的时间内做出决策。研究人员计算出,在典型的诊所中使用该系统可以减少近 80% 的不必要实验室检测,从而节省资金和时间,同时仍能捕捉到绝大多数的病患。最重要的是,该系统建立在“宁可谨慎,不可大意”的原则之上。通过拒绝对不确定或质量较差的图像做出最终判断,它确保了没有任何患者会带着虚假的安全感被送回家。这种方法将人工智能从一个试图取代医生的工具,转变为一个支持医生的工具,在处理常规工作的同时,保护最脆弱的患者免于被漏诊。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。