The AI-CDSS Evidence Gap: A Critical Analysis of Outcome Measurement, Human-AI Interaction, and Implementation Validation
这项批判性叙述性综述揭示,目前关于基于人工智能的临床决策支持系统的证据不足以证明其能带来显著的患者获益,因为这些证据过度依赖替代性诊断指标,忽视了诸如自动化偏见等显著的人机交互风险,且缺乏在多样化真实世界环境(特别是中低收入国家)中的前瞻性验证。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
医院正开始使用一种新型数字助手来辅助医生进行决策。这些工具基于人工智能构建,通过扫描医学影像或审查患者记录,以比人类更快的速度发现肺炎或败血症等疾病。其前景是巨大的:更少的漏诊、减轻过度劳累的工作人员负担,以及为每个人提供更好的护理。但人们日益担心,我们在真正了解这些工具是有利还是有害之前,就匆忙将其投入实践。核心问题不在于计算机能否在图像中找到某种模式,而在于该模式是否真的能让患者变得更健康。为了回答这个问题,我们必须超越计算机的评分表,去观察真实的医生如何与机器互动,以及当系统不再处于受控实验室、而是处于繁忙、混乱的诊所时,它会表现得如何。
一个研究小组致力于调查这种脱节现象。他们对围绕这些人工智能工具的证据进行了批判性审查,查阅了数千项研究,以了解我们究竟掌握了多少关于其安全性和有效性的知识。他们的工作揭示了一个令人不安的认知鸿沟。该领域目前痴迷于衡量计算机在测试环境中识别疾病的准确度。然而,研究人员发现,这种对技术准确性的关注,对于该工具是否能真正改善患者生存率、缩短住院时间或减轻痛苦,几乎无法提供任何信息。事实上,通过仅仅关注计算机的得分,我们可能会错过故事中最危险的部分:即该工具如何改变医生的思维和行为方式。
研究人员确定了三个具体的阶段,在这些阶段证据出现了缺失,形成了一条导致难以信任这些系统的不确定性链条。第一个失败发生在最开始,即我们衡量成功的方式上。大多数研究仅报告诊断准确性,例如AI有多频繁地正确识别出肿瘤。这就像仅仅根据一辆新车在测试跑道上直线行驶的速度来评判它,却从未检查它是否能安全刹车,或在雨天是否操控良好。研究发现,即使是最强有力的证据(包括在随机试验中涵盖超过一万两千名患者)也仅显示出诊断准确性有微小的提升。更重要的是,这些主要研究都没有测量对患者真正重要的结果,如死亡率或住院时长。我们知道计算机可以发现疾病,但我们不知道及早发现它是否真的能挽救生命。
第二个失败发生在计算机与人类相遇时。研究人员发现,医生与这些工具的互动方式往往是不可预测且有时是有害的。当计算机建议一种诊断时,医生并不总是将其视为中立的数据。有时,他们会过度信任机器,即使机器是错误的,这种倾向被称为“自动化偏差”。在文献中有一个引人注目的例子:当AI在乳腺摄影筛查中给出错误建议时,经验丰富的放射科医生的诊断准确性大幅下降。错误AI建议的存在,使得医生在工作中的表现甚至不如独立工作时。相反,当计算机产生过多的虚假警报时,医生会感到精疲力竭,并开始完全忽略这些警报,这种现象被称为“警报疲劳”。如果系统频繁“狼来了”,真正的狼就会被忽视。目前的证据在很大程度上忽略了这些人类行为,将医生视为信息的被动接收者,而非一个判断力可能被侵蚀或误导的积极合作伙伴。
第三个失败在于这些系统在现实世界中是如何部署和监测的。虽然有很多指南和框架旨在帮助医院安全地实施这些工具,但研究人员发现,这些计划在实践中很少得到测试或遵循。这在低收入和中等收入国家尤为明显,那里的证据几乎不存在。用于指导部署的框架通常是在拥有先进技术和稳定基础设施的发达国家创建的。当应用于资源有限的环境时,它们可能根本不起作用。例如,一个基于世界某部分地区数据训练的系统,在应用于具有不同疾病模式或生活条件的另一类人群时,可能会完全失效。如果没有适当的监测,一个在纸面上看起来表现良好的系统可能会随着时间的推移而发生偏移,随着患者群体的变化而变得不再准确,但由于没有人关注正确的事物,因此无人察觉。
研究人员认为,这三个失败并非并列存在,而是相互影响,从而创造出更大的风险。因为我们只衡量准确性,所以我们会错过准确性无法预测的人为错误。因为我们不衡量人类行为,所以我们无法建立真正有效的实施计划。其结果是,医院正在基于不完整的信息部署强大的工具。该综述强调了一个特定的场景:一个系统在富裕国家表现良好,但被部署在西非的一个地区医院。在那里,由于患者特征的不同,该系统产生了过多的虚假警报。工作人员因不堪重负,停止查看警报。该系统的准确性得分在纸面上依然很高,但在现实中,它正通过训练医生去忽略那些他们真正需要的警告,从而造成伤害。
这种分析并不意味着人工智能在医学领域没有地位。研究人员指出,有一些成功的案例,例如用于筛查糖尿病视网膜病变或优先处理紧急扫描的工具,在这些领域技术显然提供了帮助。然而,这些成功是例外而非普遍现象,且通常依赖于非常具体、狭窄的任务。更广泛的结论是,目前的证明工具安全有效的标准是不充分的。我们不能只问计算机是否聪明,而要开始询问整个系统——计算机与医生共同协作——是否让患者变得更好。
为了解决这个问题,作者提出了一个新的最低证据标准。在任何工具被广泛使用之前,不仅要测试它寻找疾病的能力,还要测试它改善患者预后(如生存率或生活质量)的能力。它还必须经过研究,以观察医生实际上是如何使用它的,测量他们是过度信任它,还是过于频繁地忽略它。最后,这些工具在部署后必须进行持续监测,以确保它们不会随着时间的推移而失去效力。这种方法需要更多的工作和更多的时间,但这是确保人工智能的普及进程不会抛弃患者的唯一途径。技术已经准备好了,但支持它的证据尚未到位。在填补这一差距之前,这些系统的部署仍然是一场针对那些本应受到保护的人们的、大规模且不受控制的实验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。