Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review
这项针对49项临床可解释人工智能(XAI)研究的范围综述显示,评估工作过度侧重于用户信任与感知,而非失效与偏差检测等关键监督能力,且严重依赖未经验证的测量指标,极少评估在部署系统上的实际表现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医院中,医生越来越多地依赖计算机程序来辅助诊断疾病并建议治疗方案。这些工具建立在复杂的数学模型之上,处理海量患者数据的速度远超任何人类。然而,这些模型通常像一个“黑匣子”一样运作,只提供建议而不解释其得出结论的过程。为了解决这种不透明性,研究人员开发了一个名为“可解释人工智能”的领域。其目标很简单:在给出答案的同时提供计算机的推理过程,就像医生在黑板上展示解题步骤一样。人们希望通过看到建议背后的逻辑,临床医生可以决定是信任它、发现错误,还是在建议危险时将其否决。这种检查并纠正机器的能力被称为“人工监督”,它被认为是高风险医疗决策中确保安全性的关键。
然而,一项新的科学研究综述表明,目前测试这些解释性的方式忽略了工作中最为关键的部分。来自柏林夏里特医科大学(Charité – Universitätsmedizin Berlin)的尼古拉斯·弗雷(Nicolas Frey)及其同事审查了发表于2015年至2026年初的49项研究,这些研究测试了医生和医学实习生如何与这些可解释工具进行交互。研究人员想要了解,这些研究究竟是证明了“解释确实能帮助临床医生发现错误”,还是仅仅在衡量“临床医生对解释的外观有多喜爱”。他们发现了一个显著的差距。虽然这些研究经常询问医生是否觉得这些解释值得信赖或易于理解,但几乎从未测试过这些解释是否真的帮助医生识别出了计算机的错误。
该综述详细梳理了这49项研究所衡量的内容。结果显示,研究重点过度集中在感受和感知上。在42项研究中,研究人员询问了参与者对系统的信任程度;在34项研究中,他们询问了解释是否有用;在33项研究中,他们询问了是否易于理解。这些问题依赖于自我报告,即医生只需简单地说:“我对这个答案感到很有信心。”研究人员发现,只有极少数的研究进一步测试了实际行为。仅有3项研究测试了医生是否能发现计算机逻辑中的特定失效点,也只有1项研究测试了医生能否识别出系统中存在的系统性偏差。或许最令人震惊的是,没有任何一项研究测试了医生是否能够正确预测计算机在处理新情况时的反应,而这本应是实现真正理解的基础技能。
证据表明,目前的科研现状优先考虑的是“安全的感受”而非“安全的机制”。大多数研究是在受控的模拟环境中进行的,而非在繁忙的真实医院中。在这些模拟实验中,医生会被展示计算机给出的正确或错误建议,但研究很少衡量医生是否成功拒绝了错误的建议。相反,它们往往衡量医生是否同意计算机的观点,却并未了解这种“同意”是基于正确答案还是错误答案。研究人员指出,一名医生可能会对某个系统表现出高度信任,却仍盲目遵循一个危险的建议;或者他们可能对某个解释感到困惑,但通过忽略计算机的建议依然做出了正确的决定。由于这些研究过度关注前者——即医生“说”自己感觉如何——因此无法为“解释确实能帮助医生捕捉错误”提供有力证据。
此外,收集这些数据的统计方法往往较为薄弱。超过一半的测量依赖于临时性的提问或未经验证的量表,而非成熟且经过科学测试的工具。在综述涉及的253个数据点中,仅有10个使用了经过验证的工具(这是衡量信任或满意度等指标的标准可靠测试方法)。绝大多数数据来自于简单的调查,医生仅需在量表上评价自己的体验。综述还强调,在49项研究中,只有2项研究考察了实际部署并应用于临床环境的系统。其余研究均为实验性质,计算机的行为由研究人员控制,这意味着我们并不知道当医生面临时间压力、疲劳或处理复杂病例时,这些解释是否依然有效。
作者认为,这种失衡造成了一种虚假的安全感。他们指出,信任是一种态度,而监督是一种行动。医生可以对一个系统感到非常信任,但仍无法在面对错误建议时予以否决。要真正了解一个解释是否安全,研究人员需要测试特定的行为:医生能否预测计算机下一步会说什么?当计算机出错时,他们能否发现错误?当计算机对特定患者群体存在偏见时,他们能否识别出来?综述发现,这些关乎安全的特定技能在现有文献中几乎完全缺失。这些研究向我们展示了解释给临床医生的“感觉”如何,但并未展示这些解释是否能在机器失效时帮助临床医生更好地完成工作。
论文总结道,要使可解释人工智能真正发挥作用并确保安全,测试方式必须发生改变。未来的研究需要超越“询问医生感觉如何”,转而开始“测试他们的实际行为”。这意味着要设计实验,通过操纵计算机的正确性,来观察医生是否能区分对错。这意味着要使用经过验证、可靠的工具来衡量态度,而不是仅凭简单的调查进行猜测。最后,这意味着要在现实世界中长期测试这些系统,以观察在面临高风险和高压力的真实环境下,这些解释是否能持续支持良好的决策。在这些转变发生之前,医学界将只能清晰地了解医生“喜欢”这些解释到什么程度,却几乎无法证明这些解释是否真的能保障患者的安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。