问题描述 高性能的 AI 模型可能会产生不准确的预测,当这些预测被部署时,可能会通过自动化偏差(对错误 AI 输出的过度依赖)损害人类的决策。为了缓解这一问题,“选择性预测”(或称 AI 延迟/deferral)被提出作为一种方案,即 AI 系统会对其认为可能有害的情况保留预测,并请求人类进行独立决策。然而,目前对该方法的典型评估依赖于一种模拟假设,即当 AI 弃权时,人类会恢复到没有 AI 参与时的基准表现。这种假设在多标签任务中尚未得到验证,因为在多标签任务中,AI 可能会保留某些预测的同时揭示其他预测。此外,以往关于延迟机制的实证研究主要集中在单输出二元设置上,这使得在复杂的、多标签临床工作流中如何理解选择性预测的功能成为了一个研究空白。
临床医生 + 选择性预测: AI 保留了其识别为可能有害(不准确)的预测,并明确告知临床医生其正在进行延迟处理(“模型向您请示/defers to you”),同时展示其他条件的预测。
选择性预测机制是利用事后真实情况(post-hoc ground truth)构建的,用以识别潜在有害的预测。为了模拟现实部署中的缺陷,该机制不仅保留了所有错误的预测,还保留了一小部分(11%)正确的预测。临床医生被随机分配到 AI 辅助条件下,并被要求诊断 ARF 的病因并选择相应的治疗方案(抗生素、利尿剂或类固醇)。表现是通过治疗准确率、假阳性率(FPR)和假阴性率(FNR)来衡量的,统计分析使用混合效应模型以解释重复测量。
核心贡献 本研究是对选择性预测在多标签临床决策任务中的首次评估。作者挑战了这样一个行为学假设:即当 AI 明确弃权时,人类的决策保持中立。具体而言,他们证明了:
选择性预测能部分缓解不准确 AI 对整体治疗准确率的负面影响。
选择性预测从根本上改变了临床医生犯错的“类型”,即在 AI 弃权时,会增加假阴性(治疗不足)。
这些效应因临床医生特征而异,缺乏 AI 经验者以及受训程度较低者(高级实践从业者)表现出更强的易受此类错误转变的影响。
研究结果
不准确 AI 的影响: 当临床医生看到所有 AI 预测(包括不准确的预测)时,其治疗准确率较基准显著下降(从 62% 降至 50%),这主要是由假阳性和假阴性的增加驱动的。
选择性预测的影响: 当 AI 撤回不准确的预测时,治疗准确率相对于“临床医生 + AI”条件有所提高(55% vs. 50%),但未能完全恢复到“仅临床医生”的基准水平(62%)。
错误转移: 虽然在选择性预测下假阳性率回到了基准水平,但假阴性率仍显著升高(42% vs. 基准的 31%)。这表明,当被告知 AI 正在弃权时,临床医生更有可能对需要干预的患者进行治疗不足。
亚组分析: 在选择性预测下,假阴性的增加在未曾使用过 AI 的临床医生(无 AI 经验者)以及高级实践从业者(APP)中尤为明显。
感知难度: 当 AI 存在时,临床医生感知到的病例难度更高,且当 AI 使用选择性预测时,难度评分最高。
意义 本文认为,选择性预测不应在没有进行特定背景评估的情况下被视为默认的“安全机制”。虽然它减少了对有害 AI 输出的过度依赖(降低了假阳性),但它引入了新的风险:它使临床医生转向治疗不足(增加了假阴性)。在急性呼吸衰竭(ARF)这类高风险背景下,治疗不足可能比过度治疗更具危害性,因此这种权衡至关重要。研究结果强调,仅仅是 AI 弃权这一行为本身并不是一个中立事件;它改变了人类的推理过程,这可能是由于可得性偏差(availability bias)或将延迟处理误解为缺乏诊断所致。因此,作者得出结论:必须在真实世界的工作流中评估 AI 系统,并密切关注在特定临床领域中哪些类型的错误是更可接受的。