Performance of Large Language Model on Real-World Patient Histories for Imaging Appropriateness.
本研究表明,ChatGPT 在根据美国放射学会(ACR)标准对腰椎核磁共振成像(MRI)的适用性进行分类方面,与放射科医生达到了中度的符合度,且当其推理质量被评定为较高时,其决策可靠性显著增加。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:大语言模型在真实患者病史中评估影像检查合理性的表现
问题陈述
腰痛(LBP)是一种普遍的全球性肌肉骨骼系统投诉,导致腰骶部磁共振成像(MRI)的请求频繁。系统评价表明,约有 29–34% 的此类影像学请求是不合理的,通常缺乏如感染、恶性肿瘤或创伤等“红旗征象”(red flags)。不必要的 MRI 会增加医疗成本、患者焦虑以及过度诊断的风险。尽管临床决策支持工具和指南已经存在,但其在现实工作流中的应用受到集成挑战和警报疲劳的阻碍。虽然大语言模型(LLMs)已成为减少不必要利用的一种可扩展替代方案,但先前的研究主要依赖于假设性的临床场景而非真实的患者病史,使用单一放射科医生作为参考标准,并侧重于较早的模型版本(如 GPT-4),且未系统地评估推理质量与决策可靠性之间的联系。
方法论
本横断面研究评估了 GPT-5.2 在使用真实世界患者病史并基于美国放射学会(ACR)标准对腰骶部 MRI 合理性进行分类的诊断准确性。
- 数据收集: 数据回顾性采集自 160 名成年患者(平均年龄 48 ± 15 岁;58% 为男性),这些患者在 2025 年 9 月至 11 月期间接受了腰骶部 MRI 检查。排除病史不足、既往脊柱手术、疑似感染或急性创伤的患者。通过一个经五位专家验证的结构化问卷来收集影像检查前的临床病史。
- 模型提示词(Prompting): 患者病史通过结构化提示词输入 GPT-5.2,要求模型扮演放射科医生角色,并根据包括明确推理过程在内的 ACR 指南,将 MRI 指征分类为“通常合理”(UA)、“可能合理”(MBA)、“通常不合理”(UNA)或“临床信息不足”(ICI)。
- 参考标准: 两名独立放射科医生(具有 5 年和 10 年经验)作为参考标准。
- 第一阶段: 放射科医生基于与 LLM 相同的提示词进行评估,且对模型的输出内容不知情。
- 第二阶段: 放射科医生评估 LLM 建议的准确性以及其临床推理的质量(使用 5 分李克特量表 1–5),且彼此对评分结果不知情。
- 统计分析: 使用加权 Cohen's kappa () 和 Bowker 不对称性检验测量一致性。对于二分类分析,将 UA 和 MBA 合并为“合理”,将 UNA 归为“不合理”。性能指标包括灵敏度(Sensitivity)、特异度(Specificity)、阳性预测值(PPV)、阴性预测值(NPV)和曲线下面积(AUC)。基于放射科医生评定的推理质量(高:4 vs. 低:<4)进行了亚组分析。
关键结果
- 一致性: GPT-5.2 与两名放射科医生均表现出中度一致性(相对于放射科医生 1 的 ;相对于放射科医生 2 的 )。这一一致性水平与放射科医生间的差异(inter-radiologist agreement)相当()。
- 二分类分析: 模型显示出高灵敏度(针对两名放射科医生均约为 85%)但特异度存在差异(针对放射科医生 1 为 92.9%;针对放射科医生 2 为 61.7%)。阴性预测值(NPV)处于中等水平(针对 R1 为 57.8%;针对 R2 为 64.4%),表明其具有倾向于保守(限制性)使用 MRI 的特征。
- 判别能力: ROC 分析显示,针对放射科医生 1 具有良好到优秀的判别能力(AUC 0.891),针对放射科医生 2 具有尚可到良好的判别能力(AUC 0.751)。
- 推理质量相关性: 一个关键发现是推理质量与决策可靠性之间存在强相关性。当放射科医生将模型的推理评定为高质量(4)时,关于合理性的精确一致性较高(针对 R1 为 83.3%;针对 R2 为 90.4%),且相反的不一致性(最危险的错误类型)较低(2.3–4.7%)。相反,当推理被评定为低质量(<4)时,精确一致性降至 0–7.1%,而相反的不一致性激增至 71.4–92.8%。
- 专家评估: 放射科医生对模型的输出质量给予了高度评价,合理性和推理质量的中位数李克特评分均为 5(最高分)。
意义与主张
作者声称,在利用真实患者病史对腰骶部 MRI 合理性进行分类时,GPT-5.2 的表现处于放射科医生间变异性的范围内。研究强调,模型推理的质量是其决策可靠性的稳健预测因子。具体而言,高质量的推理输出与专家判断的高度一致性相关,而低质量的推理则与显著的不一致性相关。
本文认为,像 GPT-5.2 这样的 LLM 有潜力作为预筛查支持工具,以减少不必要的影像检查请求。然而,作者强调,这种潜力取决于模型的推理质量,并建议采用一种混合工作流,即将低质量推理的输出升级为专家审核。研究结论指出,虽然该模型展现出应用前景,但安全的临床集成仍需要持续的人类监督、前瞻性多中心验证,以及建立共识参考标准,以解决模糊病例中的观察者间差异问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。