EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses
本文介绍了 EarlyDx,这是一个针对基于 MIMIC-IV 仅含入院数据的开放式、证据支持型急诊诊断的大规模基准测试,该研究揭示了当前的语言大模型尽管经过了后训练改进,但在利用有限的初始证据可靠地推断诊断方面仍面临困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜题的侦探,但你被允许观察犯罪现场的时间只有最初的五分钟。你的笔记本里写满了线索:一个泥泞的脚印、一扇破碎的窗户,以及一名仍在发抖的目击者。你的任务是在警察到达之前、在实验室检测结果出来之前、在嫌疑人交代之前,去猜测此时此刻究竟发生了什么。这正是急诊科(ER)医生的日常现实。他们必须做出一个“工作诊断”——即根据患者走进门时所能获得的有限信息,对病情进行最好的推测。
长期以来,科学家们一直试图教会计算机从事这项工作,即使用人工智能(AI)。他们构建了“基准测试”,这些就像是衡量机器有多聪明的考试成绩。但大多数此类测试都是“作弊”的。它们给了 AI 关于患者整个住院过程的完整故事(包括几天后得出的最终诊断),然后要求它预测开端。这就像是给侦探提供了谜题的答案,却问他们如何通过线索进行推理。此外,这些测试强迫 AI 从一个简短且固定的列表中选择答案,就像做多选题一样,而不是让他们用自然语言书写自己的答案。这篇名为 EarlyDx 的论文决定纠正这种游戏规则。它构建了一个全新的、更公平的测试,迫使 AI 像真正的急诊科医生一样行动:仅根据入院那一刻可用的证据进行推理,并用自由文本写出诊断结果,就像人类那样。
新的游戏:EarlyDx
研究人员创建了一个巨大的新游乐场,名为 EarlyDx,它由超过 15.4 万次真实的急诊就诊记录组成。想象一下一个庞大的患者故事图书馆。在这个图书馆中,他们仔细地在每个故事被送入医院的那一刻将其切断。他们丢弃了之后编写的所有记录、第二天返回的任何化验结果,以及患者接受治疗后得出的任何最终诊断。他们只保留了“入院时”的证据:患者的年龄、主诉(哪里疼)、生命体征,以及当时进行的任何即时检查,如 X 光或心电监护仪。
但棘手的部分在于,这个图书馆里的“答案”不仅仅是最终诊断。研究人员使用了一个特殊的 AI“审计员”来检查患者档案中记录的每一项诊断。他们问道:“这个诊断是否仅凭我们入院时的证据就能得到证实?”
- 有支持的(Supported): 证据就在那里(例如,X 光显示骨折)。
- 部分支持的(Partially Supported): 证据是一个暗示,但不是板上钉钉(例如,患者有糖尿病史,但我们还没有血液检测结果)。
- 无支持的(Unsupported): 诊断是正确的,但在入院时我们无法得知(例如,需要生长三天才能得到结果的血培养)。
AI 模型仅根据“有支持的”和“部分支持的”答案进行评分。如果 AI 给出的诊断需要我们当时尚不具备的信息,它将得不到任何分数。这确保了测试衡量的是真正的推理能力,而非幸运的猜测或死记硬背最终答案。
大惊喜:AI 依赖显性文本
当研究人员运行测试时,他们发现了一些令人惊讶的事情。他们测试了世界上最聪明的 AI 模型,包括大型通用模型和专业的医疗模型。结果显示,大多数这类“零样本”(zero-shot)模型(即未针对此新测试进行专门训练的模型)在进行诊断“推断”方面表现得很糟糕。
它们并没有像侦探那样思考,而是表现得像一台复印机。大约 43% 的情况下,正确的诊断直接以原话形式出现在患者的记录中(例如,记录写着“疑似肺炎”,AI 就直接复制了“肺炎”)。当 AI 需要进行“推断”——即连接那些并未被明确说明的逻辑点时——这些模型就会崩溃。它们只能找到 3% 到 31% 的隐藏诊断。这就像一个学生,如果答案写在黑板上他就能抄下来,但如果需要自己解数学题,他就会完全失败。
即使研究人员在这一特定任务上对一个较小的 AI 模型进行了“微调”(重新训练),它的表现也变好了许多,但仍未达到人类医生的水平。经过微调的模型可以找到大约 56% 的隐藏诊断,这虽然是一个巨大的进步,但仍然遗漏了许多关键病例。
人为因素与“时间敏感型”差距
研究还通过让一名人类医生查看相同的入院记录,将这些 AI 模型与人类医生进行了对比。人类医生在寻找隐藏线索方面表现得更好,捕捉到了约 68% 的有支持诊断。然而,人类医生也会列出许多种可能性,从而形成一个“鉴别诊断”(即可能是什么疾病的清单)。AI 模型往往要么列出的太少(忽略了危险),要么列出的太杂(过于笼统)。
最令人担忧的发现出现在观察时间敏感型状况(time-critical conditions)时——例如心脏病发作、中风或败血症等生死攸关的紧急情况。在这些情况下,漏诊比误报的后果要严重得多。人类医生会寻求一种谨慎的平衡:他们会标记许多潜在的危险以确保安全。然而,AI 模型在处理这一点时却很挣扎。有些模型因为过于谨慎而错过了危险;有些则因为过于鲁莽而把所有情况都标为危险。目前测试过的没有任何 AI 系统能达到人类医生的水平,即能以正确的置信度说出:“这看起来很危险,让我们检查一下。”
结论
论文得出结论:尽管 AI 在阅读医疗记录方面正在进步,但它尚未准备好取代急诊室所需的人类侦探式工作。目前的模型大多擅长提取(寻找已有的内容),但不擅长推断(弄清楚隐含的意思)。研究人员建议,要让 AI 真正发挥作用,它需要学习如何处理不确定性,学会承认自己的不确定,并标记潜在的危险,而不是仅仅试图猜出最终答案。在此之前,“早期诊断”这一游戏仍是人类的专长,而 AI 只能充当一个虽有帮助但并不完美的助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。