← 最新论文
📄 medicine

Concordance of a ChatGPT-4o–based triage model with emergency physician categorization in the emergency department: a prospective observational comparison with emergency medical technicians

这项前瞻性观察性研究发现,在使用相同的结构化临床数据时,基于 ChatGPT-4o 的分诊模型在与急诊科医师分类的一致性方面显著高于急救医疗技术人员,尽管这种一致性反映的是评分者的一致性而非诊断有效性,并伴有对高危患者过度分诊的倾向。

原作者: Zülküf Sergen Ünlü, Murat Seyit, İbrahim Türkçüer, Atakan Yılmaz, Mert Özen, Alten Oskay

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zülküf Sergen Ünlü, Murat Seyit, İbrahim Türkçüer, Atakan Yılmaz, Mert Özen, Alten Oskay

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一个繁忙的急诊室,就像一个巨大的、混乱的火车站。每一分钟都有新的乘客(患者)到达,需要有人决定谁能登上第一班列车(立即护理),谁在站台上等待(中度护理),以及谁可以稍后去售票窗口(低紧急度)。这个过程被称为分诊(Triage)

通常,由人类专家(急诊科医生)做出这些决定。但人类会疲劳、分心,或者受到情绪的影响,因此两位不同的专家可能会对同一位乘客做出不同的分类。

这项研究提出了一个简单的问题:超智能计算机程序(ChatGPT-4o)能否像人类专家一样出色地为这些乘客分类?

以下是研究人员的工作内容和发现,使用了简单的类比:

设置:“分类游戏”

研究人员设置了一个由三名玩家组成的游戏,他们都在观察来自一家土耳其医院的 788 名乘客:

  1. 人类专家(金标准): 一位经过高度训练的急诊科医生。这位医生是“裁判”。
  2. 计算机(新玩家): 一个 ChatGPT-4o 模型。它没有亲眼看到患者;它只阅读了一份关于患者的标准化的事实清单(症状、病史等)。
  3. 分诊技术员(现实世界的玩家): 急诊医疗技术员(EMTs)。他们是这个特定医院前门处负责进行分类的人。他们亲眼看到了患者,就像现实生活中一样。

规则:

  • 医生和计算机都查看了完全相同的书面清单
  • 技术员们则观察了站在他们面前的真实的人
  • 每个人都必须将患者放入三个颜色的箱子中:红色(紧急!)、黄色(稍等一下)或绿色(没事,稍后再去)。

结果:谁赢得了游戏?

1. 计算机 vs. 医生
计算机在模仿医生方面表现得非常出色。

  • 得分: 如果想象一个 1.0 代表完美一致的刻度,计算机和医生的吻合度约为 84%(得分 0.84)。
  • 隐喻: 这就像一个学生如此彻底地研究了老师的答案解析,以至于他们在考试中写下了完全相同的答案。他们在分类患者的方式上几乎是完全一致的。

2. 计算机 vs. 分诊技术员
计算机的表现也优于实际站在门口的人类技术员。

  • 得分: 技术员与医生的吻合度仅为 63%
  • 差距: 计算机在匹配医生的选择方面明显优于技术员。

3. “红色”箱子问题(陷阱)
这里变得棘手了。红色箱子是为生命垂危的紧急情况准备的。漏掉一名红色患者是危险的。

  • 技术员: 他们非常谨慎。如果他们把某人归入红色,通常是正确的(准确率 8 7%)。然而,他们漏掉了许多实际的紧急情况,将 45 名关键患者错分到了“黄色”箱子中。他们属于分诊不足(过于保守)。
  • 计算机: 它捕捉到了几乎所有的关键患者(92% 的“红色”患者被正确识别)。但是,它也非常“疑神疑鬼”。它将 28 名实际上属于“黄色”的人分到了“红色”箱子中。
  • 隐喻: 计算机就像一个保安,只要闻到一点烟味就会大喊“着火啦!”。它救下了所有真正着火的人,但也造成了大量的虚假警报,导致那些并不需要紧急出口的人堵塞了出口。

重要警告(细则)

作者非常谨慎,并没有说计算机在现实生活中比医生“更好”。原因如下:

  • “共享教科书”偏差: 计算机和医生都是在查看相同的书面笔记。而技术员是在观察。因为计算机和医生使用的是相同的资料来源,所以他们更有可能达成一致。这就像两个人在批改试卷,而他们手里都拿着答案解析;他们之间的一致性会高于那个只能根据学生潦草字迹进行猜测的人。
  • 缺乏“现实世界”测试: 这项研究并未检查患者的病情是否因此好转或恶化。它只检查了计算机是否同意医生的观点。我们不知道计算机的“红色”判定是否真的挽救了生命,还是仅仅浪费了资源。
  • 遗漏最严重的病例: 该研究排除了最严重的患者(那些处于昏迷状态或需要立即进行心肺复苏的患者)。因此,我们不知道计算机如何处理最极端的紧急情况。
  • 单一医生: “金标准”仅仅是一个人的观点。如果这位医生那天状态不佳或有特定的偏见,计算机也会仅仅复制这种偏见。

核心结论

这项研究是一个概念验证。它就像是在展示一种新型发动机可以在高速测试跑道上运行。

  • 它证明了: ChatGPT-4o 模型可以通过阅读患者病历,几乎完全按照专科医生的标准进行分类,并且在这一特定环境下,它的表现比一线技术员更具一致性。
  • 它没有证明: 它并没有证明计算机目前可以在真实医院中安全使用。它倾向于过度判定紧急情况(虚假警报),而且我们不知道它在处理最严重的患者或面对不同语言和医院系统时表现如何。

研究人员总结道,这项技术很有前景,但在能够取代或辅助现实急诊室中的人类之前,还需要进行更多的测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →