← 最新论文
💻 computer science

Performance evaluation and benchmarking across 16 large language models on a comprehensive real-world emergency department triage data set

本研究通过对真实世界的急诊科分诊数据进行 16 个大语言模型的基准测试发现,尽管结构化提示可以使模型在严重程度分类上与人类护士达成实质性的一致,但大多数模型仍表现出准确性有限、科室分配不佳、系统性过度自信以及非确定性行为,这表明在经过进一步验证和改进之前,它们尚不具备临床应用的条件。

原作者: Leo Benning, Anja Hirsch, Matthias Gröschel, Tobias Röschl, Martin Spott, Felix Patricius Hans, Tim Urban, Hans-Jörg Busch, Alexander Meyer, Julian Gabriel Madrid

发布于 2026-06-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Leo Benning, Anja Hirsch, Matthias Gröschel, Tobias Röschl, Martin Spott, Felix Patricius Hans, Tim Urban, Hans-Jörg Busch, Alexander Meyer, Julian Gabriel Madrid

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个繁忙的医院急诊室就像一个巨大的、混乱的火车站。每天,成千上万的人带着不同的问题到来,从擦伤的膝盖到心脏病发作。这个“站长”(分诊护士)的工作是观察每一个人,判断他们问题的紧迫程度,并告诉他们该去哪个站台:是前往高频快车(针对危重病例的急诊科),还是前往当地公交站(针对轻微问题的急诊诊所)。

这份工作极其困难。它发生得很快,压力巨大,且决策失误的后果可能关乎生死。

最近,人们一直在问:“我们能不能雇佣一个超级聪明的 AI 机器人(大语言模型或 LLM)来帮助站长?”这些 AI 机器人就像是读遍了图书馆里几乎所有书籍的优秀学生。但它们真的学会如何运营一个火车站了吗?

这篇论文是针对 16 种不同的 AI 机器人在德国一家医院的真实数据上进行的测试报告。以下是研究结果的简单解释:

1. “试驾”过程

研究人员提取了 16,107 份真实的患者记录(已匿名处理,不涉及姓名),并要求 16 种不同的 AI 模型充当分诊护士。它们必须完成两件事:

  • 评定紧急程度: 给患者评分,从 1 分(即刻死亡)到 5 分(轻微不适)。
  • 选择目的地: 将患者送往急诊室(ER)或急诊诊所(Urgent Care Clinic)。

他们将 AI 的答案与实际护士的决定进行了对比。

2. 结果:大多数机器人仍在学习中

如果人类护士是“金标准”,那么大多数 AI 机器人并没有通过这项测试。

  • “平庸”的学生: 大多数 AI 模型的成绩仅为“尚可”到“中等”。它们大约只有一半的时间能与护士的判断一致。
  • “自信”的失败: 这是可怕的部分。即使在出错时,AI 对自己的正确性也表现得极其自信。这就像一个学生做错了数学题,却举手大喊:“我 100% 确定这就是答案!”研究发现,AI 的自我信心与其是否真的正确几乎没有任何关系。
  • “不可靠”的机器人: 如果你问同一个 AI 同一个问题 100 次,它在 23% 的情况下会给出不同的答案。想象一下,你询问 GPS 导航,今天它说“左转”,明天它却说“右转”,尽管交通状况并没有改变。这种“非确定性”行为在医院里是危险的。

3. 秘密武器:“循序渐进”的指南

有一个巨大的惊喜。研究人员尝试用一种特定的技巧来测试其中一个表现最好的 AI 模型。他们不再只是说:“这是一个患者,你怎么看?”,而是给了 AI 一个清单

  • 第一步: 患者是否处于生命垂危状态?
  • 第二步: 是否有高风险症状?
  • 第三步: 他们的生命体征如何?
  • 第四步: 他们需要多少医疗资源?

当 AI 被迫遵循这种循序渐进的逻辑(就像人类护士那样)时,它的表现大幅提升,达到了“显著”水平。它变得几乎和人类护士一样出色。
教训是: AI 有多“大”或多“聪明”并不重要。重要的是你如何提问。给 AI 一个清晰、结构化的规则手册,比让它凭直觉猜测要有效得多。

4. “去哪里”的问题

虽然 AI 在猜测紧急程度评分方面做得还可以(有时),但在决定患者应该去哪里(急诊室 vs 急诊诊所)方面表现得很糟糕。

  • AI 经常把轻微问题的患者送到急诊室(过度分诊),这会堵塞医疗系统。
  • 或者,它把严重的患者送到急诊诊所(分诊不足),这是危险的。
  • 论文指出,这是因为 AI 不了解那家特定医院的“本地规则”,比如哪家诊所在凌晨 3 点还开着,或者哪个建筑拥有正确的设备。

5. 底线结论

论文得出结论:虽然这些 AI 机器人令人印象深刻,但它们还没准备好独自驾驶巴士。

  • 它们太不稳定(它们会改变主意)。
  • 它们太过度自信(它们不知道自己什么时候错了)。
  • 它们需要一个人类“副驾驶”来检查它们的工作。

目前让它们发挥更好作用的唯一方法,是停止将它们视为神奇的“黑箱”,而是开始将它们视为需要严格、循序渐进说明书的学生。在我们能够解决它们的可靠性和信心问题之前,它们不应该独立做出关乎生死的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →