← 最新论文
💬 NLP

Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark

本文介绍了 GPBench,这是一个面向全科医学的基于能力的新颖基准,用于评估十个最先进的语言大模型,并得出结论:当前模型尚不适合自主临床部署,需要持续的人工监督和进一步优化。

原作者: Zheqing Li, Yiying Yang, Jiping Lang, Wenhao Jiang, Junrong Chen, Yuhang Zhao, Shuang Li, Dingqian Wang, Zhu Lin, Xuanna Li, Yuze Tang, Jiexian Qiu, Xiaolin Lu, Hongji Yu, Shuang Chen, Yuhua Bi, Xiaof
发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheqing Li, Yiying Yang, Jiping Lang, Wenhao Jiang, Junrong Chen, Yuhang Zhao, Shuang Li, Dingqian Wang, Zhu Lin, Xuanna Li, Yuze Tang, Jiexian Qiu, Xiaolin Lu, Hongji Yu, Shuang Chen, Yuhua Bi, Xiaofei Zeng, Yixian Chen, Lin Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为社区诊所招聘一名新医生。你不会只要求他们背诵教科书中关于发烧的定义;你更希望看到他们如何应对一位真实、棘手且复杂的患者——这位患者既恐惧又困惑,同时患有三种不同的健康问题。

这篇论文本质上是对人工智能(AI)医生,特别是大型语言模型(LLM)的“求职面试”。研究人员构建了一个名为GPBench的新测试平台,以评估这些 AI 模型是否已准备好担任全科医生(GPs)的工作。

以下是他们实验与发现的简要解析,辅以通俗易懂的类比:

1. 问题所在:旧有的测试过于简单

此前,对 AI 医生的测试就像让他们参加基于高中生物试卷的选择题测验。他们能非常出色地回答诸如“法国的首都是哪里?”或“什么会导致头痛?”之类的问题。

但现实生活并非选择题测验。一位真正的医生必须:

  • 倾听患者絮叨地描述症状。
  • 从五种可能的疾病中找出哪一种是错误的。
  • 决定患者是否需要转诊至专科医生,还是可以在诊所继续治疗。
  • 以患者能理解的方式解释治疗方案。
  • 考虑患者的预算和感受。

旧有的测试并未考察这些“软技能”或复杂推理能力,仅仅检验了 AI 是否记住了事实。

2. 解决方案:逼真的“模拟游戏”

研究人员创建了GPBench,这就像是为 AI 设计的一款高风险模拟游戏。AI 不再仅仅回答问题,而是必须扮演三种不同的角色:

  • ** trivia 大师(选择题测试):** 回答 3,661 道多项选择题,以证明其掌握医学事实。
  • 侦探(临床病例测试): 阅读真实的匿名患者记录,并像人类医生一样撰写完整的诊断和治疗计划。
  • 面试官(AI 患者测试): AI 必须扮演医生角色,向模拟的“患者”(另一个 AI)提出正确的问题,以查明病因。这测试了 AI 是否知道该问“什么”,而不仅仅是知道该说“什么”。

3. 结果:AI 是“书呆子”,而非“医生”

研究人员测试了 10 个当时最智能的 AI 模型(包括 GPT-4、Claude 以及专用医疗 AI),并将它们与不同经验水平的人类医生进行了比较。

以下是他们的发现:

  • AI 是事实复述机器: 在 trivia 问题(记忆事实)方面,AI 模型实际上胜过了人类医生。它们就像读遍了图书馆里所有医学教科书并能完美背诵的学生。
  • AI 在“侦探工作”上失败: 当面对真实患者病例时,AI 显得力不从心。
    • 遗漏线索: 它们经常忽略关键细节,例如未能注意到患者患有严重的心脏病,或漏诊了某种罕见疾病。
    • 幻觉(凭空捏造): 有时,AI 会编造不存在的疾病阶段或药物剂量,仅仅为了让答案看起来完整。这就像学生因为害怕留白而胡乱猜测答案。
    • 糟糕的问诊: 当扮演医生时,AI 极不擅长提出正确的后续问题。如果患者说肚子疼,AI 可能只会问“你发烧吗?”,而不是深入探究疼痛的具体位置或什么因素会加重疼痛。
  • “人情味”的差距: AI 擅长提供通用的健康建议(例如“多吃蔬菜”),但在个性化护理方面却表现不佳。它无法为具有复杂需求的特定个人制定最佳治疗方案。

4. 结论:尚未准备好奔赴一线

该论文得出结论:当前的 AI 模型尚不具备在诊室独立工作的能力。

  • 它们需要监督: 就像医学生需要资深医生监督一样,这些 AI 模型也需要人类医生来核查它们的工作。不能信任它们独立做出决策。
  • 缺乏“常识”推理: 它们在查找信息方面表现出色,但在处理混乱的现实世界情境、将零散线索串联起来方面却表现糟糕。
  • 需要更多训练: 若要真正发挥作用,它们不仅需要基于教科书进行训练,更需要基于人类医生思考、交谈和决策的真实且混乱的过程进行训练。

简而言之: AI 是一部才华横溢的百科全书,能以优异成绩通过书面考试,但目前它仍是一名笨拙、缺乏经验的实习生,需要人类导师的指引以确保患者安全。它尚未准备好取代真正的医生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →