Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
本文介绍了 GPBench,这是一个面向全科医学的基于能力的新颖基准,用于评估十个最先进的语言大模型,并得出结论:当前模型尚不适合自主临床部署,需要持续的人工监督和进一步优化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为社区诊所招聘一名新医生。你不会只要求他们背诵教科书中关于发烧的定义;你更希望看到他们如何应对一位真实、棘手且复杂的患者——这位患者既恐惧又困惑,同时患有三种不同的健康问题。
这篇论文本质上是对人工智能(AI)医生,特别是大型语言模型(LLM)的“求职面试”。研究人员构建了一个名为GPBench的新测试平台,以评估这些 AI 模型是否已准备好担任全科医生(GPs)的工作。
以下是他们实验与发现的简要解析,辅以通俗易懂的类比:
1. 问题所在:旧有的测试过于简单
此前,对 AI 医生的测试就像让他们参加基于高中生物试卷的选择题测验。他们能非常出色地回答诸如“法国的首都是哪里?”或“什么会导致头痛?”之类的问题。
但现实生活并非选择题测验。一位真正的医生必须:
- 倾听患者絮叨地描述症状。
- 从五种可能的疾病中找出哪一种是错误的。
- 决定患者是否需要转诊至专科医生,还是可以在诊所继续治疗。
- 以患者能理解的方式解释治疗方案。
- 考虑患者的预算和感受。
旧有的测试并未考察这些“软技能”或复杂推理能力,仅仅检验了 AI 是否记住了事实。
2. 解决方案:逼真的“模拟游戏”
研究人员创建了GPBench,这就像是为 AI 设计的一款高风险模拟游戏。AI 不再仅仅回答问题,而是必须扮演三种不同的角色:
- ** trivia 大师(选择题测试):** 回答 3,661 道多项选择题,以证明其掌握医学事实。
- 侦探(临床病例测试): 阅读真实的匿名患者记录,并像人类医生一样撰写完整的诊断和治疗计划。
- 面试官(AI 患者测试): AI 必须扮演医生角色,向模拟的“患者”(另一个 AI)提出正确的问题,以查明病因。这测试了 AI 是否知道该问“什么”,而不仅仅是知道该说“什么”。
3. 结果:AI 是“书呆子”,而非“医生”
研究人员测试了 10 个当时最智能的 AI 模型(包括 GPT-4、Claude 以及专用医疗 AI),并将它们与不同经验水平的人类医生进行了比较。
以下是他们的发现:
- AI 是事实复述机器: 在 trivia 问题(记忆事实)方面,AI 模型实际上胜过了人类医生。它们就像读遍了图书馆里所有医学教科书并能完美背诵的学生。
- AI 在“侦探工作”上失败: 当面对真实患者病例时,AI 显得力不从心。
- 遗漏线索: 它们经常忽略关键细节,例如未能注意到患者患有严重的心脏病,或漏诊了某种罕见疾病。
- 幻觉(凭空捏造): 有时,AI 会编造不存在的疾病阶段或药物剂量,仅仅为了让答案看起来完整。这就像学生因为害怕留白而胡乱猜测答案。
- 糟糕的问诊: 当扮演医生时,AI 极不擅长提出正确的后续问题。如果患者说肚子疼,AI 可能只会问“你发烧吗?”,而不是深入探究疼痛的具体位置或什么因素会加重疼痛。
- “人情味”的差距: AI 擅长提供通用的健康建议(例如“多吃蔬菜”),但在个性化护理方面却表现不佳。它无法为具有复杂需求的特定个人制定最佳治疗方案。
4. 结论:尚未准备好奔赴一线
该论文得出结论:当前的 AI 模型尚不具备在诊室独立工作的能力。
- 它们需要监督: 就像医学生需要资深医生监督一样,这些 AI 模型也需要人类医生来核查它们的工作。不能信任它们独立做出决策。
- 缺乏“常识”推理: 它们在查找信息方面表现出色,但在处理混乱的现实世界情境、将零散线索串联起来方面却表现糟糕。
- 需要更多训练: 若要真正发挥作用,它们不仅需要基于教科书进行训练,更需要基于人类医生思考、交谈和决策的真实且混乱的过程进行训练。
简而言之: AI 是一部才华横溢的百科全书,能以优异成绩通过书面考试,但目前它仍是一名笨拙、缺乏经验的实习生,需要人类导师的指引以确保患者安全。它尚未准备好取代真正的医生。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。