Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance
本文介绍了 PhysAssistBench,这是一个由真实的 MIMIC-IV 病例构建的新型基准测试,用于评估大语言模型在交互式医患场景中协调临床知识、患者沟通以及电子健康档案(EHR)工具使用的能力,并揭示了尽管模型在各项单一能力上有所提升,但在执行此类综合型医生辅助任务时仍然表现得不可靠。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:“超级实习生”测试
想象一下,在一间医生忙得不可开交的医院里。他们想雇佣一名“超级实习生”(AI)来帮忙。这个实习生需要同时完成三件事:
- 阅读患者病历(电子健康记录或 EHR):瞬间读取信息。
- 与患者交流:获取完整的病情描述。
- 倾听医生:医生非常忙碌,且经常使用简写或缩略语进行沟通。
论文指出,虽然 AI 擅长通过医学考试(就像学生背诵教科书),但我们实际上并不知道它是否能够处理作为医生助手这种复杂、真实的日常工作。为了验证这一点,作者构建了一个全新的、难度极高的测试,名为 PhysAssistBench。
问题所在:“教科书” vs. “现实世界”
把目前的 AI 测试想象成一场驾驶考试,你只需要在空旷的停车场里对着完美的交通锥停好车。AI 在这种测试中表现得近乎完美。
但现实生活不是空旷的停车场,而是高峰时段的交通拥堵。
- 医生: 医生不会说“请检查血压”,而是可能只说“压力怎么样?”或者干脆只说“压力?”(这被称为隐式查询)。
- 患者: 患者不会说“我有高血压”,而是可能说“我的头感觉像个气球,而且我的袜子在脚踝处留下了深深的印记。”(这是歧义沟通)。
- 系统: 医院的计算机要求你必须按照特定的顺序点击特定的按钮才能获取数据。
论文指出,当这三者混合在一起时,目前的 AI 模型就会出错。它们会在“交通拥堵”中迷失方向。
解决方案:“电子游戏”医院
为了对 AI 进行更恰当的测试,研究人员利用来自 MIMIC-IV 数据库的真实、匿名化的患者数据,构建了一个真实的模拟环境。
他们不仅仅是编写问题,而是创建了一个拥有三个角色的电子游戏环境:
- 忙碌的医生: 一个基于真实病例提出简短、模糊问题的 AI。
- “代理型”患者: 一个表现得像真实人类的计算机角色。它拥有医疗档案,但也拥有“个性”。它可能会忘记提到某个症状,或者用俚语来描述症状。它的回答仅基于其真实的病史,而不是编造的故事。
- 医院计算机: 一个严格的系统,只有当你使用正确的数字“钥匙”(工具)进行请求时,它才会提供数据。
接受测试的 AI 必须扮演助手的角色。它必须倾听医生的指令,弄清楚医生的真实意图,向患者询问正确的问题,并检查计算机以获取事实,最后给出一个清晰的答案给医生。
测试流程:四轮混乱挑战
该测试包含 324 个不同的“场景”(类似于不同的患者案例)。每个场景分为四个回合:
- 第一轮: 医生要求获取一个特定事实(例如:“最新的血液检测结果是什么?”)。
- 第二轮: 医生要求更多信息,但使用了缩略语(例如:“还有药物呢?”)。
- 第三轮: 医生根据目前的所有信息提出一项建议(例如:“考虑到这一切,我们该怎么做?”)。
- 第四轮: 医生要求 AI 开具一份新的处方或更新病历。
AI 必须正确完成所有四轮任务才能通过整个场景。如果其中任何一轮出错,整个环节即宣告失败。
结果如何?“超级实习生”踉跄了
研究人员测试了 14 个目前最强大的 AI 模型(包括 GPT-5、Claude 和 Gemini 等知名模型)。
实验结果:
- 好消息: AI 擅长处理简单任务。如果医生问“血压是多少?”,而 AI 只是去查找并回答,它的正确率能达到 80% 以上。
- 坏消息: 当测试变得复杂时,AI 的表现糟糕透顶。
- “缩略语”问题: 当医生使用模糊语言(如“查一下药”)时,AI 经常会对“哪种药”或“检查什么”感到困惑。
- “患者”问题: 当 AI 需要通过与“患者”交谈来获取缺失信息时,其表现显著下降。它更擅长阅读计算机文件,而不擅长进行对话。
- “全或无”问题: 即使是最优秀的模型,也只有约 8% 到 23% 能完美通过整个四轮场景。这意味着在真实的医院环境中,AI 在多步骤对话中出错的概率会比成功的概率更高。
结论
论文得出结论:AI 目前还不足以成为医生在真实医院中可靠的“副驾驶”。
类比:
想象你正在教一个机器人当厨师。
- 旧测试: 你问机器人:“你会切洋葱吗?”它通过了。
- 这个新测试: 你把机器人放进一个忙碌的厨房。主厨大喊:“把汤修好!”机器人必须品尝汤的味道,询问顾客想要什么,检查储藏室里的食材,然后烹饪。
- 结果: 机器人要么把汤烧焦了,要么忘了询问顾客。它知道如何切洋葱,但它不知道如何经营整个厨房。
作者表示,最大的障碍不在于 AI 是否掌握了足够的医学知识,而在于它无法在不产生混乱的情况下,同时协调倾听、交谈和使用工具。他们已经向公众发布了这项测试,以便其他研究人员尝试解决这些特定的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。