← 最新论文
📄 medicine

Prospective Deployment of Multimodal AI Grading for Medical Student OSCEs

本文报告了 MAPLES 的首次前瞻性部署,这是一种成功整合了笔记、音频和视频来为医学生客观结构化临床考试(OSCE)评分的多模态人工智能系统,该系统展示了与人类评审员的高度一致性,并通过自动化评分与针对性人工复核相结合的混合模式,减少了 92.3% 的人工评分工作量。

原作者: Huong-Tra Ngo, Ameer Hamza Shakur, Michael Holcomb, Shinyoung Kang, David Hein, Judah Gruen, Hunter Schuler, Philip Jarrett, Thomas Dalton, Krystle Campbell, Daniel Scott, Andrew R. Jamieson

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Huong-Tra Ngo, Ameer Hamza Shakur, Michael Holcomb, Shinyoung Kang, David Hein, Judah Gruen, Hunter Schuler, Philip Jarrett, Thomas Dalton, Krystle Campbell, Daniel Scott, Andrew R. Jamieson

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:多模态人工智能在医学系学生 OSCE 中的前瞻性部署

问题陈述

客观结构化临床考试(OSCE)是医学教育中评估临床胜任力的金标准,用于评价病史采集、体格检查、沟通能力和推理能力。然而,传统的 OSCE 管理属于资源密集型,需要经过培训的评估者、人工评分量表以及大量的专家时间。在作者所在的机构(德克萨斯大学西南医学中心),仅对诊疗后文档进行人工评分每年就需耗费约 1,120 小时及 56,000 美元。这些约束限制了评估的频率,延迟了向学习者反馈结果的时间(通常延迟数月),并阻碍了形成性评估的扩展。虽然大语言模型(LLM)在评分书面回答方面已展现出潜力,但全面的 OSCE 评估需要同时评估文本、音频和视频。现有的现成多模态模型在细微的临床评估方面表现出局限性,且关于大规模前瞻性教育部署的证据仍然匮乏。

方法论

作者报告了 MAPLES(用于学习遭遇评分的多模态评估流水线)在德克萨斯大学西南医学中心 2025 年秋季 OSCE 管理过程中的首次前瞻性部署。MAPLES 是一个基于量表的零样本(zero-shot)人工智能系统。

系统架构与工作流

  • 数据摄取: 系统摄取了 222 名二年级医学生在五个站点中的三路同步数据流:书面临床笔记、诊疗音频以及同步的三摄像头视频(面向患者、面向医生及俯视视角)。
  • 评分逻辑: MAPLES 采用了零样本方法。系统上传由教师编写的量表(结构化 Excel 文件),并动态构建每个项目的提示词。未提供特定任务的微调或少样本示例。
    • 文本: 笔记作为纯文本进行处理。
    • 音频: 音频直接进行处理,不经过中间转录,以评估言语内容、语气和亲和力。
    • 视频: 通过自动化预处理步骤(使用零样本分割)隔离体格检查片段,然后再进行评分。
  • 模型配置: 系统采用 Gemini 2.5 Pro (Google DeepMind) 进行推理,设置温度(temperature)为 0,top-p 为 1,并利用结构化输出约束以确保评分符合量表模式。Gemini 2.5 Flash 用于视频分割。
  • 人机协同(Human-in-the-Loop)工作流:
    1. 第一轮 AI 评分: AI 对所有 72,907 个保留的项目级分数进行评分。
    2. 路由机制: 处于底端 5%(笔记)或底端 10%(音频/视频)的学习者被路由至独立的人工复核环节。
    3. 盲法 SPE 复审: 标准化病人评估者(SPE)对路由的项目进行独立重新评分,且对 AI 分数不知情。
    4. 裁决: 若 AI 与 SPE 的评分差异超过预设容差(二元评分为完全匹配;序数评分为 \le1 个类别差异),则升级至医生专家进行最终裁决。医生会同时审查两种评分及证据来源。

研究设计

  • 样本量: 222 名学生,10 个站点形式,每名学生 330–333 个评估项目。
  • 复核集: 28 名学习者被路由进行复核(12 名针对笔记,23 名针对音频/视频,7 名两者皆有)。
  • 裁决集: 616 个真实的争议项(排除数据/量表错误)由医生进行了复核。
  • 治理: 一个多学科监督委员会负责监督模型选择、阈值设定和部署周期,以确保迭代优化。

关键结果

一致性与裁决

  • AI–SPE 一致性: 在路由的低分复核集中,容差一致性(允许序数项存在一个类别的差异)较高:笔记为 85.7%,音频为 89.2%,视频为 92.4%。整体精确一致性较低(72.0%),这主要是由音频/视频评分的复杂性驱动的。
  • 医生裁决: 在 616 个升级的争议项中,医生专家在 76.0% 的情况下支持 AI 分数,在 19.0% 的情况下支持 SPE 分数,另有 5.0% 的情况两者皆不支持。这种对 AI 的偏好在所有模态中均成立,尽管在笔记方面最高(81.6%),在视频方面最低(51.5%)。
  • 分歧方向: 无论 AI 评分高于还是低于 SPE,医生都更倾向于支持 AI,这表明 AI 并非仅仅是在虚高评分。

错误分析

  • SPE 错误: SPE 错误的主要因素是“证据遗漏”(35.1%)和“临床知识不足”(24.4%),通常表现为未能识别术语的语义等效性。
  • AI 错误: AI 错误的主要因素是“评分过于宽松”(37.8%)和“文档位置错误”(25.2%),即 AI 将正确的答案归功于错误的笔记部分。极少数情况(9.4%)涉及“伪造证据”(幻觉)。
  • 量表质量: “量表缺乏特异性”是人类和 AI 产生错误的共同因素,凸显了精准设计量表的必要性。

运营效率

  • 工作量减少: 与单次人工评分的对冲实验(counterfactual single-pass manual workflow)相比,AI 辅助工作流仅需 5,616 次人工评分操作,而后者需要 72,907 次。这代表了 92.3% 的人工评分工作量缩减。
  • 周转时间: 从考试到成绩报告发布的时间从数月缩短至不到两周。
  • 成本: 每次诊疗的边际推理成本估计为 1.73 美元(笔记 0.12 美元,音频 0.28 美元,视频 1.31 美元),不包括固定的开发成本。

意义与主张

本文声称展示了首次在本科医学教育中部署集成的多模态 AI 系统进行 OSCE 评分。作者强调,其核心贡献不在于取代人类判断,而在于重新分配人类精力

  • 运营可行性: 研究证明,多模态 AI 可以嵌入到常规 OSCE 操作中,处理整个样本组的第一轮评分,从而将人类的精力集中在补救措施最为关键的“低分尾部”区域。
  • 专家对齐: 研究发现,在争议裁决中,医生更倾向于支持 AI 的评分而非 SPE 的评分,这表明 AI 系统捕捉到的评估细微差别与专家的临床判断高度一致,甚至在一致性上可能优于传统的 SPE 评估。
  • 系统性改进: 该部署暴露了现状中的系统性问题,包括人类评分者的可靠性、量表质量以及流程效率。作者认为,AI 让教育者能够从“如何评分”转向关注“应该评估哪些技能”(即量表设计与案例设计)。
  • 可扩展性: 零样本、基于量表的设计允许将评分技能迁移到新的站点或修订后的量表中,而无需重新训练模型,从而支持评估频率和范围的扩展。

作者对研究的普适性保持了谨慎态度,指出结果受限于特定机构的基础设施和量表。他们承认存在局限性,包括缺乏全样本的盲法裁决、分析集中在低分尾部,以及需要进一步验证人口统计学公平性和幻觉率。该工作被定位为迈向由教育者管理、由 AI 增强的评估系统的基础性一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →