Prospective Deployment of Multimodal AI Grading for Medical Student OSCEs
本文报告了 MAPLES 的首次前瞻性部署,这是一种成功整合了笔记、音频和视频来为医学生客观结构化临床考试(OSCE)评分的多模态人工智能系统,该系统展示了与人类评审员的高度一致性,并通过自动化评分与针对性人工复核相结合的混合模式,减少了 92.3% 的人工评分工作量。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:多模态人工智能在医学系学生 OSCE 中的前瞻性部署
问题陈述
客观结构化临床考试(OSCE)是医学教育中评估临床胜任力的金标准,用于评价病史采集、体格检查、沟通能力和推理能力。然而,传统的 OSCE 管理属于资源密集型,需要经过培训的评估者、人工评分量表以及大量的专家时间。在作者所在的机构(德克萨斯大学西南医学中心),仅对诊疗后文档进行人工评分每年就需耗费约 1,120 小时及 56,000 美元。这些约束限制了评估的频率,延迟了向学习者反馈结果的时间(通常延迟数月),并阻碍了形成性评估的扩展。虽然大语言模型(LLM)在评分书面回答方面已展现出潜力,但全面的 OSCE 评估需要同时评估文本、音频和视频。现有的现成多模态模型在细微的临床评估方面表现出局限性,且关于大规模前瞻性教育部署的证据仍然匮乏。
方法论
作者报告了 MAPLES(用于学习遭遇评分的多模态评估流水线)在德克萨斯大学西南医学中心 2025 年秋季 OSCE 管理过程中的首次前瞻性部署。MAPLES 是一个基于量表的零样本(zero-shot)人工智能系统。
系统架构与工作流
- 数据摄取: 系统摄取了 222 名二年级医学生在五个站点中的三路同步数据流:书面临床笔记、诊疗音频以及同步的三摄像头视频(面向患者、面向医生及俯视视角)。
- 评分逻辑: MAPLES 采用了零样本方法。系统上传由教师编写的量表(结构化 Excel 文件),并动态构建每个项目的提示词。未提供特定任务的微调或少样本示例。
- 文本: 笔记作为纯文本进行处理。
- 音频: 音频直接进行处理,不经过中间转录,以评估言语内容、语气和亲和力。
- 视频: 通过自动化预处理步骤(使用零样本分割)隔离体格检查片段,然后再进行评分。
- 模型配置: 系统采用 Gemini 2.5 Pro (Google DeepMind) 进行推理,设置温度(temperature)为 0,top-p 为 1,并利用结构化输出约束以确保评分符合量表模式。Gemini 2.5 Flash 用于视频分割。
- 人机协同(Human-in-the-Loop)工作流:
- 第一轮 AI 评分: AI 对所有 72,907 个保留的项目级分数进行评分。
- 路由机制: 处于底端 5%(笔记)或底端 10%(音频/视频)的学习者被路由至独立的人工复核环节。
- 盲法 SPE 复审: 标准化病人评估者(SPE)对路由的项目进行独立重新评分,且对 AI 分数不知情。
- 裁决: 若 AI 与 SPE 的评分差异超过预设容差(二元评分为完全匹配;序数评分为 1 个类别差异),则升级至医生专家进行最终裁决。医生会同时审查两种评分及证据来源。
研究设计
- 样本量: 222 名学生,10 个站点形式,每名学生 330–333 个评估项目。
- 复核集: 28 名学习者被路由进行复核(12 名针对笔记,23 名针对音频/视频,7 名两者皆有)。
- 裁决集: 616 个真实的争议项(排除数据/量表错误)由医生进行了复核。
- 治理: 一个多学科监督委员会负责监督模型选择、阈值设定和部署周期,以确保迭代优化。
关键结果
一致性与裁决
- AI–SPE 一致性: 在路由的低分复核集中,容差一致性(允许序数项存在一个类别的差异)较高:笔记为 85.7%,音频为 89.2%,视频为 92.4%。整体精确一致性较低(72.0%),这主要是由音频/视频评分的复杂性驱动的。
- 医生裁决: 在 616 个升级的争议项中,医生专家在 76.0% 的情况下支持 AI 分数,在 19.0% 的情况下支持 SPE 分数,另有 5.0% 的情况两者皆不支持。这种对 AI 的偏好在所有模态中均成立,尽管在笔记方面最高(81.6%),在视频方面最低(51.5%)。
- 分歧方向: 无论 AI 评分高于还是低于 SPE,医生都更倾向于支持 AI,这表明 AI 并非仅仅是在虚高评分。
错误分析
- SPE 错误: SPE 错误的主要因素是“证据遗漏”(35.1%)和“临床知识不足”(24.4%),通常表现为未能识别术语的语义等效性。
- AI 错误: AI 错误的主要因素是“评分过于宽松”(37.8%)和“文档位置错误”(25.2%),即 AI 将正确的答案归功于错误的笔记部分。极少数情况(9.4%)涉及“伪造证据”(幻觉)。
- 量表质量: “量表缺乏特异性”是人类和 AI 产生错误的共同因素,凸显了精准设计量表的必要性。
运营效率
- 工作量减少: 与单次人工评分的对冲实验(counterfactual single-pass manual workflow)相比,AI 辅助工作流仅需 5,616 次人工评分操作,而后者需要 72,907 次。这代表了 92.3% 的人工评分工作量缩减。
- 周转时间: 从考试到成绩报告发布的时间从数月缩短至不到两周。
- 成本: 每次诊疗的边际推理成本估计为 1.73 美元(笔记 0.12 美元,音频 0.28 美元,视频 1.31 美元),不包括固定的开发成本。
意义与主张
本文声称展示了首次在本科医学教育中部署集成的多模态 AI 系统进行 OSCE 评分。作者强调,其核心贡献不在于取代人类判断,而在于重新分配人类精力。
- 运营可行性: 研究证明,多模态 AI 可以嵌入到常规 OSCE 操作中,处理整个样本组的第一轮评分,从而将人类的精力集中在补救措施最为关键的“低分尾部”区域。
- 专家对齐: 研究发现,在争议裁决中,医生更倾向于支持 AI 的评分而非 SPE 的评分,这表明 AI 系统捕捉到的评估细微差别与专家的临床判断高度一致,甚至在一致性上可能优于传统的 SPE 评估。
- 系统性改进: 该部署暴露了现状中的系统性问题,包括人类评分者的可靠性、量表质量以及流程效率。作者认为,AI 让教育者能够从“如何评分”转向关注“应该评估哪些技能”(即量表设计与案例设计)。
- 可扩展性: 零样本、基于量表的设计允许将评分技能迁移到新的站点或修订后的量表中,而无需重新训练模型,从而支持评估频率和范围的扩展。
作者对研究的普适性保持了谨慎态度,指出结果受限于特定机构的基础设施和量表。他们承认存在局限性,包括缺乏全样本的盲法裁决、分析集中在低分尾部,以及需要进一步验证人口统计学公平性和幻觉率。该工作被定位为迈向由教育者管理、由 AI 增强的评估系统的基础性一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。