Applying a Cognitive Diagnostic Model to Assess Clinical Reasoning: Q- Matrix Development and Known-Groups Validity Evidence from a Nationwide Medical Examination
本研究通过使用 DINA 模型,验证了一个用于在韩国全国性医学考试中评估临床推理能力的七属性 Q 矩阵,并由于三年级与四年级学生之间存在显著的掌握度差异,证明了其具有很强的已知组效度。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医疗培训的高风险世界中,像医生一样思考的能力与掌握事实同样至关重要。这种被称为“临床推理”的技能,涉及将零散的患者细节——症状、病史、实验室结果——编织成清晰的诊断和治疗方案。几十年来,医学院一直依赖多项选择题来测试这种能力。然而,这些测试通常只提供一个单一的分数,一个数字只能告诉学生他们答对了多少题,却无法揭示他们的思维过程是怎样的。这就像是知道一名跑者在十分钟内完成了比赛,却不知道他是前半程冲刺后半程慢跑,还是每转弯处都踉跄跌倒。为了真正改善医学教育,教育者需要看到学生具体的思维步骤,准确识别出他们推理过程中的哪些部分很强,哪些部分需要改进。
佳成大学医学院的一位研究人员致力于解决这一问题,通过将一种称为“认知诊断模型”的高级方法应用于韩国一项大规模的国家级医学考试。该研究的目标不再仅仅是统计正确答案的数量,而是旨在绘制出回答每个问题所需的特定思维技能图谱。研究团队分析了近5,600名三年级和四年级医学生的反应。他们首先列出了专家认为对临床推理至关重要的九种不同思维技能,例如解读实验室结果或决定治疗方案。通过仔细审查考试题目并咨询经验丰富的医学教育专家小组,他们将这份清单精简为七种截然不同的技能。随后,他们使用统计模型来观察这七种技能是否能准确解释学生的表现。结果令人瞩目:该模型成功分离了学生的能力,显示出拥有更多临床经验的四年级学生,在这些推理技能上的掌握率始终高于三年级学生。这一发现提供了强有力的证据,证明了新框架的有效性,提供了一种超越简单测试分数、实现对学生思维进行详细、逐项技能诊断的方法。
这一结论的探索始于一个庞大的数据集:2019年第二届临床综合考试,这是一项在韩国全国范围内面向医学生进行的书面测试。研究人员专门针对其中的内科部分,该部分包含144道多项选择题。他们收集了5,586名学生的答案,其中包括2,603名三年级学生和2,983名四年级学生。由于数据完全匿名,研究人员无法查看单个学生的背景,但由于样本量巨大,他们得以观察到推理技能随时间发展的清晰模式。
第一个重大任务是构建一张被称为“Q矩阵”的地图,将每个考试问题与解决该问题所需的特定思维技能联系起来。研究人员从文献综述中提取了九种潜在技能作为起点。这些技能包括解读患者病史、分析体格检查发现、筛选重要信息以及评估病情严重程度等。他们将这九种技能与144道题目进行映射,创建了一份草案地图。为了验证这张地图是否合理,他们观察了不同技能在同一题目中共同出现的频率,并进行了统计检验以确定各技能是否具有区分度。初步数据显示,这些技能具有足够的差异性,但统计检验本身并未提供强有力的证明。
意识到仅凭数字无法说明全部情况,研究人员引入了由四名医学院教师组成的专家小组。这些在医学教育和考试开发领域拥有数十年经验的专家审查了草案地图和统计数据。他们判定某些技能过于相似,不宜分开保留。例如,他们合并了“解读患者病史”和“分析体检发现”这两项技能,因为在实际临床操作中,医生通常会将两者结合使用以发现重要线索。他们还剔除了“筛选重要信息”这一技能,理由是书面考试题目通常已经呈现了经过筛选的信息,因此无法测试寻找信息的能力。此外,他们也精简了“严重程度评估”技能,去除了其中的“紧急程度”组成部分,因为在书面测试中很难进行一致性的判断。经过专家评审后,清单被精炼为七项清晰且独立的技能:区分重要患者信息、解读实验室发现、分析疾病原因、评估进一步检查的必要性、诊断推理、评估严重程度以及做出治疗决策。
在确定了七项技能后,研究人员将认知诊断模型应用于学生的答案。该模型运作逻辑类似于逻辑门:它假设要答对一个问题,学生必须掌握该问题所要求的所有技能。如果学生漏掉哪怕一个必需的技能,模型就会预测其极可能答错(除非是猜对的)。模型计算了每位学生掌握这七项技能中每一项的概率。结果显示,该模型与数据拟合得非常好,准确反映了数千名学生在正确与错误回答中的模式。
这一新框架的真正考验在于研究人员对两组学生的对比。由于临床推理预计会随着学生在医院获得更多实践经验而提高,研究人员预测四年级学生将比三年级学生展现出更高的全项技能掌握率。数据以极其清晰的方式证实了这一预测。对于这七项技能中的每一项,四年级学生都表现出了显著更高的掌握水平。这种差异并非微小的统计偏差,而是一个巨大且一致的差距。四年级学生在各项技能上的掌握率在83%至91%之间,而三年级学生则在50%至65%之间徘徊。这种一致且巨大的差距成为了有力证据,证明了这七项技能是真实存在的,并且模型正确地识别了它们。
研究还查看了总分情况,以了解新方法与传统测试方式的对比。四年级学生的总分明显高于三年级学生,这符合预期。然而,新方法做到了总分无法做到的事情:它将这一巨大的差异分解成了七个具体的组成部分。它表明,推理技能方面的差距与总分的差距同样显著,这证明了该模型并非只是在数据中增加噪声,而是以更详细的方式捕捉到了相同的成长轨迹。
这项研究凸显了医学教育评估方式的转变。多年来,关注点一直在于学生通过或不及格考试。本研究表明,我们现在可以深入观察测试内部,看清学生思维的哪些部分在运作,哪些部分不在运作。本研究确定的七项技能为医学生需要学习的内容提供了一份清晰的蓝图。尽管研究存在局限性,例如使用的题目并非专为这种分析类型而设计,但结果足够稳健,足以证明这种方法是可行的。研究结果表明,在未来,医学考试可以为学生提供一份关于其推理技能的详细成绩单,帮助他们及其老师针对特定领域进行改进,而非仅仅给出一个单一的数字。这种细致程度最终可以确保医生不仅是在记忆事实,而且是在真正掌握护理患者所需的复杂思维能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。