Inverted validity arguments in the evaluation of India’s national professionalism curriculum: a systematic review
这项系统综述揭示了评估印度国家 AETCOM 专业精神课程的相关文献在方法论上存在缺陷且呈现“倒置”现象,即基于薄弱的设计和修饰性的结论提出了大量且自信的有效性主张,却未能提供必要的证据来确定该课程是否真正改善了现实世界的医疗实践。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位厨师,正试图弄清楚一种政府强制规定的“完美汤”新食谱是否真的让人们变得更健康了。在医学教育的世界里,这个食谱被称为 AETCOM——这是一个旨在教导未来的医生如何变得仁慈、有道德且擅长与患者沟通的国家项目。但棘手的部分在于:你如何知道这碗汤是否真的奏效?你不能只问厨师他们是否觉得汤的味道很好,也不能只看配料表。你必须观察当这碗汤被端到真实的餐厅并提供给真正的顾客时会发生什么。这就是“评估”科学发挥作用的地方。评估是一个检查一项课程是否在现实世界中真正改变了行为的过程,而不仅仅是在教室里。为了正确地做到这一点,科学家们使用了几个宏大的概念:“效度”(Validity),就像是检查你的尺子测量的是长度而不是温度;“迁移训练”(Transfer of Training),它询问你在厨房学到的东西是否真的能帮助你在餐厅忙碌时更好地烹饪;以及“润色”(Spin),即当有人写一份报告,将一个小小的成功描述成一场巨大的胜利。
现在,想象有一组侦探——研究人员 Siddalingaiah 和 Masali——决定调查关于这个“完美汤”食谱的报告堆。他们没有仅仅问:“这汤管用吗?”他们问了一个更奇怪的问题:“我们现有的这些报告,是否有能力回答那个问题?”他们查看了 2015 年以来试图测试 AETCOM 课程的数十项研究。他们的发现有点像是走进一个房间,里面每个人都在大喊这汤简直太棒了,但却没有人真的在餐厅里品尝这碗汤。相反,他们只是在厨房里品尝原材料,或者只是询问厨师的感觉如何。
侦探们发现,研究报告中所呈现的“成功规模”,完全取决于测试是如何设置的,而不是取决于汤本身有多好。当老师在课后立即对自己的学生进行评分时,结果非常巨大且辉煌,就像是在一个 1 分就已经很优秀的量表中得到了 3.49 分。但当研究人员寻找那仅有的两项真正对比了接受过培训的学生与未接受培训学生的实验时,这种魔力消失了。分数降到了微小的 0.12。这就像是第一组测试者使用了一个放大镜,让一切看起来都变大了,而第二组则使用了一面朴实、诚实的镜子。论文表明,测试规则越“宽松”(或越不严谨),所报告的成功看起来就越大。
更有趣的是,研究人员注意到了一种奇怪的“润色”模式。他们发现,在 75% 的报告中,作者提出的主张远远超出了他们实际测量的内容。这就像是一个学生在拼写测试中得了“A”,然后却在报告中写道:“这证明我将获得诺贝尔文学奖。”这些研究测量的是诸如“学生的感觉”或“他们在测试中的知识水平”之类的内容,但报告却声称这些研究证明了医生现在的诊疗行为更好,或者诉讼将会消失。事实上,89% 的报告所声称的内容都超出了其证据所能支持的范围。它们在证据最匮乏的地方表现得最为自信。
论文还指出,几乎没有人检查“工作场所条件”。你可以这样想:你可以教一名司机在空旷的停车场里完美停车,但如果真实的城市街道拥堵、拥挤,而且老板要求司机开快点,他们可能还是会撞车。研究人员发现,只有 5% 的研究检查了医生的主管是否支持这种新行为,只有 12% 的研究检查了医生是否有机会练习所学到的内容。如果不了解“停车场”是否开放,你就不能责怪司机停车没停好,也不能责怪驾驶学校。
那么,结论是什么?这篇论文并不是在说 AETCOM 课程不好,或者它不起作用。它是在说,我们目前测试它的方式是破碎的。证据基础是“倒置的”:它在最薄弱的地方表现得最响亮、最自信。作者得出结论,我们目前还无法判断该课程是成功还是失败,仅仅是因为我们还没有建立起一套能够观察到当医生在真实医院处理真实患者时,这些课程是否真正扎根的测试系统。他们建议我们需要停止使用“放大镜”式的测试,转而建立一个观察现实世界发生情况的系统,检查环境是否允许这些新技能的使用。在此之前,那些关于拯救生命和修复关系的宏大主张仍然仅仅是——主张,而非经过证实的实事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。