← 最新论文
📄 medicine

Standard Setting in the Era of Workplace-Based Assessment: A Pilot Exploration

这项初步研究表明,三种既有的标准设定方法(Angoff、Bookmark 和 Construct Mapping)可以可行且可靠地应用于纵向工作场所评估数据,以界定一个具有辩护性的外科学毕业标准,其提出的 582 分切分值得到了结果趋同性和定性见解的支持。

原作者: Alyssa A Pradarelli, Kayla M Marcotte, Brian C George, Tyler J Loftus, James R Korndorffer, David T Hughes, Gifty Kwakye, Sophia K McKinley, Erin M White, James N Lau, Jordan D Bohnen, Andrew E Krumm

发布于 2026-06-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Alyssa A Pradarelli, Kayla M Marcotte, Brian C George, Tyler J Loftus, James R Korndorffer, David T Hughes, Gifty Kwakye, Sophia K McKinley, Erin M White, James N Lau, Jordan D Bohnen, Andrew E Krumm

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位主厨,正试图决定一名烹饪专业的学生何时已经准备好离开厨房并开设自己的餐厅。在过去,你可能只需观察他们做一道特定的菜(比如舒芙蕾),然后做出判断:“是的,他们能应付得了这道菜。”但今天,医学院正转向一种模式:观察学生在数年内制作许多不同的菜肴,并收集大量关于他们在真实厨房(手术室)中表现的数据。

问题在于,没有人知道如何将这些长期的、海量的数据转化为一个清晰、明确的“合格”或“不合格”的标准线。

这篇论文就像是一次试点测试,一组 10 名专家级主厨(外科教育者)尝试通过三种不同的测量工具来研究如何画出这条线。以下是他们的做法和发现,用简单的方式解释如下:

目标:寻找“毕业线”

研究人员想要找到一个特定的分数,用来表示:“这个学生已经准备好独立执业了。”他们使用了一个名为 SIMPL 的数字化工具,该工具根据学生在手术中的表现给出 372 到 628 之间的评分。目标是找到该量表上的确切数字,即学生达到“具备执业能力”的临界点。

三种测量工具

专家们尝试了三种不同的方法来设定这条线,类似于你尝试用不同方法来猜测房价:

  1. “Angoff”法(心理推测):

    • 运作方式: 专家们被要求想象一个“勉强及格”的学生。然后,针对清单上的每一场手术,他们必须猜测:“这个勉强及格的学生能出色完成这场手术的概率是多少?”
    • 类比: 这就像是要求一群裁判去想象一名刚好够快以进入奥运会水平的选手,然后去猜测这名选手能跨过多少个栏架。
    • 结果: 这对专家来说非常困难。他们觉得这太复杂了,大脑在为每一场手术去构思那个“勉强及格”的学生时,会感到非常疲劳。
  2. “书签”(Bookmark)法(阶梯法):

    • 运作方式: 他们将一系列手术按照数据从“最简单”到“最难”进行排列。然后,专家们被要求在学生开始失败的那个位置放下一个“书签”。
    • 类比: 想象一个梯子,每一级台阶代表一场手术。专家们必须说:“好吧,学生可以爬到这一级,但如果再往上走,他们就会掉下来。”
    • 结果: 专家们在如何排列这些“台阶”的顺序上无法达成一致。一些手术似乎并不符合计算机建议的顺序,这让他们对自己的答案感到不确定。
  3. “结构映射”(Construct Mapping)法(热力图):

    • 运作方式: 这是最受欢迎的方法。专家们观察一张彩色的“热力图”(显示概率的图表)。这张图表向他们展示了具有特定分数的学生完成特定手术的可能性。他们可以一次性看到全局。
    • 类比: 这不是在猜测或攀爬阶梯,而是像看一张天气图。你可以看到风暴云(困难的手术)和晴朗区域(简单的手术),然后可以说:“好吧,如果温度(分数)在这里,那么学生就可以安全地出门了。”
    • 结果: 专家们非常喜欢这个方法。它快速、利用了真实数据,并且帮助他们看到一个单一的分数是如何应用于许多不同手术的。

重大发现

当专家们完成工作后,他们对比了使用三种不同工具所画出的“合格”线。

  • Angoff 建议的线在 577 左右。
  • Bookmark 建议的线在 588 左右。
  • Construct Mapping 建议的线在 582 左右。

令人惊讶的是: 尽管工具完全不同,但他们画出的线几乎是一样的。在统计学上,它们之间没有显著差异。这让研究人员确信,582 是一个可靠的、可以作为毕业起点的分数。

专家们的看法(“人性化”的一面)

虽然数字很接近,但专家们对过程也有一些想法:

  • 定义“准备就绪”: 对他们来说,很难就什么是“最低限度胜任”的学生达成共识。是指那些刚好足够优秀到可以毕业的人,还是指那些明天就能成为外科医生的水平?他们很难停止去思考“完美”的外科医生,而专注于关注“足够好”的医生。
  • 复杂性: 他们发现很难考虑到特定手术的难度。他们一致同意将标准设定在“常规/简单”病例上,而不是最难的病例上。
  • 胜出者: 他们更倾向于使用热力图(结构映射法),因为这种方法最高效,并且能帮助他们同时可视化跨越多种手术的标准。

底线结论

这项研究证明,你可以将大量的长期表现数据转化为一个清晰、公平的毕业标准。他们发现,三种不同的测量方式都导向了相同的结果,这使得结果是值得信赖的。

他们提出将 582 分作为新的标准。如果学生达到这个分数,数据表明他们有 88–90% 的机会能够完成腹腔镜阑尾切除术,有 83–85% 的机会完成胆囊切除术,以及 76–80% 的机会完成结肠手术。

简而言之:他们找到了一种可靠的方法,来衡量一名外科实习生何时准备好独自上场,并且他们发现,通过观察“大局”(热力图)是实现这一目标的最佳方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →