Expert validation of AI-generated clinical assessment items for physician assistant certification: a multi-dimensional rubric and dual- reliability method
本研究提出并验证了一种用于系统评估人工智能生成的医师助理认证考试题目的多维度量表及双重信度方法,证明了人工智能生成的内容符合专家质量标准,且在学生表现和感知方面与人类编写的问题无异。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何成为一名医生。你不仅希望它能记住事实,还希望它能参加考试、解决谜题,并像人类医学生一样解释其推理过程。这就是**生成式人工智能(Generative AI)**在教育领域的世界。把人工智能想象成一个超快速、不知疲倦的作家,它能在人类教授编写一个问题的时间内,产出数千个练习题。但问题在于:在像物理治疗师(PA)必须通过才能获得执照的高风险考试中,一个糟糕的问题不仅仅是令人恼火,它甚至可能是危险的。如果问题令人困惑或答案错误,学生可能会学到错误的东西。
多年来,我们一直有一套严格的系统来检查人工编写的问题。一个专家团队会阅读每一个问题,以确保其符合规则、清晰且测试了正确的技能。但没人知道如何将这种同样的“专家检查”应用于人工智能。如果人工智能编写了一个问题,你如何知道它是否真的好?它只是华丽的词藻堆砌,还是真正的医学知识测试?本论文填补了这一空白,提出了这样一个问题:我们能否建立一个可靠的清单来验证人工智能生成的医学问题,并且人工智能产生的工作是否真的与人类一样出色?
AI 问题工厂与专家检查员
匹兹堡大学的研究人员决定建立一个使用人工智能为物理治疗师国家认证考试(PANCE)生成练习题的“工厂”。但在让他们使用这些问题之前,他们需要一种检查该工厂产出的方法。他们不能仅仅信任人工智能;他们需要一个人类质量控制团队。
因此,他们创建了一种新的检查工具,就像一份包含五个特定类别的详细评分表。想象一下你正在评判一场烘焙比赛。你不会只说“蛋糕很好”,你会检查:
- 临床-教育一致性: 这个问题是否真的测试了医生需要知道的知识?
- 情景完整性: 故事(患者的症状)是否完整,或者烘焙师是不是忘了放鸡蛋?
- 选项质量: 错误选项(干扰项)是具有迷惑性但公平的,还是显而易见的错误?
- 语言与清晰度: 问题是否易于阅读,还是一个混乱的堆砌?
- 解释质量: 如果学生答错了,解释是否教会了他们“为什么”?
团队使用这份评分表检查了 55 个由人工智能生成的问题。他们邀请了六名资深的 PA 教师担任评委。结果非常出色。这些问题在整体质量量表上的得分非常高(平均为 0.9285 / 1.0),这意味着人工智能成功遵循了高质量问题编写的规则。“问题追踪”(前四个类别)和“解释追踪”(第五个类别)都达到了“优秀”的阈值。
伟大的“共识”之谜
故事在这里发生了一个有趣且引人入胜的转折。当六位专家查看这些问题时,他们大多达成了一致:“是的,这很好。”事实上,他们在问题质量上的共识率约为 88%。
但当研究人员尝试使用一种标准的数学公式(称为 Fleiss' κ)来衡量专家的共识程度时,得出的数值却极低——几乎为零(0.1201)。通常,这样一个低数值意味着专家们意见不一,无法达成共识。但他们确实达成了共识!
论文将此解释为“普遍性悖论”(prevalence paradox)。想象一下一个教室,99% 的学生都得了 A。如果你试图计算学生们对于“谁得了 A”的共识程度,数学计算会变得很奇怪,因为几乎所有人都在做同样的事情。标准公式会被这种“过高的共识”所迷惑,并误认为这只是运气。
为了解决这个问题,研究人员使用了另一种更稳健的数学工具,称为 Gwet's AC1。该工具给出了高分(0.8653),证实了专家们实际上是步调一致的。论文指出,当人工智能表现出色时,我们经常会看到这种模式:高水平的共识在旧式数学看来却是低水平的共识。他们建议我们需要使用这种新工具,以避免在人工智能内容实际上非常优秀时产生恐慌。
“人类 vs. 机器人”盲测
最后,研究人员想知道学生是否能分辨出差异。他们为 10 名医学生进行了一项盲测。学生们回答了 30 个问题:其中 15 个由人工智能编写,15 个由人类编写。他们不知道哪个是哪个。
结果是不分伯仲。学生在 AI 问题上的正确率为 70.0%,而在人类问题上的正确率为 69.3%。从统计学上看,这几乎是平局。AI 生成的问题与人类编写的问题一样难,也一样清晰。
然而,当学生尝试猜测哪些问题是由机器人编写时,他们出错的次数往往高于猜对的次数。他们仅在 52.67% 的情况下猜对(这基本上是抛硬币的概率)。有趣的是,他们存在一种偏见:他们倾向于认为 AI 问题是由人类编写的,但他们更容易识别出人类编写的问题。这表明人工智能在模仿人类说话方面已经做得非常好,但尚未达到完美。
这意味着什么(以及它不意味着什么)
论文得出结论,他们已经建立了一个可以验证用于医学考试的 AI 问题的有效“检查工具”。他们测试的人工智能产生了高质量的内容,通过了专家评审,并在小型学生测试中表现得与人类编写的问题一样好。
然而,作者谨慎地表示,这并不是一个最终的、完美的解决方案。学生测试规模较小(仅 10 人),因此他们称之为“初步的”。他们还指出,人工智能在“选项质量”方面仍存在一点困难——有时错误的选项不够具有迷惑性。他们构建的工具旨在用于其他医学考试,如护理或外科执照考试,但需要在那里先进行测试。
简而言之,人工智能还没有准备好取代老师,但有了这个用来检查其工作的全新“评分卡”,我们或许终于可以利用它来编写那些帮助下一代医生进行备考的练习测试了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。