← 最新论文
📄 other

AI versus Expert Feedback on Ethical Decision-Making in Medical Students: A Pilot Randomized Controlled Feasibility Trial with Exploratory Educational Outcomes

这项试点随机对照试验表明,人工智能生成的反馈是医学伦理教育中替代专家小组反馈的一种可行且可接受的选择,尽管存在基线不平衡的问题且需要更大规模的确认性研究,但其初步结果显示出相当或可能更优的效果。

原作者: Tuğba İş Kara, Yavuz Selim Kıyak

发布于 2026-07-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Tuğba İş Kara, Yavuz Selim Kıyak

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

请将医学院的课堂想象成一个巨大的、高风险的训练场,未来的医生在这里不仅学习如何修复骨折,还学习如何应对人类生活中那些混乱且模糊的灰色地带。这是一个学生必须学习平衡规则、情感与艰难抉择的地方——比如决定谁能获得稀缺资源,或者如何向家属告知坏消息。几十年来,教授这些“伦理肌肉”的最佳方式是让一位人类专家(就像一位睿智的教练)来评审学生的选择,并解释为什么某个决定是好是坏。但问题在于:要为每一位学生都找到足够的睿智教练是非常困难的,而且会占用他们大量的精力。

于是,人工智能(AI)登场了,它是那个能以闪电般速度进行聊天、写作和解谜的数字大脑。研究人员提出的核心问题是:这个数字大脑能否充当人类教练的替代品?具体来说,AI 生成的反馈是否能像一组人类专家一样,帮助学生做出更好的伦理选择?这并不是要完全取代人类,而是看一种“经由人类审核的 AI”能否成为一个可扩展的“侧翼助手”,在不让教职人员精疲力竭的前提下提供同样的指导。如果这行得通,这意味着无论班级规模有多大,每位医学生都能拥有专属的伦理导师。


伟大的反馈对决:人类教练 vs. AI 助手

在最近的一项试点研究中,研究人员设计了一个迷人的实验,旨在观察机器人的建议是否能与一间充满人类专家的房间抗衡。他们收集了 56 名六年级医学生(基本上是即将毕业的实习医生),并将他们分为两组。两组人都玩同一个名为“判断一致性学习工具”(CJLC)的伦理视频游戏。你可以把这个工具想象成一个模拟器,学生在其中面临棘手的场景,做出选择,然后根据他们的选择与专家的做法相比如何来获取反馈。

转折点在于,两组获得的反馈来源不同。一组收到了由 25 名人类专家组成的专家组撰写的笔记;另一组则收到了由 AI 生成的笔记,但设置了一个安全网:AI 的输出内容首先经过人类专家的检查和批准,以确保它没有产生幻觉或表现异常。目标是观察 AI 组的学习效果是否能与人类组持平。

结果:AI 展现出令人惊讶(但需谨慎对待)的领先优势

当学生参加一项名为“客观结构化视频考试”(OSVE)的测试时——这类似于一种视频测验,要求他们在场景中识别出正确的伦理举措——结果呈现出一种起伏不定的态势。

首先,在起跑线上出现了一个小插曲。在培训开始之前,AI 组的得分就已经高于人类组了。这就像是一场比赛还没开始,其中一支队伍就已经领先了五米。AI 组的平均起始分数为 23.32,而人类组的起始分数为 19.36。这并非微小的差距,而是一个显著的差距。

培训结束后,两组都有所进步。AI 组的最终平均分为 27.29,而人类组则落在 23.32。当研究人员使用一种统计技巧来调整由于初始差异(基准线差异)带来的影响时,AI 组看起来依然是赢家。调整后的数学计算表明,AI 的反馈可能带来了约 4.50 分 的提升。

然而,研究人员非常谨慎,并没有急于庆祝。当他们观察每个学生的实际进步程度(从开始到结束的变化量)时,两组的表现是完全一致的。两组的进步分数均为 3.96 分。这是一个平局。这表明,虽然 AI 组最终的分数更高,但他们可能只是起步较好,而不是 AI 教会了人类无法教授的东西。

其他测试的表现如何?

研究还检查了另外两项指标:衡量学生处理不确定性能力的“剧本一致性测试”(SCT),以及观察学生是否存在思维定式或偏见的“BIAS 量表”。在这些领域,AI 与人类是不分伯仲的。两者之间没有任何差异。AI 没有击败人类,但也并未落后。它的表现与人类专家一样出色,或者说,仅仅是同样“平庸”。

学生的评价

三个月后,参与反馈的志愿者们似乎非常喜欢这次体验。在回应的 21 名学生中,高达 95.2% 的人表示他们会向其他医学生推荐这项培训。他们认为场景非常真实,并觉得这有助于他们更快地思考伦理问题。不过,他们也指出一个主要障碍:在现实世界中,即使你知道上司或资深医生在伦理上是错误的,也很难去挑战他们。

底线结论

那么,AI 赢了吗?研究表明,AI 生成的反馈是可行且可接受的。它并没有失败;事实上,它没有表现出比人类专家更差的迹象。数据甚至暗示,它在帮助学生证明其决策合理性方面可能略胜一筹,但研究人员提醒我们要对此保持审慎。因为 AI 组的初始得分较高,且样本量较小,我们不能断定 AI 是更优秀的老师。

可以将这项研究视为一次成功的彩排。它证明了受人类监督的 AI 教练可以在不崩溃系统的情况下顺利完成任务。但要了解它是否真的是“最有价值球员”(MVP),我们还需要更大的赛场、更多的球员以及更公平的起跑线。目前,AI 是一个极具前景的侧翼助手,准备协助人类专家,共同教导下一代医生如何做出正确的选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →