← 最新论文
📄 medicine

Do AI-generated surgical cases improve clinical reasoning? A quasi-experimental comparison in surgical clerkship

这项准实验研究表明,接受 DeepSeek 生成病例训练的外科实习学生,与接受传统专家编写病例训练的学生相比,其临床推理评分显著更高且认知负荷特征更佳,这表明在专家审核的支持下,人工智能生成的内容可以有效地增强医学教育。

原作者: Zhitao Dong, Gang Huang, Li Geng, Ruwen Zhang, Shengxian Yuan, Yong Xia, Hui Liu

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhitao Dong, Gang Huang, Li Geng, Ruwen Zhang, Shengxian Yuan, Yong Xia, Hui Liu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

外科手术不仅是一项体力活,更是一项脑力训练。在外科医生拿起手术刀之前,他们必须学会像侦探一样思考:从患者的病史和症状中搜集线索,权衡不同的可能性,并在信息尚不完整的情况下果断决定行动方案。这种被称为“临床推理”的思维过程,是确保医疗实践安全的引擎。当它发挥作用时,患者能得到正确的治疗;当它失效时,错误便会发生。传统上,医学生通过在老师的指导下研读真实的患者案例(即书面故事)来学习这项技能。然而,为忙碌的医生编写这些故事是一项缓慢且昂贵的工作,而且由此产生的案例集往往显得千篇一律,只向学生展示疾病最典型的版本,而非他们在医院中将面临的那种混乱、复杂的现实。

人工智能最近为这一瓶颈提供了潜在的解决方案。大型语言模型(一种在海量文本上进行训练的计算机程序)现在可以瞬间编写出这些患者故事。但一个关键问题仍悬而未决:阅读由机器编写的故事,是否真的能比阅读由人类编写的故事更能帮助学生提升思考能力?上海的一组研究人员试图通过测试由人工智能系统生成的案例是否能比传统的、由人类编写的案例更有效地提高外科系学生的推理技能,来寻找答案。

该研究在一家中国大型教学医院内分两个为期六个月的阶段进行。研究人员针对两组五年级医学生开展工作,每组包含三十名正在进行外科临床实习的学生。第一组作为对照组,通过研读由资深教员在过去三年中编写的二十四个患者案例进行学习。这些是该系一直使用的标准专家编写的故事。第二组为实验组,他们研习的是另一套不同的二十四个案例。这些案例并非由人类编写,而是由一个名为 DeepSeek 的特定人工智能模型生成的。研究人员仔细匹配了两组案例,确保它们涵盖了完全相同的疾病类型,如阑尾炎、胆囊炎症和肠梗阻,从而确保唯一的重大区别在于谁或什么编写了这些故事。

为了衡量学生的学习效果,研究人员并没有简单地询问他们是否记住了事实或能否从列表中选出正确答案。相反,他们使用了一个先进的数字化平台来绘制出学生的思维路径。当学生处理新的、未见过的患者场景时,系统会追踪他们做出的每一个决策:他们提出了哪些问题,下达了哪些检查指令,以及如何解读结果。这使得研究人员不仅能看到学生是否得到了正确的诊断,还能看到他们是如何得出结论的。他们观察学生是否遗漏了重要步骤、是否过快地下结论,或者是否遵循了专家所认可的逻辑路径。他们还要求学生报告工作的心理负担程度以及对自身能力的信心程度。

结果显示,使用人工智能案例进行训练的学生具有明显的优势。在最终评估中,使用人工智能生成故事的一组在整体推理表现上的得分显著高于使用人类编写故事的一组。这种差异之大足以被视为一次重大的进步。当研究人员对得分进行细分时,他们发现人工智能组在两个特定方面表现更佳:他们在最终诊断方面更加准确,并且在遵循完整的、逻辑严密的探究路径方面做得更好,不会跳步或过早定论。或许最重要的一点是,人工智能组在判断上犯错的次数更少,例如忽略矛盾证据或让最初的直觉蒙蔽了思考。

研究还阐明了这可能发生的原因。使用人工智能案例的学生反映,由于材料呈现方式的不同,他们感受到的心理压力较小,并且觉得自己更有能力建立对学科内容的深度理解。这符合一种学习理论,即当学生接触到多样化的场景时,他们的大脑会被迫努力寻找潜在的模式,而不是仅仅死记硬背一个单一、可预测的故事。人工智能能够毫不费力地生成这些多样的场景。对于每种疾病,人工智能都创建了三个版本:一个看起来很典型,一个症状异常,以及一个因其他健康问题而变得复杂的版本。这种多样性迫使学生进行更灵活的思考。相比之下,人类编写的案例虽然准确,但往往遵循一种标准的模式,这可能导致学生依赖思维捷径。

效率是另一个主要发现。研究人员发现,借助人工智能生成这些案例的速度比手工编写要快得多。人类专家编写一个详细案例可能需要四到八个小时,而人工智能可以在瞬间生成草稿。人类教员仍然发挥着至关重要的作用,他们会对每个人工智能生成的案例进行约十二分钟的审核,以确保其符合医学逻辑且没有危险错误。甚至有一个案例因为人工智能建议了一种对特定患者不安全的药物而被拒绝。这一审核过程意味着,该部门在一年内节省了大约一百六十个教员工时,这些时间可以重新投入到教学和指导工作中。

研究人员谨慎地指出,这种成功取决于“人类专家在场”的机制。人工智能是一个用于生成容量和多样性的强大工具,但它并不完美。它可能会犯错,比如建议错误的药物,因此必须由人类在将作品交给学生之前进行检查。研究还承认,使用人工智能案例的学生之所以表现出色,可能仅仅是因为材料的新颖性带来的动力提升。此外,由于研究是在单一医院针对特定学生群体进行的,结果在其他环境或不同学习群体中可能会有所不同。

尽管存在这些局限性,该研究仍提供了强有力的证据,证明人工智能可以以一种有意义的方式增强医学教育。它表明,通过利用人工智能创建更广泛、更多样化的患者故事库,教育者可以帮助学生培养外科手术所需的灵活且稳健的思维能力。这项技术并不是要取代教师,而是将教师从编写无尽案例文件的繁琐工作中解放出来,以便他们能专注于引导学生的思维。最终目标不是让学生去死记硬背计算机编写的故事,而是训练他们去应对现实生活中的不确定性——在现实中,每一位患者都是一个独特的谜题,无法通过简单的公式来破解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →