← 最新论文
📄 medicine

Inconsistent and divergent large language model safety guidance during intraoperative crises: a guideline- anchored benchmark

这项研究表明,前沿大语言模型在模拟术中危机时,在提供基于指南的安全指导方面表现出显著的不一致性和差异性,特别是在沟通与升级处置方面,这凸显了评估其可靠性和可重复性而非仅仅评估其综合准确性的必要性,以用于临床决策支持。

原作者: Brian H. Park, Claire S. Soria, Preetham Suresh, Ryan Broderick, Bryan Sandler

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Brian H. Park, Claire S. Soria, Preetham Suresh, Ryan Broderick, Bryan Sandler

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在手术室这种高风险的环境中,秒秒必争。当病人在手术过程中病情突然恶化时,医疗团队必须立即行动,遵循经过数十年完善的严格救生清单。这些协议旨在在造成伤害之前捕捉错误,确保团队沟通清晰、将问题上报给正确的人员,并执行特定的关键操作。随着被称为大语言模型的人工智能工具开始进入医学领域,人们越来越希望它们能作为数字助手,在这些混乱时刻提供实时指导。然而,与依赖训练和经验的人类医生不同,这些计算机程序是根据数据中的模式生成答案的,有时会对同一个问题产生不同的响应。对于患者安全而言,关键问题不仅在于人工智能能否识别问题,还在于它是否能在每次危机发生时,都能始终如一地推荐正确、安全的行动,以及它是否可以被信任,做到不犹豫也不矛盾。

加州大学圣迭戈分校的一个研究小组致力于测试这种可靠性。他们创建了一个严密的模拟实验,涉及十种不同类型的外科紧急情况,从严重出血到气道阻塞及心脏并发症。研究人员并没有简单地要求人工智能诊断问题,而是向模型展示了一个逐步展开的危机过程,并在每个阶段之后询问手术团队下一步该做什么。这些模型接受了针对 150 项特定安全行动的严格测试,这些行动源自既定的医学指南和急救手册。这些行动包括宣布危机、呼救、停止有害操作或执行救命动作等。研究人员对三个领先的人工智能模型分别进行了三次场景模拟,将这些计算机程序视为加入手术室的新成员。其目标是观察模型是否每次都会给出相同的安全建议,还是其指导会发生漂移并发生不可预测的变化。

结果显示出显著且令人担忧的不一致性。当同一个危机场景多次呈现给同一个模型时,计算机并不会给出相同的答案。在 30 种模型与场景的组合中,有 29 种组合中模型识别出的正确安全行动比例在不同运行之间发生了变化。平均而言,同一模型两次运行之间的性能差异非常大,波动接近 15 到 18 个百分点。这意味着如果外科医生在真实的紧急情况下问了两次同样的问题,计算机第二次可能会建议一套完全不同的行动方案,从而可能在第一次时遗漏了某个关键步骤。虽然其中一个模型 Claude Opus 4.6 识别出的正确行动总体上比其他模型更多,但它仍然存在同样的这种不稳定性,且各模型之间总准确率的差异不足以判定出一个明确的胜者。最危险的变化出现在沟通和升级环节。模型经常未能建议团队宣布紧急情况或呼叫额外援助,且它们遗漏这些关键步骤的频率变化剧烈,在相同条件下,一个模型遗漏这些步骤的频率几乎是另一个模型的近三倍。

该研究还检查了模型是否会建议可能对患者造成伤害的行动。幸运的是,在所有受试模型中,这类不安全建议都很少见。然而,模型在安全建议方面表现出的不一致性是一个重大隐忧。研究人员发现,模型通常更擅长建议具体的医疗操作,例如给药或进行手术,但在处理危机管理中更偏向“软性”的团队协作方面——例如组织团队或沟通情况的严重性——则表现得非常吃力。这表明,虽然人工智能可能掌握医学事实,但它并不可靠地理解管理危机所需的团队动态。研究人员得出结论,对于这些工具要在手术室中发挥作用,评判标准不能仅在于它们通常是否正确,而在于它们是否具有一致的可重复性。一个对于同一个问题给出不同安全建议的工具,在患者生命垂危之际是无法被信任来支持医疗团队的。这项研究作为一个基准,为未来的人工智能提供了一把衡量尺,证明了在这些系统用于高压医疗环境时,可靠性与准确性同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →