Large Language Models for Automated AGREE II Quality Appraisal of Sepsis Clinical Practice Guidelines: A Methodological Comparative Study
本研究将六种大语言模型与人类专家在针对脓毒症临床实践指南的 AGREE II 评估方面进行了基准测试,结果显示,尽管这些模型实现了中度一致性,但它们表现出持续的特定领域偏差和不同的效率,这表明其最佳角色是作为人类-人工智能混合工作流中的分诊工具,而非作为独立的评估者。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医学的高风险领域,挽救生命的治疗方案通常由临床实践指南来引导。这些指南并非随意的建议,而是经过精心构建的文件,将现有的最佳科学证据综合成清晰的指令。它们指导医疗团队如何管理复杂的疾病,例如脓毒症——这是一种危险的感染反应,会导致器官衰竭并夺走数千人的生命。然而,这些指南的质量差异巨大。有些是基于严谨、透明的方法构建的,而另一些则可能缺乏深度或清晰度。为了从可靠与不可靠的指南中进行甄别,专家们使用一种名为 AGREE II 的特定工具。该工具就像一份详细的清单,针对指南的结构、其证据以及在现实世界中的实用性提出二十三个具体问题。传统上,填写这份清单是一个缓慢且昂贵的过程,需要由高度专业化的专家团队阅读文件的每一个字,并对其优劣进行辩论。随着出版的指南数量增长速度超过了能够阅读它们的专家数量,医学界面临着一个瓶颈:如何在不被庞大数量压垮的情况下确保质量。
这正是人工智能进入故事的地方,特别是被称为“大语言模型”的新一代计算机程序。这些系统在海量文本上进行了训练,展现出了阅读、理解和总结复杂信息的能力。研究人员想知道,这些数字工具是否可以承担起评估医学指南的繁重工作,在人类专家介入之前,充当快速、自动化的初步筛选。一组科学家决定测试这个想法,他们让六种不同的语言模型与一个专家小组进行对决。他们并没有要求计算机去猜测答案;相反,他们向这些模型输入了十一份关于治疗脓毒症的真实世界指南全文,并要求模型使用人类专家已经使用过的严格的 AGREE II 清单对它们进行评分。目标是观察机器是否能像专家一样思考,或者是否会在医学判断的细微之处出错。
结果显示,这种关系虽然前景广阔,但远非完美。计算机模型能够以中等程度与人类专家达成一致,捕捉到文档的总体质量。然而,它们并非简单地模仿人类思维,而是形成了自己独特的错误模式。最显著的发现是,机器在评估指南的“适用性”方面存在一致性的偏差。清单中的这一部分询问文档是否为医生在繁忙的医院中实际应用提供了足够的实用建议,包括成本、设备和当地资源等方面。人类专家通常会对这些部分给出较高的分数,认可了建议背后的实践意图。相比之下,计算机模型始终给出较低的分数。看起来,机器是在寻找关于如何实施治疗的明确、分步骤的指令,并因为指南没有提供这些细节而惩罚了指南,即使这些指南在其他方面是合理的。它们似乎忽略了人类医生本能理解的微妙的现实世界背景。
相反,模型在评估“开发严谨性”时往往过于慷慨。清单的这一部分检查指南是如何创建的,寻找作者遵循严格科学方法的证据。计算机非常擅长识别诸如“系统评价”或“循证”之类的关键词,一旦看到这些术语,它们就会给予高分。有时,即使人类专家认为其方法并不如语言所暗示的那样强大,计算机也会给出高分。机器很好地阅读了文本的表面,但偶尔会错过工作的深层真相。这创造了一种奇怪的动态:计算机对指南的实用部分过于苛刻,而对理论部分的评价又过于宽松。
除了具体的评分外,研究还观察了使用这些不同模型的速度和成本。研究人员测量了每台计算机阅读指南所需的时间以及产生答案所消耗的数字“燃料”。其中一个由中国科技公司开发的模型脱颖而出,表现得最为高效。它产生的评分与人类专家高度一致,仅用十五秒便完成了任务,且消耗的数字资源最少。另一款来自美国主要科技公司的模型运行速度稍慢,成本略高,但其偏差最小,这意味着它的评分最接近人类的平均水平,而不会过度倾向于某一方面。研究发现,对于这项特定的任务,规模更大、更强大的模型并不一定更好;事实上,最高效的模型并不是规模最大或具备最广泛医学知识的模型。这表明,对于这种详细且结构化的工作,遵循特定规则的能力比原始规模更为重要。
研究人员得出结论,这些人工智能工具尚未准备好取代人类专家。如果一家医院仅仅依靠计算机来决定哪些指南足够优秀,他们可能会因为机器对实践细节过于严格而拒绝优秀的文档,或者可能因为机器被华丽的辞藻所迷惑而接受薄弱的文档。相反,这些模型的最佳用途是作为一种分诊系统。它们可以快速扫描数百份指南,标记出那些看起来有前景的指南,并突出显示那些可能需要进一步审查的指南。这将使人类专家能够专注于最困难的案例,特别是那些处于“可接受”边缘的指南。通过这种方式,技术充当了一个强大的助手,处理容量和速度问题,同时将最终的、细致的判断留给那些理解患者护理现实的人。这项研究证实,虽然机器可以阅读文字,但它们仍需要人类来理解其中的含义。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。