← 最新论文
💻 computer science

Automating the triage of rheumatology outpatient referrals: a comparative evaluation of 23 large language models under simple and advanced prompting

本研究表明,当代大语言模型,特别是在先进提示技术的引导下,能够实现准确率媲美甚至超过人类专家的风湿病转诊分诊自动化,从而有效地消除了对昂贵、大规模模型的的需求。

原作者: Lynden Roberts

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Lynden Roberts

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天,成千上万名饱受关节疼痛、肿胀或僵硬困扰的人向风湿科医生写信寻求帮助。这些被称为“转诊信”的信件如洪水般涌入,专科医生必须从中进行分类。这种分类工作被称为“分诊”(triage),其目的是决定谁需要立即就医(因为其病情可能威胁到器官或生命),以及谁可以安全地等待数周或数月。这项任务由资深医生承担,他们必须阅读复杂且非结构化的文本来做出判断。这是一项高强度、极度耗费精力的工作,夺走了他们看望患者和治疗疾病的时间。当系统运作良好时,病情最严重的患者能得到及时的救助;而当系统失效时,患有快速恶化性自身免疫性疾病的患者可能会等待过久,从而面临永久性损伤的风险。然而,即使是由经验丰富的医生进行分类,这一过程也并非完美;专家之间经常存在分歧,紧急病例有时会被遗漏或延迟处理。

随着转诊数量的增长速度超过了可用专科医生的增加速度,诊所正在寻找利用人工智能提供帮助的方法。具体而言,他们正在测试大语言模型——这类计算机程序通过学习海量文本进行训练,能够理解并生成人类语言。这些模型已经用于回答医学问题和辅助诊断,但目前尚不清楚它们是否能够可靠地处理这种特定的、高风险的分诊任务。核心问题不仅在于计算机能否完成这项工作,还在于它能否像人类团队一样出色,以及使用功能最强大、最昂贵的计算机是否是完成工作的必要条件。

澳大利亚莫纳什健康中心(Monash Health)的一位研究人员致力于通过对 23 种不同的大语言模型进行严格测试来回答这些问题。他们根据真实案例创建了 20 个真实的转诊场景,涵盖了从危及生命的紧急情况到常规疼痛的全方位紧迫程度。为了建立一个正确答案的“金标准”,四位独立的风湿科医生在互不知晓对方决策的情况下,对每一个案例进行了审查,最终为每个案例达成了一个共识的紧急程度等级。随后,研究人员要求这 23 个计算机模型对这 20 个案例进行同样的转诊分类。为了确保结果具有稳定性而非仅仅是运气好,每个模型在处理每个案例时都被要求进行三次决策。实验运行了两次:一次是使用非常简单的指令,仅要求模型对转诊进行分类;另一次则是使用更为详细的指令,该指令详细解释了如何思考该问题,提供了每个紧急程度等级的具体示例,并引导模型关注特定的医学体征,同时忽略疼痛程度等不太相关的因素。

结果揭示了这些机器思考方式的一个清晰模式。当仅给予简单指令时,模型的表现各不相同。规模最大、最先进且最昂贵的模型明显比那些较小、较便宜的模型更准确。在这种简单设置下,为更大的模型支付更多费用确实能换取更好的性能。然而,当研究人员切换到先进且详细的指令时,情况发生了彻底改变。通过这种更好的引导,模型之间的性能差距消失了。较小、较便宜的模型赶上了那些昂贵的模型,成本与准确性之间的联系也随之消失。详细的指令本质上教会了这些较小的模型如何通过推理来解决问题,使它们能够以极低的成本达到与那些“巨头”模型相当的表现。

即便使用了最好的指令,计算机也并非无懈可击。它们仍会犯错,有时会误判患者病情较重,有时则会误判病情较轻。研究人员指出,“低估分诊”(即漏掉紧急病例)是最危险的错误类型,因为它会导致关键治疗的延迟。尽管存在这种风险,顶尖表现的模型在大多数案例中都能匹配人类的共识,通常在三次尝试中都对紧急程度等级给出了正确的判断。这种表现水平处于或高于人类医生的准确度范围,众所周知,人类医生在约三分之一的病例中存在分歧,并且在见到患者后经常会改变其紧急程度评级。

这项研究表明,用于自动化处理此类行政负担的工具已经存在,并且可能比此前认为的更加经济。核心发现是,向计算机提问的方式与计算机本身同样重要。通过使用包含明确规则和示例的精心设计的“提示词”(prompt),诊所或许可以使用较小、较便宜的模型来实现媲美最昂贵系统的效果。这可以让医疗服务将宝贵的时间还给资深医生,使他们从整理信件的工作中解脱出来,从而专注于治疗患者。虽然这项技术前景广阔,但研究人员强调,任何应用于现实世界的系统都必须经过仔细监控,以确保不会遗漏紧急病例,且人类医生必须留在流程中,负责审核最关键的决策。未来的路径包括在真实的实时转诊案例中测试这些工具,并不断完善指令以确保安全性,但现有数据表明,一个可靠的、自动化的风湿科分诊助手已不再是一个遥远的梦想。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →