← 最新论文
📄 allergy and immunology

Can Large Language Models Diagnose Primary Immunodeficiency from Patient-Described Symptoms?

这项研究表明,虽然大语言模型能够有效地从医生撰写的病史中识别原发性免疫缺陷,但当依赖患者对症状的自身描述时,其诊断准确性会显著下降,这凸显了基于医学输入语言和框架的性能方面的关键差距。

原作者: Reteig, L. C., Woloshin, S., Maglione, P. J., Farmer, J. R., Ong, M.-S.

发布于 2026-10-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Reteig, L. C., Woloshin, S., Maglione, P. J., Farmer, J. R., Ong, M.-S.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

对于数百万人来说,寻求医疗诊断的过程并非一条直线,而是一段漫长且令人困惑的旅程。对于那些患有罕见疾病的人来说尤其如此,因为这些疾病的症状可能模糊、常见,或者极易被误认为是其他疾病。近年来,许多人转向了一种新型的助手:大语言模型。这些是经过海量文本训练的高级计算机程序,能够进行对话并回答有关健康的问题。它们已成为人们在见到专家之前,试图理解自身身体状况的首选资源。但一个关键问题仍然存在:当患者是问题的描述者时,这些数字工具真的能理解患者吗?答案很大程度上取决于说话者的身份。当医生使用精确的医学术语总结病例时,计算机能完美理解;但当普通人用日常语言描述他们的疼痛、疲劳或反复感染时,计算机往往会迷失方向。

一组研究人员致力于测试这种专家语言与患者语言之间的差距,重点研究了一类被称为原发性免疫缺陷的罕见疾病。这些疾病是指身体的自然防御系统(通常用于对抗病菌)出现故障或缺失。这类患者经常生病,有时甚至会出现需要住院治疗的严重感染,并且面临自身免疫性疾病等其他并发症的高风险。由于这些疾病既罕见又复杂,患者往往要等待多年才能获得正确诊断,这种延迟可能是危险且令人心力交瘁的。在等待期间,许多人会通过聊天机器人寻找答案。研究人员想要了解,如果描述直接来自患者而非医生,这些聊天机器人能否识别出免疫系统功能障碍的迹象。

为了查明真相,研究人员收集了二十一名已经确诊为原发性免疫缺陷的成年人的经历。这些人全都经历了漫长的诊断延迟。团队要求他们描述最初让他们觉得身体不对劲的症状。研究人员提取了这些原始、未经编辑的描述——完全按照患者的原话,保留了所有的犹豫、重复和日常用语——并将它们输入到一个强大的大语言模型中。他们去除了任何关于最终诊断的提及,因此计算机必须仅依靠症状来进行判断。目标很简单:计算机是否会建议该患者可能患有原发性免疫缺陷,或者至少识别出其免疫系统存在问题?

结果显示,计算机在处理专家输入与患者输入时的表现存在显著差异。在之前的一项使用相同计算机模型的研究中,当医生使用专业医学语言编写病史时,计算机在 96% 的案例中正确识别了该疾病,表现近乎完美。然而,当研究人员使用患者自己的语言时,计算机的表现大幅下降。它仅在 21 例中的 7 例中正确识别出了原发性免疫缺陷,比例约为三分之一。尽管患者描述的是完全相同的疾病,但计算机在大多数情况下未能指出具体的病症。

尽管未能给出具体诊断,但计算机并非完全没有帮助。在 21 例中的 17 例中,它暗示患者可能存在普遍的免疫系统问题,即使它未能命名特定的罕见疾病。这是一个重要的发现,因为它表明该工具仍可以作为一个有用的信号。对于那些被多位医生告知症状只是压力或过敏的患者来说,计算机建议“免疫系统问题”可能会鼓励他们去寻求专科医生的帮助。然而,研究也表明,计算机经常会猜测其他更常见的疾病。它频繁地建议过敏、环境因素(如空气质量差)或内分泌问题(如甲状腺问题)。这些是医生首先会考虑的情况,但也可能成为那些真正患有罕见免疫疾病的人的死胡同。

研究人员发现,当患者的故事包含三个特定线索时,计算机最有可能得到正确的诊断:童年时期开始的感染、需要住院治疗的严重感染,或者并非感染类的症状(如生长发育迟缓或消化系统问题)。当患者以这些清晰、经典的描述方式讲述挣扎时,计算机更有机会将线索联系起来。但当描述较为微妙或侧重于整体不适感时,计算机就会感到吃力。这凸显了一个根本性的弱点:该工具对讲述方式高度敏感。它擅长处理结构化、精确的医学语言,但在面对人们描述健康问题时那种杂乱、感性且多样化的表达方式时却显得力不从心。

研究作者谨慎地指出,这并非是对这些工具安全性或实用性的最终定论,而是一个警告,提醒人们注意目前的使用方式。他们指出,他们的测试属于“最佳情况”。接受采访的患者已知晓自己的诊断,因此可能会比发病初期更清晰地记得自己的症状。如果计算机在面对如此清晰的回溯性描述时表现依然欠佳,那么在面对那些处于困惑中、尚未确诊且不确定问题所在处的患者时,表现可能会更糟。此外,该研究并未测试计算机会对健康人群产生多少次“假警报”,这是一个重大担忧。如果该工具将过多健康的人标记为有免疫问题,可能会使医生不堪重负,并延迟真正需要护理的人获得治疗。

最终,这项研究强调了现代医学面临的一个日益严峻的挑战。随着越来越多的人转向人工智能寻求健康指导,技术所能实现的能力与人们实际使用方式之间的差距正演变成一个安全问题。计算机并没有坏掉,它只是被训练去理解专家的语言,而非患者的语言。对于数百万正在经历“诊断长征”的人来说,只要这些工具还不能真正倾听房间里那个人的声音,而仅仅是倾听医疗记录,那么它们的承诺就仍然无法兑现。未来的道路在于建立能够弥合这一鸿沟的系统,确保当患者用自己的语言描述痛苦时,他们得到的不仅仅是一个猜测,而是一个通往所需护理的可靠指南。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →