← 最新论文
📄 otolaryngology

Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals

本研究表明,当前的大型语言模型在从耳鼻喉科电子健康记录中提取结构化临床信息时,无法达到与医学专业人员相当的评分者间信度,这表明它们最适合于需要人工验证的初步数据提取工作,而非自主临床部署。

原作者: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.
发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

如今,医院产生了海量的书面记录。每一次患者就诊、每一项检测结果以及每一个治疗决策,都会被记录在被称为电子健康记录的数字化笔记中。这些文档细节丰富,包含了医生用于描述症状、诊断病情和制定护理计划的特定语言。几十年来,将这些非结构化的叙述转化为有组织、可搜索的数据一直是一项艰巨的任务,通常需要人工阅读并手工重写信息。最近,一种被称为大语言模型的新型计算机程序出现了。这些系统经过海量文本训练,能够以令人惊讶的流利程度阅读、理解并总结人类语言。它们已经展示出能够回答医学问题并通过执业资格考试的能力,这引发了许多人的思考:它们是否也能自动阅读患者记录并提取其中的关键事实。

这个问题不仅关乎节省时间,更关乎安全与准确。如果计算机要协助医生管理患者护理,它必须在不凭空捏造或遗漏关键细节的情况下找到正确的信息。一项新的研究旨在直接测试这种能力。研究人员收集了来自耳鼻喉科诊所的近百份真实患者记录,并要求人类医生和七种不同的语言模型阅读这些记录。任务是提取特定的事实,例如患者的年龄、症状、诊断结果以及接受的治疗。为了确保所有人都在使用相同的语言,研究人员要求每一条信息都必须转化为全球医院通用的标准化代码。这使得研究人员能够精确比较机器与人类的表现。

结果揭示了人类专业知识与当前人工智能之间存在的明显差距。当研究中的十四名医生阅读相同的记录时,他们在提取的信息上达成了一致的比例为81%。这种高度的一致性表明,医生们对笔记的解读是连贯一致的。然而,当计算机模型与医生进行对比时,一致性显著下降到了约66%。换句话说,机器在从相同文本中识别相同事实方面的可靠性尚未达到人类的水平。该研究测试了不同规模的模型,从拥有数千亿连接的庞大系统到可以在本地计算机上运行的小型系统,没有一个模型达到了医疗专业人员所展现出的那种一致性水平。

性能表现因提取信息的类型而异。模型在寻找治疗方案和检测结果方面表现得相当出色,因为这些内容通常以清晰、标准的方式书写。但在处理体征和诊断方面,它们的表现则较差,因为这些内容往往需要对临床背景有更深层的理解。有趣的是,计算机倾向于发现比医生更多的信息,尤其是在风险因素方面。医生通常关注眼前的问题,而模型似乎会标记文中提到的每一个可能的风险。这表明机器不仅仅是在模仿人类的行为,而是在以不同的方式处理文本——它们有时会捕捉到人类可能忽略的细节,但也可能标记了一些在临床上并不相关的因素。

尽管存在这些差异,机器仍能证明如果使用得当,它们可以成为有用的工具。研究发现,当模型识别出某项信息时,其准确率通常很高,达到了97%。这意味着它们很少捏造不存在的事实。然而,它们大约有15%的时间会遗漏某些信息。这种模式指向了这些工具在未来的一个特定角色:它们最适合作为“第一遍扫描”,快速浏览记录以提取可能的候选信息供医生审核。最终的决策和验证仍需由人类完成。研究人员得出结论,虽然这些模型功能强大,但尚未准备好在临床环境中独立工作。它们最好被视为助手,可以帮助整理涌现的医疗数据,前提是必须始终有专家进行人工核查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →