← 最新论文
📄 health informatics

Interoperability of standardised electronic healthcare records facilitates transfer learning of clinical language models

本研究表明,将电子健康记录标准化为 OMOP 通用数据模型,能够有效地实现临床语言模型在不同英国数据集之间的迁移学习,尽管存在人口统计学差异和词汇限制,仍能在预测急诊住院再入院方面取得高预测性能。

原作者: Remfry, E., Henkin, R.

发布于 2026-09-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Remfry, E., Henkin, R.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

医院和诊所不断产生大量的数字化病历笔记。这些电子记录包含了每一次就诊的历史、每一项处方以及每一项检测结果。然而,不同系统记录这些信息的方式往往并不统一。一家诊所可能会使用一个特定的代码来表示高血压读数,而另一家诊所则可能使用完全不同的代码来表示同样的东西。这种缺乏统一性的现象使得整合来自不同地方的数据以寻找规律或教计算机识别健康趋势变得十分困难。为了解决这个问题,研究人员开发了一种被称为“通用数据模型”的医疗数据通用翻译器。可以把它想象成一本共享的字典,强制要求不同的编码系统在医疗事件的含义上达成一致,将混乱的本地简写转化为一种单一的、标准化的语言。人们希望,如果计算机能够从一组患者身上学习这种通用语言,它们或许就能将这些知识应用到另一组完全不同的患者身上,而无需从头开始重新训练。

在最近的一项研究中,研究人员试图通过使用来自英国的两组大型健康记录集合,来测试这一想法在现实世界中是否可行。他们专注于一个特定的任务:预测患者在出院后三十天内是否需要因急诊再次入院。他们选择的两个数据集非常不同。一个数据集来自全英范围内的全科医生网络,而另一个则仅来自伦敦的诊所。这些人群在年龄、种族和经济背景上存在差异,且每个系统的计算机最初都是使用不同的编码系统来记录其医疗历史的。研究人员首先将这两组记录都翻译成了前文提到的标准通用语言。然后,他们训练了一个被称为“临床语言模型”的高级计算机程序来理解第一组数据集。该程序学习阅读医疗事件的序列,并预测未来发生紧急再入院的可能性。

关键的测试在于,研究人员要求这个经过训练的程序在没有任何新训练的情况下,去观察第二个数据集(即来自伦敦的数据集)。他们想看看从第一组数据中获得的知识是否可以转移到第二组数据中。结果令人鼓舞。该模型此前从未见过伦敦的数据,但在处理这组新数据时的表现,几乎与一个从一开始就专门针对该群体进行训练的模型一样出色。它能以极高的准确度正确识别出有风险的患者,其表现远优于一个在没有任何先前学习的情况下从零开始构建的模型。这表明,标准化数据使计算机能够学习适用于不同人群的健康风险通用原则,即使这些人群在纸面上看起来差异很大。

研究人员还进行了深入研究,以了解医疗记录中的哪些部分在驱动这些预测。他们发现,最重要的信息来自于患者病史以及医生的观察记录,例如关于症状或体格检查发现的笔记。有趣的是,其他因素(如药物清单或具体的测量数值)的重要性会根据所使用的不同数据集而变化。在一组数据中,移除药物数据实际上提高了模型的性能;而在另一组数据中,移除测量数据则产生了同样的效果。这表明,虽然通用语言帮助计算机理解了大局,但最重要的具体细节仍可能取决于数据的原始收集和组织方式。

尽管取得了这些成功,但该研究也强调了一些实际的局限性。将记录翻译成标准语言的过程并不完美;由于某些本地代码在通用字典中没有直接对应的匹配项,导致部分信息丢失。此外,该计算机程序的词汇量有限,这意味着它无法识别在新数据集中遇到的每一个代码。尽管如此,核心结论依然稳固:通过将杂乱的本地医疗记录转换为标准化格式,研究人员可以构建出跨医院和跨地区的强大工具。这种方法为创建不被单一系统所束缚的医疗预测工具提供了一条充满希望的路径,使得从一个社区获得的洞察力能够潜在地造福于另一个社区,无论其本地编码习惯或人口构成如何。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →