医院和诊所不断产生大量的数字化病历笔记。这些电子记录包含了每一次就诊的历史、每一项处方以及每一项检测结果。然而,不同系统记录这些信息的方式往往并不统一。一家诊所可能会使用一个特定的代码来表示高血压读数,而另一家诊所则可能使用完全不同的代码来表示同样的东西。这种缺乏统一性的现象使得整合来自不同地方的数据以寻找规律或教计算机识别健康趋势变得十分困难。为了解决这个问题,研究人员开发了一种被称为“通用数据模型”的医疗数据通用翻译器。可以把它想象成一本共享的字典,强制要求不同的编码系统在医疗事件的含义上达成一致,将混乱的本地简写转化为一种单一的、标准化的语言。人们希望,如果计算机能够从一组患者身上学习这种通用语言,它们或许就能将这些知识应用到另一组完全不同的患者身上,而无需从头开始重新训练。
在最近的一项研究中,研究人员试图通过使用来自英国的两组大型健康记录集合,来测试这一想法在现实世界中是否可行。他们专注于一个特定的任务:预测患者在出院后三十天内是否需要因急诊再次入院。他们选择的两个数据集非常不同。一个数据集来自全英范围内的全科医生网络,而另一个则仅来自伦敦的诊所。这些人群在年龄、种族和经济背景上存在差异,且每个系统的计算机最初都是使用不同的编码系统来记录其医疗历史的。研究人员首先将这两组记录都翻译成了前文提到的标准通用语言。然后,他们训练了一个被称为“临床语言模型”的高级计算机程序来理解第一组数据集。该程序学习阅读医疗事件的序列,并预测未来发生紧急再入院的可能性。
关键的测试在于,研究人员要求这个经过训练的程序在没有任何新训练的情况下,去观察第二个数据集(即来自伦敦的数据集)。他们想看看从第一组数据中获得的知识是否可以转移到第二组数据中。结果令人鼓舞。该模型此前从未见过伦敦的数据,但在处理这组新数据时的表现,几乎与一个从一开始就专门针对该群体进行训练的模型一样出色。它能以极高的准确度正确识别出有风险的患者,其表现远优于一个在没有任何先前学习的情况下从零开始构建的模型。这表明,标准化数据使计算机能够学习适用于不同人群的健康风险通用原则,即使这些人群在纸面上看起来差异很大。
研究人员还进行了深入研究,以了解医疗记录中的哪些部分在驱动这些预测。他们发现,最重要的信息来自于患者病史以及医生的观察记录,例如关于症状或体格检查发现的笔记。有趣的是,其他因素(如药物清单或具体的测量数值)的重要性会根据所使用的不同数据集而变化。在一组数据中,移除药物数据实际上提高了模型的性能;而在另一组数据中,移除测量数据则产生了同样的效果。这表明,虽然通用语言帮助计算机理解了大局,但最重要的具体细节仍可能取决于数据的原始收集和组织方式。
尽管取得了这些成功,但该研究也强调了一些实际的局限性。将记录翻译成标准语言的过程并不完美;由于某些本地代码在通用字典中没有直接对应的匹配项,导致部分信息丢失。此外,该计算机程序的词汇量有限,这意味着它无法识别在新数据集中遇到的每一个代码。尽管如此,核心结论依然稳固:通过将杂乱的本地医疗记录转换为标准化格式,研究人员可以构建出跨医院和跨地区的强大工具。这种方法为创建不被单一系统所束缚的医疗预测工具提供了一条充满希望的路径,使得从一个社区获得的洞察力能够潜在地造福于另一个社区,无论其本地编码习惯或人口构成如何。
技术摘要:标准化电子健康记录的互操作性与迁移学习
问题陈述
电子健康记录(EHR)依赖于多样化的临床编码本体(例如 Read v2、SNOMED CT、ICD-10),即使在同一个国家医疗系统中,这些本体也存在显著差异。这种异质性为在不同数据集和机构之间训练和部署机器学习模型制造了障碍。虽然通用数据模型(CDM,如 OMOP)通过标准化数据结构和词汇来促进跨数据集分析,但目前尚不清楚这种标准化在多大程度上保留了进行临床预测任务所需的特定信息。此外,目前尚不确定映射过程(该过程通常会合并或丢弃源编码)是否保留了足够的信号,以实现临床基础模型(在某一数据集上预训练)向另一数据集的迁移,而无需从头开始重新训练。
方法论
本研究利用了来自英国国民医疗服务体系(NHS)的两个初级保健数据集:CPRD GOLD(使用 Read v2 编码)和 CPRD Aurum(使用 SNOMED CT),研究范围限制在伦敦地区。这两个数据集均被映射到 OMOP CDM,将源编码转换为标准的 OMOP 概念 ID。
- 数据处理: 作者将 Read v2、SNOMED CT、dm+d、ICD-10 和 OPCS-4 编码映射到 OMOP 标准概念。他们评估了映射保真度以及唯一概念数量的减少情况。
- 模型架构: 一个基于 BERT 的 Transformer(仅编码器)在 CPRD GOLD 预训练语料库(105 万患者)上通过掩码语言模型(masked language modelling)从头开始训练。分词器完全基于 GOLD 预训练数据构建,词表上限为 20,000 个 token。
- 实验设计:
- 预训练: 模型(PT-GOLD)在 GOLD 上进行预训练。
- 微调: 预训练模型分别在 GOLD(FT-GOLD)和 Aurum(FT-Aurum)上进行微调,以预测 30 天内急诊住院再入院情况。
- 迁移学习: 在 GOLD 上预训练并微调后的模型直接应用于 Aurum 测试集(进行推理),无需进一步权重更新(INF-Aurum),以评估零样本(zero-shot)迁移效果。
- 对照组: 使用随机初始化的权重在 Aurum 上进行微调的模型(RI-Aurum),以建立基准。
- 消融实验: 通过在微调期间移除特定的 OMOP 领域(药物、测量、观察和疾病)来评估其贡献。
关键结果
- 映射保真度: OMOP 映射在 CPRD GOLD 中成功覆盖了 95.6% 的记录,在 Aurum 中覆盖了 86.2% 的记录。映射使 GOLD 中的唯一初级保健概念减少了 36%,在 Aurum 中减少了 28.6%,表明存在显著的数据压缩。
- 分词器覆盖率: 在 GOLD 上训练的分词器覆盖了 GOLD 中 99.53% 的概念出现,但在 Aurum 中仅覆盖了 91.27%,反映了源数据集与目标数据集之间的词汇差距。
- 模型性能:
- FT-GOLD(在 GOLD 测试集上): AUROC 0.913。
- FT-Aurum(在 Aurum 测试集上): AUROC 0.927。
- INF-Aurum(从 GOLD 到 Aurum 的零样本迁移): AUROC 0.911。该性能与 FT-Aurum 相当,且显著优于随机初始化对照组(RI-Aurum,AUROC 0.885)。
- 微调增益: 对迁移后的模型在 Aurum 上进行进一步微调(FT-Aurum)后,相比零样本推理仅获得了微小的提升(+0.016 AUROC)。
- 消融发现: 移除“观察与疾病”领域会导致两个数据集的性能均下降。然而,在 FT-Aurum 中移除“药物”会提高性能,而在 FT-GOLD 中移除“测量”则会提高性能。这表明,对于再入院预测的临床信号在不同的 OMOP 领域中分布不同,这取决于源数据集的编码结构。
主要贡献
- 迁移学习的实证验证: 研究表明,通过将 EHR 数据标准化为 OMOP,可以实现临床语言模型在具有不同编码本体和人口统计特征(如不同的种族构成和社会经济地位)的数据集之间的有效迁移。
- 评估映射保真度: 作者量化了 OMOP 映射过程中的信息丢失程度,指出虽然可以实现高保真度映射,但它本质上会压缩数据,并可能排除缺乏标准对应项的高容量行政代码。
- 领域特定信号分析: 通过消融实验,论文揭示了特定 OMOP 领域(如药物 vs. 测量)的预测效用在不同数据集之间并不统一,这可能是由于不同源系统将临床概念分配到各领域时的结构性差异所致。
意义与主张
本文主张,在概念层面进行务实的 OMOP 标准化,可以支持临床预测模型的互操作性。具体而言,研究表明一个在英国初级保健数据集上预训练的模型,可以在采用不同编码系统的另一个数据集上进行复用,并保持极高的预测性能(AUROC ~0.91),而无需重新训练。这表明,即使在存在人口统计学异质性的情况下,标准化也可以减轻为每个新站点单独训练模型的必要性。
然而,作者保持了审慎的态度,承认了以下局限性:
- 数据丢失: 映射过程和固定词表会导致数据丢失,特别是对于那些在预训练分词器中不存在或缺乏标准 OMOP 对应项的代码。
- 泛化性: 虽然在两个英国数据集之间取得了成功,但作者指出,该研究尚未测试在同一国家医疗系统之外的泛化能力。
- 领域差异: 消融结果中的差异强调,标准化并不能完全统一不同源系统之间数据领域的语义含义,而这可能会影响下游模型的行为。
研究结论认为,虽然标准化是实现模型互操作性的关键步骤,但它并非万灵药;实际部署需要仔细考虑词汇覆盖范围以及目标数据集的具体结构性细微差别。
每周获取最佳 health informatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。