← 最新论文
📄 health informatics

Forecasting laboratory measurements from longitudinal electronic health records

该论文介绍了 LaBERT,这是一种基于 Transformer 的模型,它通过有效地学习具有临床意义的治疗效果并实现个性化临床决策支持,在根据纵向电子健康记录预测未来实验室测量值方面显著优于基准方法。

原作者: Firoozbakht, F., Baumabach, J.

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Firoozbakht, F., Baumabach, J.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在试图猜测下周的天气会如何。你可以仅仅观察现在的天空并说:“现在是晴天,所以明天可能也是晴天。”这算是一个不错的猜测,但它忽略了大局。如果一个风暴系统正从西方移入呢?如果已经连续下了三天雨呢?为了得到正确的答案,你需要观察整个故事:天气的历史、温度趋势,甚至昨天预报员说了什么。

在医学领域,医生也面临着类似的谜题。他们拥有患者的“医疗天气报告”,这是一份被称为电子健康档案(EHR)的长长的数字和笔记列表。这些记录追踪了诸如血液检测结果、药物和患者感受随时间的变化。核心问题是:我们能否利用这些杂乱、复杂的历史记录,来预测患者在下次就诊时的健康指标会是什么样子?如果我们能做到这一点,就像拥有了一个水晶球,能帮助医生在麻烦发生前发现苗头,从而及时调整治疗方案。这就是“预测”患者健康的挑战,而由于每个人的身体反应各不相同,且数据往往杂乱且存在缺失,这使得这项工作变得异常困难。

于是,由研究人员 Farzaneh Firoozbakht 和 Jan Baumbach 设计的名为 LaBERT 的新型计算机“大脑”应运而生,旨在解决这个难题。可以将 LaBERT 想象成一位超级聪明的侦探,它不仅看最新的线索(最近一次血液检测),还会阅读整个案卷。这位侦探是在一个包含超过 25.5 万名患者、超过 50 万次住院就诊记录的海量真实世界医疗记录库上进行训练的。

以下是 LaBERT 的工作原理及其发现:

侦探的工具箱
大多数计算机模型试图将患者的历史转化为简单的单词列表,就像一本故事书。但 LaBERT 不同。它以特殊的方式处理不同类型的医疗数据。它知道药物名称与血压数值是不同的。它没有将所有内容都压缩成文本,而是使用了一种特殊的“翻译”系统,保留了数字作为数字、药物名称作为名称,让模型能够理解每种信息的独特形态。

至关重要的是,LaвERT 不仅仅孤立地看待单次就诊。它使用了一个“记忆小径”系统。想象一下一名徒步旅行者在每个营地都留下一个背包。当徒步者到达下一个营地时,他们不仅会观察当前地点,还会检查之前所有营地的背包,以了解自己曾去过哪里以及可能前往何处。LaBERT 通过将当前的就诊情况与所有先前就诊的“潜在历史”相结合来实现这一点。研究人员测试了三种携带这种“背包”的方式:仅添加旧信息、使用“门控”来决定保留多少旧信息,或者使用复杂的记忆单元。他们发现“门控”方法效果最好,能够自适应地平衡昨日发生的情况与今日发生的情况。

结果:优于基础水平
团队将 LaBERT 与一些更简单的方法进行了对比测试。其中一种是“基准”方法,即假设你的下一次血液检测结果与上一次完全相同;另一种是标准的计算机模型(MLP),它不具备这种高级的“记忆”或“翻译”技能。

结果显而易见:LaBERT 胜出了。

  • 它将平均预测误差(均方误差)从 0.77 降低到了 0.53
  • 它提高了解释患者健康变化的能力(R² 分数),从 0.29 提升到了 0.51

这意味着 LaBERT 不仅仅是在瞎猜;它实际上正在学习患者的历史、治疗方案与未来健康状况之间复杂的舞蹈。

它真的理解医学吗?
为了确保 LaBERT 不仅仅是在记忆模式而没有理解本质,研究人员玩了一个“如果……会怎样”的游戏。他们提取了真实的患者记录,并将实际使用的药物替换为随机的假药物。他们发现,在 81% 的案例中,当使用真实药物时,模型对未来健康状态的预测准确度远高于使用假药物时。这表明 LaBERT 已经学习到特定的药物会导致特定的身体变化。

他们进一步进行了“反事实”实验。他们询问模型:“如果这位患者服用华法林(Warfarin,一种抗凝血剂),他们的 INR(国际标准化比值,反映血液凝固程度的指标)会发生什么变化?”以及“如果他们服用肝素(Heparin),他们的 PTT(部分凝血活酶时间)会发生什么变化?”

  • 当看到华法林时,模型在不同测试运行中 100% 预测了 INR 的增加。
  • 当看到肝素时,模型在 82% 到 89% 的运行中预测了 PTT 的增加。

这些结果在模型预测 0.5 天后或 30 天后的健康状态时依然成立。这表明模型学习到了真实的、既定的医学规则,而非随机噪声。

LaBERT 做不到什么
需要注意的是,该模型并非万能。研究人员明确指出,LaBERT 是从“观察性”数据(即医院中实际发生的现象)中学习的。它并不证明“因果关系”。例如,模型可能会预测服用胰岛素的患者随后会有较高的血糖。这并不是因为胰岛素升高了血糖(实际上它会降低血糖);而是因为医生会将胰岛素用于那些血糖已经非常高的患者。模型忠实地重现了这种现实世界的模式,但除非被告知,否则它并不知道生物学上的因果逻辑。作者警告说,这些预测是“观察性预测”,而非绝对的因果真理,应当用于辅助而非取代医生的判断。

总结
LaBERT 是一个强大的新工具,它表明我们可以利用患者漫长且杂乱的生活史,以惊人的准确度来预测其未来的健康指标。通过将时间、药物和实验室结果视为一个相互关联的故事,而非孤立事实的列表,它为未来提供了一个愿景:医生可以模拟不同的治疗路径,并选择最有可能让患者保持健康的路径。虽然它不是解决所有医学奥秘的魔杖,但它是迈向个性化、前瞻性医疗的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →