← 最新论文
💬 NLP

Bridging the Version Gap: Multi-version Training Improves ICD Code Prediction, Especially for Rare Codes

本文表明,在 ICD-9 和 ICD-10 数据的组合上训练一种改进的逐标签注意力模型,通过有效弥合版本差异并以更少的参数解决长尾问题,显著提升了 ICD-10 编码预测性能,尤其是对罕见编码的预测。

原作者: Jinghui Liu, Anthony Nguyen

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinghui Liu, Anthony Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对该论文的解读。

核心难题:移动的目标与长尾效应

想象一下,你正在整理一个庞大的医疗记录图书馆。为此,你必须为每位患者分配一个特定的“标签”(即 ICD 代码)来描述其疾病。这项工作中有两个巨大的难题:

  1. 词典不断变更:官方的医疗标签词典(称为 ICD)一直在更新。有时,旧词典(ICD-9)中的标签与新词典(ICD-10)中的标签无法完美对应。这就像你手中的旧教科书还在书架上,却不得不学习一门新语言。大多数计算机程序只被训练为掌握一种“版本”的语言,因此当规则改变时,它们就会陷入混乱。
  2. “长尾”问题:大多数患者患有常见病(如流感或高血压),这些很容易打标签。但还有成千上万种罕见疾病,只有极少数人患病。在数据世界中,这些就是“长尾”。由于这些罕见疾病的样本极少,计算机模型难以学习它们,往往完全忽略它们。

解决方案:混合新旧书籍

研究人员提出了一个简单的问题:如果我们同时利用旧的医疗记录(ICD-9)和新的记录(ICD-10)来训练计算机,会发生什么?

通常人们认为混合这两者会是一场灾难,因为标签无法完美对应(只有约 24% 的旧标签在新系统中能找到直接匹配)。这就像试图通过混入一些法语单词来教学生说英语;你预期他们会感到困惑。

然而,研究人员构建了一个名为 DUALLAAT 的特殊模型,并尝试了这种方法。他们向模型输入了一种由以下数据混合而成的“冰沙”:

  • 来自 MIMIC-III 的旧记录(ICD-9)
  • 来自 MIMIC-IV 的较新记录(ICD-9)
  • 来自 MIMIC-IV 的最新记录(ICD-10)

结果如何?(实验结果)

结果出奇地好,就像为计算机模型注入了一种“秘密酱汁”:

  • 罕见疾病提升:最大的胜利在于罕见疾病(即“长尾”部分)。通过加入旧数据,模型识别罕见 ICD-10 代码的能力提升了 27%。这就像旧记录中包含了关于疾病概念的隐藏线索,即使具体的标签名称不同。模型学会了疾病的含义,而不仅仅是标签。
  • 常见病提升:模型在处理常见病方面也变得更出色,在无需增加复杂度的情况下提高了整体准确率。
  • 效率:他们不再需要三个不同的模型(每个数据集版本一个),而只需要一个模型就能处理所有情况。这节省了巨大的计算机内存和训练时间。这就像拥有万能翻译器,而不是每去一个国家都需要一本不同的词典。

“为什么”(秘密成分)

论文指出,成功并非来自标签的完美匹配,而是源于共享的临床意义

这样想:即使“心脏病发作”这个词在旧书中是"Myocardial Infarction",而在新书中变成了"Acute Myocardial Infarction",但笔记中关于患者症状的描述仍然相似。通过阅读新旧笔记,模型学会了识别疾病的故事,这使其比只阅读新笔记的模型聪明得多。

总结

该论文证明,当系统更新时,你不必丢弃旧的医疗数据。通过混合新旧记录,你可以训练出一个单一、更聪明的计算机模型,它不仅能更好地识别罕见疾病,而且在编码系统变更时也不会崩溃。它将“过时”的数据转化为了宝贵的训练工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →