ICD2Bert: ICD Bert Encodings for Clinical Outcome Prediction on Routine Health Insurance Data
本文介绍了 ICD2BERT,一种在没有进行领域特定修改的情况下在 ICD 代码上进行预训练的标准 BERT 模型,并通过广泛的基准测试表明,此类架构复杂性往往无法超越更简单的基准模型,从而强调了对于临床结果预测而言,数据质量、规模和预训练比模型的复杂程度更为关键。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
全球范围内的医院和保险公司都依赖一种通用的语言来记录患者的病情。这种语言由代码组成,即代表特定疾病、伤害和医疗程序的字母与数字组成的短字符串。这些代码最初是为了处理计费和文书工作而创建的,但如今它们已成为医生和计算机理解患者病史的主要方式。由于这些记录如此庞大且标准化,研究人员长期以来一直希望利用人工智能在其中发现隐藏的模式,这些模式或许能预测谁会再次生病、谁可能会死亡或谁需要特定的治疗。为此,科学家们一直在构建复杂的计算机程序,旨在让计算机像人类阅读故事一样阅读这些代码,寻找不同事件之间的背景和联系。
一个研究小组着手测试这些复杂的计算机程序是否真的必要,或者它们增加的额外复杂性是否仅仅是一种干扰。他们专注于一种被称为“Transformer”的特定类型的人工智能,这是一种彻底改变了计算机理解语言能力的强大工具。在医学领域,科学家们一直在微调这些工具,添加诸如患者年龄或就诊次数等额外信息层,希望这些细节能帮助计算机做出更好的预测。研究人员想知道,这些定制的添加究竟是真的提高了结果,还是一个更简单、标准的工具也能同样出色地完成工作。他们还想看看这些先进的系统是否能从一组患者中学习,并将该知识应用于另一组完全不同的患者,例如来自不同国家或医疗系统的患者。
为了回答这些问题,该团队构建了一个新的标准版本计算机程序,该程序仅读取医疗代码,而不包含其他研究人员添加的年龄或就诊信息。他们将这个新模型命名为 ICD2BERT。然后,他们使用三组非常不同的医疗数据,将该模型与几种流行的、更复杂的模型进行了对比测试。其中一组数据来自美国的一家大型医院,包含了新旧两套编码系统的记录。另一组数据来自一小群具有详细病史的患者,旨在测试模型在极少数据下的学习能力。第三组数据规模巨大,包含了来自德国数百万条常规健康保险索赔记录,覆盖了极其广泛且多样化的人口。
结果令人惊讶。当研究人员将标准模型与那些复杂的、定制化的模型进行比较时,他们发现额外的特征并没有让计算机变得更聪明。那个仅仅阅读代码的模型,其表现与那些同时了解患者年龄或就诊历史的模型一样出色。事实上,研究人员发现,模型所学习的数据质量和规模,远比计算机程序本身的复杂程度更为重要。更出人意料的是,一种非常简单的方法——即将代码视为类别列表,而不试图理解事件的顺序或背景——其表现往往也与最先进的人工智能不相上下。这种简单的方法在预测未来疾病、死亡和再次入院方面的准确度,在许多情况下都能达到复杂系统的水平。
研究还表明,所使用的特定医疗代码类型至关重要。在美国的医院数据中,旧的编码系统仍然保留着新的系统未能完全取代的关键信息;当研究人员移除旧代码时,计算机的表现显著下降。然而,在仅使用新代码的德国保险数据中,如果将代码缩减为最基本的类别,计算机就会表现挣扎,这表明在那些特定记录中,细微的细节是必不可少的。研究人员还发现,虽然复杂的模型可以从美国数据中学习并将其应用于德国数据,但反之则不然。一个仅在德国数据上训练的模型在处理美国记录时失败了,这很可能是因为它从未见过旧的编码系统。这表明,为了让计算机在不同的医疗系统中真正发挥作用,它必须在尽可能广泛且多样化的数据类型上进行训练。
最后,团队研究了这些模型做出决策的原因是否易于理解。由于他们的标准模型没有额外的、定制构建的层,因此可以使用现有的工具来分析哪些医疗代码影响了预测。他们发现,糖尿病和高血压等疾病的特定代码是预测死亡或再次入院的最强驱动因素。这种透明度对于需要信任计算机建议的医生来说至关重要。这项研究表明,在医院投资建设和训练大规模、复杂的人工智能系统之前,应仔细考虑一种更简单、更透明的方法是否同样有效。研究结果表明,预测临床结果的能力不在于计算机程序精巧的设计,而在于它所被允许阅读的医疗记录的丰富度和广度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。