← 最新论文
📄 medicine

An Interpretable Machine Learning Framework for Predicting In-Hospital Mortality in Patients with Heart Failure and Concurrent Infection: Development Using MIMIC-IV and External Validation in eICU-CRD

本研究利用 MIMIC-IV 和 eICU-CRD 数据开发并外部验证了用于预测伴有感染的心力衰竭患者住院死亡率的可解释机器学习模型,揭示了不同数据库和感染亚组之间模型的性能差异,并通过 SHAP 分析识别了关键的临床预测因子。

原作者: Xinyue Zhang, Chengyun Liu, Xueke Guang, Guangyu Gao, Haohui Fan, Hao Zhang, Quan Zhou, Xinqi Diao, Weilin Lu

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyue Zhang, Chengyun Liu, Xueke Guang, Guangyu Gao, Haohui Fan, Hao Zhang, Quan Zhou, Xinqi Diao, Weilin Lu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当心脏难以有效地泵血时,整个身体都会感受到这种压力。这种被称为心力衰竭的状况,使得患者应对额外压力的储备能力变得微乎其微。如果此时发生感染,情况可能会迅速恶化。人体的免疫系统会发起大规模的炎症反应来对抗病原体,但这种反应本身也可能使本已虚弱的心脏过载,从而导致危险的器官衰竭循环。对于重症监护室(ICU)的医生来说,预测同时患有心力衰竭和感染的患者在住院期间是否能存活,是一项至关重要的挑战。用于评估风险的传统工具通常依赖于简单的清单,将每个症状视为独立的条目,从而忽略了这些不同问题之间复杂的相互作用。为了解决这一问题,研究人员开始探索,能够发现海量数据中隐藏模式的计算机系统是否能为那些处于极高危险中的患者提供更清晰的图景。

来自武汉协和医院的一个研究小组致力于构建并测试这样一个系统。他们希望创建一个工具,能够观察患者入院时的许多不同体征——例如年龄、生命体征和血液检测结果——并将它们结合起来,以预测住院期间死亡的可能性。为此,他们利用了两个大规模的、公开可用的美国重症监护室医疗记录数据集。第一个被称为 MIMIC-IV 的集合包含来自一家大型医院的数据,而第二个 eICU-CRD 则收集了来自全美数百家医院的信息。研究人员专门针对被诊断为同时患有心力衰竭和感染的成年人进行了研究。他们在第一个数据库中识别出 1,415 名患者来构建模型,然后通过第二个数据库中的 2,826 名不同患者来测试这些模型,以观察其结果在更广泛的环境下是否依然成立。

该团队训练了四种不同类型的机器学习算法来进行这些预测。其中一种方法是标准的统计方法,而另外三种是更先进的系统,它们通过构建决策树来寻找变量之间的复杂关系。研究人员根据感染是由细菌还是由其他生物(如病毒或真菌)引起的,将患者进行了分组,因为人体对不同类型的感染反应不同。随后,他们让计算机模型猜测哪些患者会存活,哪些不会,并将结果与医院记录的实际结局进行对比。

结果显示,没有任何一个单一的计算机程序能够完美适用于所有情况。在来自单一医院的初始患者组中,一种名为 LightGBM 的先进模型表现最为出色,并且在预测细菌感染患者的结局方面特别有效。然而,对于非细菌感染患者,另一种名为 XGBoost 的模型则更为准确。当研究人员在由许多家医院组成的第二个更大规模的患者组中测试这些相同的模型时,排名再次发生了变化。在这个更广泛的群体中,第三种模型 AdaBoost 成为了预测细菌感染的最佳模型,而 XGBoost 仍然是预测非细菌感染最强的模型。这种差异表明,预测风险的最佳工具很大程度上取决于特定的患者群体和感染类型,而不是存在一种在任何地方都表现最佳的通用算法。

为了理解这些计算机模型是如何做出决策的,研究人员使用了一种称为 SHAP 分析的技术,它就像一束聚光灯,展示了哪些因素对每项预测最为重要。他们发现,模型高度依赖于几个关键指标。衡量患者意识水平的评分(即格拉斯哥昏迷量表)是一个主要因素。其他关键输入还包括血液中的白细胞数量、一种名为血尿素氮的废物水平、患者体重以及尿量。分析显示,较高的白细胞水平和血尿素氮水平会使预测向死亡风险增加的方向倾斜,而较高的尿量和较大的体重则与较低的风险相关联。

尽管有这些发现,研究人员谨慎地指出,他们的工作尚未准备好作为医院的标准工具投入使用。这项研究是对过去数据的回顾性观察,这意味着计算机是从已经接受过治疗的患者记录中学习,而不是在实时测试一种新的治疗方法。两个数据库之间的性能差异凸显了医疗数据可能因采集地点不同而产生显著差异,一个在某家医院表现良好的模型,在未经调整的情况下,在另一家医院可能并不适用。此外,研究明确指出,计算机识别出的因素并非经证实的死亡原因;它们仅仅是模型用来做出猜测的信号。研究人员总结道,虽然这些具有解释性的机器学习系统为探索复杂患者的风险模式提供了一种有前景的方法,但在它们能够被信任用于指导生死攸关的决策之前,还需要在未来的真实临床试验中进行进一步测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →