Evaluating missing-data workflows under hospital-structured missingness: a simulation-calibrated study in eICU and MIMIC-IV
本研究表明,多中心电子健康记录中具有医院结构性的缺失显著偏倚了死亡率关联估计值,并削弱了常规缺失数据工作流下置信区间的覆盖度,凸显了进行集群层面诊断、特定方法性能比较以及显式非随机缺失敏感性分析的紧迫需求。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医院中,一个病人的故事往往不仅由记录下来的内容来讲述,还由缺失的内容来诉说。当医生开具一项血液检查单时,结果会出现在电子记录中。但如果这项检查从未被开具,或者如果机器未能发送数据,记录就会显示出一片空白。几十年来,分析这些海量数字档案的研究人员一直将这些空白视为需要修复或忽略的简单错误。他们假设缺失的化验结果仅仅是一个缺失的数字,与病人的病情或医院的习惯无关。然而,在现实中,一个缺失的值往往是一种信息。它可能意味着医生认为某项测试没有必要,或者特定的医院缺乏运行该测试的设备。当这些缺口并非随机出现,而是遵循与医院或病人背景相关的模式时,它们可能会悄悄地扭曲数据的整体图景。
这就是一项新研究探讨的核心挑战,该研究观察了研究人员如何处理关键护理数据库中这些缺失的信息。研究人员想知道,填补空白的标准方法是否实际上改变了关于重要医学问题的答案。他们聚焦于一个特定的、高风险的情景:比较不同种族和民族群体在医院内的死亡风险。目标不是为了证明某一群体在生物学上比另一群体更脆弱,而是为了观察数据清洗方法是否可能在并不存在差异的地方制造出差异,或者掩盖了原本存在的差异。通过利用计算机模拟创建的已知真相来测试这些方法,研究表明,处理缺失数据的选择不仅仅是一个技术细节,它是一个从根本上改变了研究对象及其结果意义的决策。
研究人员转向了来自美国重症监护室的两个大规模真实世界数据集。其中一个被称为 eICU 的数据库收集了来自 206 家不同医院的信息,捕捉了全国各地医疗服务交付的多样性。另一个名为 MIMIC-IV 的数据库则来自一家大型学术医院。他们专注于患者住院第一天内进行的八项常见血液测试,例如白细胞计数、肾功能和肝脏健康等测量值。在现实世界中,这些测试并不总是可用。在单中心医院数据库中,只有约 24% 的患者拥有全部八项记录结果。在多中心医院数据库中,这一比例略高,为 36%,但其中的缺口远非随机。有些医院对几乎所有患者都有数据,而有些医院则对几乎所有人都有缺失的结果。在某些情况下,整个医院对于特定的测试(如乳酸或胆红素)都没有记录值,这表明缺失的数据是这些特定医疗中心的结构性特征,而非随机故障。
为了观察这种缺失如何影响结果,团队应用了五种科学家用来处理不完整记录的标准方法。一种方法是直接丢弃任何含有单个缺失测试的患者。另一种方法是用数据中的中间值填充缺口,并注明该值为缺失。第三种方法尝试对剩余的患者进行加权,以代表被丢弃的患者。另外两种方法使用了复杂的计算机算法,根据该患者现有的其他信息来推测缺失的数值,其中一个版本试图考虑到该患者所接受治疗的具体医院。研究人员随后使用这五个不同版本的数据来计算不同种族之间的死亡率差异。
结果令人震惊。取决于使用哪种方法,估计的种族间死亡率差异会发生剧烈波动。在一个案例中,在单中心医院数据库中对比亚洲患者与白人患者时,那种直接丢弃不完整记录的方法显示亚洲患者的死亡风险较低。然而,另一种填充缺失数字的方法却显示他们的死亡风险较高。这种波动的幅度接近三个百分点,足以彻底改变研究结论。在多中心医院数据库中,波动同样剧烈,对于西班牙裔患者的估计值会根据工作流程的变化,在低风险到高风险之间摆动。研究表明,所选的方法不仅增加了数据中的噪声,甚至改变了发现的方向。
为了理解为什么会发生这种情况,研究人员构建了一个他们知道确切真相的计算机模拟系统。他们创造了一个包含 6 - 60 家医院和数千名患者的虚拟世界,通过编程让缺失数据以特定的模式出现,以模仿现实世界。因为他们在模拟中知道真实答案,所以可以精确衡量每种方法的错误程度。他们发现,当缺失数据与医院结构相关联时,即使是最复杂的模型也难以应对。那个试图考虑医院背景的方法表现优于其他一些方法,但并不完美。它仍然会产生误差,并且其置信区间过于狭窄,无法令人信赖。模拟还揭示了,如果缺失数据是以计算机无法察觉的方式与患者未记录的严重程度相关联,那么没有任何方法可以完全解决问题。当缺失是由模型无法获知的因素驱动时,所有方法都仍然存在偏差,产生的估计值会偏离真实值几个百分点。
研究还检查了研究人员对其结果的信心是如何受到影响的。在科学领域,一个结果通常伴随着一个不确定性的范围,即一个表示我们有多大把握的误差范围。研究人员发现,某些方法产生的范围过于狭窄,给人一种虚假的精确感。在模拟中,当缺失数据沉重且由医院结构驱动时,某些方法的置信区间覆盖真实答案的概率不到 30%,尽管它们理应达到 95%。这意味着,如果研究人员使用其中一种有缺陷的方法,他们就是在声称对一个实际上相当不稳固的结果具有高度确定性。这项研究强调,如果不对缺失数据是如何处理的情况进行检查,仅仅报告一个数字就像是用一把随温度变化而缩放的尺子来测量房间一样。
最重要的发现之一是,方法的选择改变了正在研究的人群。当研究人员简单地丢弃带有缺失数据的患者时,他们留下的群体看起来与原始人群有所不同。在现实世界的数据中,那些拥有全部化验结果的患者通常年龄较大,或具有不同的特征。通过用平均值或复杂的猜测来填补空白,研究人员实际上是在创造一个在现实世界中可能并不存在的合成人群。研究表明,他们计算出的“标准化”风险差异并不是关于疾病的普遍真理,而是针对由数据清洗方法所定义的一个特定人群所提出的特定问题的特定答案。
研究人员得出结论,在处理医院记录中的缺失数据时,并不存在单一的、神奇的解决方案。他们在模拟中证明了“更复杂的数学模型会自动解决问题”这一观点是错误的。即使是一个明确尝试考虑医院差异的模型,也无法保证结果的准确性。研究认为,研究人员必须停止将缺失数据视为一个技术性的清理步骤,而应将其视为所提问题的基本组成部分。在得出任何结论之前,他们需要绘制出数据在哪里缺失以及为什么缺失的精确图谱。他们必须诚实地说明他们的结果究竟代表了哪类人群。而且,他们必须针对“数据为何缺失”的不同假设进行测试,并承认如果缺失是由隐藏因素驱动的,那么结果可能是错误的。
最终,这项工作是对使用电子记录进行医学研究的未来所发出的警告和指南。它表明,我们处理数据中空白的方式与我们拥有的数据本身一样重要。如果我们忽视缺失数据的模式,我们就有可能将医学知识建立在一个随方法论变化而移动的基础之上。这项研究并没有提供一个完美的工具来解决问题,但它提供了一张清晰的陷阱地图。它表明,未来的路径需要透明度、严谨的测试,以及一种接受现实的态度——即承认如果缺失是由隐藏因素驱动的,那么关于健康差异的一些问题可能在理解数据缺失的原因之前,仍将保持不确定性。目标不是寻找一个完美的数字,而是理解我们的数据所能告诉我们的极限。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。