Recovering Incomplete Clustered Binary Data in Longitudinal Electronic Health Records Using Multiple Imputation
本文引入并验证了聚类逻辑因子随机效应(CLF-RE)框架,该框架作为一种计算可扩展的多重插补方法,能够有效恢复电子健康记录中不完整的、高维的纵向二元数据,与现有方法相比,显著降低了流行病学估计中的偏差。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试拼凑一个巨大的拼图,但每当你看向拼图盒时,都会发现有人偷偷拿走了其中的几块。在医学科学的世界里,这些拼图通常是由多年来收集的患者数据组成的,这种数据被称为“纵向”研究。有时,缺失的不只是碎片,而是呈现出某种特定的模式。例如,如果一名患者牙齿疼痛,牙医可能会仔细记录下来,但如果牙齿看起来完全健康,为了节省时间,他们可能会跳过记录。这产生了一个“层级化”的问题:数据不仅仅是一个扁平的列表,它是分层组织的。把一名患者想象成一个大盒子,盒子里装着他们的牙齿,而每颗牙齿内部又有牙医检查牙周疾病的微小位点。如果牙医跳过了对某些位点的检查,那么整个患者健康的图像就会变得模糊。科学家们担心,如果试图利用这些模糊的图像来研究疾病的成因,可能会得出错误的结论,比如误以为某个风险因素(如吸烟)并没有实际看起来那么危险。
这篇论文解决了一个非常具体且高风险的拼图问题:牙科记录。牙医在单次就诊中可能会检查一个人口腔内多达 192 个微小位点。在现实生活中,他们很少每次都检查全部 192 个位点。研究人员问道:我们能否利用数学方法准确地“猜出”缺失的位点,从而修复这张模糊的图像?他们测试了一种名为“聚类逻辑因子”(Clustered Logistic Factor,简称 CLF)填补法。你可以把这种方法想象成一位超级聪明的侦探,他知道如果一颗牙齿上的一个位点生病了,那么紧邻它的位点也很可能生病;他也知道如果一名患者在某次就诊时牙龈状况不佳,那么他们在上次就诊时很可能也是如此。团队将这位侦探与其他方法进行了比较,比如一个只看整体而不注意微小位点的简单猜测者,或者一台试图记住每一个细微联系但由于数学计算过于复杂而在面对大量患者时会崩溃的复杂机器。
主要发现是,由缺失数据导致的“模糊图像”是一个严重的问题。当研究人员模拟缺失数据时,他们发现风险因素(如吸烟、糖尿病和年龄)与牙周疾病进展之间的联系被削弱了多达四倍。这就像是疾病隐藏了它的真实强度。然而,当研究人员使用新的 CLF 侦探法来填补缺失的位点时,图像重新变得清晰。该方法成功恢复了这些联系的真实强度,与仅观察不完整数据相比,将误差减少了 3 到 15 倍。
该论文还明确反对了几种常见的方法。它表明一种名为“K-最近邻”(K-nearest neighbors)的简单方法(即根据患者整体的相似性进行猜测)表现不佳,就像一个忽略了拼图具体布局的侦探。它还证明了一种更复杂、标准的名为“MICE-2l.bin”的方法——该方法试图解释层级结构中的每一个层面——对于计算机来说过于沉重,当患者人数超过 100 人时,它会因为内存不足而直接崩溃。作者建议,虽然一种更简单的模型(MICE-logreg)在预测单个位点方面与他们的新方法表现同样出色,但他们的新 CLF 方法是唯一既能理解牙齿“聚类”特性,又足够轻量、能在标准计算机上处理大规模人群的工具。
当他们在来自新加坡的 721 名患者的真实数据上进行测试时,结果令人震惊。不完整的记录掩盖了轻度至中度牙周疾病的真实情况。通过填补空白,研究人员发现,这种疾病的实际患病率比不完整记录显示的要高出 7 到 11 个百分点。事实证明,“缺失”的数据并非随机产生的;系统性地低估了早期问题的存在。论文总结道,虽然他们的方法并不是能解决一切问题的魔杖(如果缺失数据与疾病之间的关系完全违背了概率规则,该方法仍会面临挑战),但它是一个实用且可扩展的工具,可以帮助流行病学家通过电子健康记录看到疾病的真实规模,防止他们低估问题的严重程度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。