Impact of Missing Data Imputation on The Structure of Real-World Clinical Datasets: A Comparison of Median, K-Nearest Neighbours, and MICE Approaches
本研究表明,在不同缺失程度的真实临床数据集下,k-最近邻(KNN)插补在保持分布保真度和多元结构完整性方面,优于中位数替代法和多重插补链式方程法(MICE)。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学研究领域,数据是发现的生命线。医生和科学家依赖于患者病史、实验室结果和治疗结果的记录来理解疾病并改善护理。然而,现实世界的医疗记录很少是完美的。患者可能会错过预约,机器可能会故障,或者医生可能只是忘了记录某个特定的测量值。这些被称为“缺失数据”的缺口产生了一个问题:如果研究人员试图分析一个带有“漏洞”的数字列表,结果可能会具有误导性,甚至无法计算。为了解决这个问题,研究人员经常使用一种称为“插补”(imputation)的过程来填补空白。最常见且最简单的方法是观察某一特定测量值的现有数字,找到中间值,然后将该相同的数字粘贴到每一个空缺处。虽然这种方法操作简便,但它有一个已知的缺陷:它会抹平数据的自然多样性,使一群原本具有多样性的患者看起来比实际情况更加趋同。一种更复杂的方法涉及使用复杂的计算机模型,根据患者的其他相关信息来推测缺失数字可能的值。科学界面临的问题是,简单的法是否足够好,还是必须使用复杂的方法来保持数据的真实性。
来自西班牙瓦伦西亚的一个研究小组通过测试三种不同的填补医疗记录空白的方法,试图回答这个问题。他们并没有创建虚假数据来测试理论,而是使用了两个大型的真实患者信息集。第一组由408名接受过肺移植的患者组成,这是一种复杂的程序,医生需要在手术前、术中和术后追踪数十项测量指标。第二组包括1700名遭受过心肌梗塞的患者,其记录详细记载了他们的生命体征和病史。在这两组中,许多数字都是缺失的。在肺移植组中,某些测量值的缺失率从极少数患者的0.2%到高达77.9%不等。在心肌梗塞组中,缺失数据从0.24%到超过63%不等。研究人员想要观察哪种填补空白的方法能最好地保留原始数据的真实形状和关系。
该团队比较了三种具体的策略。第一种是标准的简单方法:用记录下来的数字的中位数(即中间值)替换每一个缺失的数字。第二种是称为“k-最近邻”(k-nearest neighbours)的方法,其原理是寻找数据库中与缺失数据的患者最相似的人,并利用他们的数值来进行推测。第三种是被称为“多重插补”(multiple imputation)的高度复杂的统计技术,它运行一系列复杂的模型来生成多个不同的缺失数据版本,然后取其平均值。研究人员使用一种检查分布情况是否一致的统计标尺,来衡量填补后的数据与原始完整数据的匹配程度。他们还检查了不同变量之间的关系(例如年龄如何与血压相关联)是否保持完好。
结果令许多预期“最复杂的方法总是最好的”的人感到惊讶。使用中间值的简单方法确实扭曲了数据,压缩了数字的多样性,使数据集看起来比真实的更缺乏多样性。然而,那个复杂的、多步骤的统计模型在这次特定测试中的表现甚至更差。它引入了最大的误差,并且比任何其他方法都更剧烈地改变了变量之间的关系。表现最好的方法是“k-最近邻”法。它保留了数据的自然分布,并使不同医疗测量值之间的关系比简单的中间值法或复杂模型都更加准确。在肺移植组中,复杂模型扭曲了近39%的变量,而k-最近邻法仅扭曲了约11%。在心肌梗塞组中,复杂模型扭曲了39%的变量,而k-最近邻法仅扭曲了11%。
研究人员发现,随着缺失数据量的增加,所有方法都会出错,但k-最近邻法出错的速度要慢得多。当一个变量具有高比例的缺失数字时,简单的中间值法和复杂模型都难以让数据看起来真实,但k-最近邻法表现得更为稳健。这可能是因为复杂模型试图为每一个单独的变量建立一个完美的数学规则,而当变量过多且用于学习的患者不足时,这变得非常困难。相比之下,k-最近邻法只需观察最相似的患者并复制他们的模式,即使在数据混乱或不完整的情况下也能运作良好。
这项研究并不是暗示复杂的统计模型毫无用处。该模型的设计初衷是提供一系列可能的答案,并考虑到由于不知道真实数值而产生的确定性问题,这对于某些类型的深度统计分析至关重要。然而,对于许多只需要一个干净、完整的数据库来描述一组患者或探索变量间关系的研究人员来说,复杂的模型可能大材小用,甚至适得其反。研究结果表明,对于创建一个单一且可靠的医疗数据集版本,k-最近邻法提供了一种强大的平衡。它比仍在广泛使用的简单中间值法更准确,且比复杂的模型更容易使用,因为它不需要研究人员做出过多的技术决策。
这项研究为医学科学提出了一个实践性的教训:有时,最先进的工具并不一定是完成这项工作的最佳选择。在医院记录这种混乱的现实中,患者的资料往往是不完整的且各具特色,通过观察相似患者来填补空白的方法,比使用僵化的数学公式更能保留数据的真实故事。通过选择正确的工具,研究人员可以确保他们发现的数据模式反映的是所研究患者的现实,而不是他们试图修复缺失数字时产生的偏差。这项工作为那些希望在保持数据真实性的同时,又不至于陷入不必要复杂性的科学家们,提供了一条清晰的前行之路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。