← Últimos artículos
📊 statistics

Impact of Missing Data Imputation on The Structure of Real-World Clinical Datasets: A Comparison of Median, K-Nearest Neighbours, and MICE Approaches

Este estudio demuestra que la imputación por k-vecinos más cercanos (KNN) supera tanto a la sustitución por mediana como a la imputación múltiple mediante ecuaciones encadenadas (MICE) en la preservación de la fidelidad de la distribución y la integridad estructural multivariante de conjuntos de datos clínicos del mundo real a través de diversos niveles de ausencia de datos.

Autores originales: Karol Aguiar Quevedo, Alilis Fontana Bellorín, Carlos Jordá Jordá Aragón, Cristóbal Aguilar-Gallardo

Publicado 2026-08-24
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Karol Aguiar Quevedo, Alilis Fontana Bellorín, Carlos Jordá Jordá Aragón, Cristóbal Aguilar-Gallardo

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la investigación médica, los datos son el alma del descubrimiento. Los médicos y científicos dependen de los registros del historial de los pacientes, los resultados de laboratorio y los resultados de los tratamientos para comprender las enfermedades y mejorar la atención. Sin embargo, los registros médicos del mundo real rara vez son perfectos. Los pacientes pierden citas, las máquinas fallan o los médicos simplemente olvidan anotar una medición específica. Estas brechas, conocidas como datos faltantes, crean un problema: si un investigador intenta analizar una lista de números con huecos, los resultados pueden ser engañosos o imposibles de calcular. Para solucionar esto, los investigadores suelen rellenar los espacios en blanco mediante un proceso llamado imputación. La forma más común y sencilla de hacerlo es observar todos los números que tienen para una medición específica, encontrar el valor central y pegar ese mismo número en cada espacio vacío. Aunque esto es fácil de hacer, tiene un fallo conocido: aplana la variedad natural de los datos, haciendo que un grupo diverso de pacientes parezca más idéntico de lo que realmente es. Un enfoque más sofisticado consiste en utilizar complejos modelos informáticos para adivinar cuáles podrían ser los números faltantes basándose en cómo se relacionan con otra información sobre el paciente. La pregunta que enfrenta la comunidad científica es si el método sencillo es suficiente, o si el método complejo es necesario para mantener la honestidad de los datos.

Un equipo de investigadores de Valencia, España, se propuso responder a esta pregunta probando tres formas diferentes de rellenar los huecos en registros médicos reales. No crearon datos falsos para probar sus teorías; en su lugar, utilizaron dos grandes colecciones reales de información de pacientes. El primer grupo consistía en 408 pacientes que se habían sometido a un trasplante de pulmón, un procedimiento complejo donde los médicos rastrean docenas de mediciones antes, durante y después de la cirugía. El segundo grupo incluía a 1.700 pacientes que habían sufrido un ataque cardíaco, con registros que detallaban sus signos vitales e historial médico. En ambos grupos, muchos números estaban ausentes. En el grupo de trasplante de pulmón, algunas mediciones faltaban en tan solo el 0,2 por ciento de los pacientes hasta un máximo del 77,9 por ciento. En el grupo de ataque cardíaco, los datos faltantes oscilaban entre el 0,24 por ciento y más del 63 por ciento. Los investigadores querían ver qué método de relleno de estos espacios en blanco preservaba mejor la verdadera forma y las relaciones de los datos originales.

El equipo comparó tres estrategias específicas. La primera fue el enfoque estándar y sencillo: reemplazar cada número faltante con la mediana, o el valor central, de los números que fueron realmente registrados. El segundo método fue el de los k-vecinos más cercanos (k-nearest neighbours), que funciona encontrando a los pacientes en la base de datos que son más similares al que tiene el dato faltante y utilizando sus valores para hacer una suposición. El tercero fue una técnica estadística altamente compleja conocida como imputación múltiple, que ejecuta una serie de modelos sofisticados para generar varias versiones diferentes posibles de los datos faltantes y luego promediarlas. Los investigadores midieron qué tan cerca estaba el conjunto de datos rellenado del conjunto de datos original y completo utilizando una regla estadística que comprueba si la distribución de los números parece la misma. También comprobaron si las relaciones entre diferentes variables, como la relación entre la edad y la presión arterial, permanecían intactas.

Los resultados fueron sorprendentes para muchos que esperan que el método más complejo sea siempre el mejor. El método sencillo de usar el valor central, en efecto, distorsionó los datos, comprimiendo la variedad de números y haciendo que el conjunto de datos pareciera menos diverso de lo que realmente era. Sin embargo, el modelo estadístico complejo, de múltiples pasos, funcionó incluso peor en esta prueba específica. Introdujo los mayores errores y alteró las relaciones entre las variables más que cualquier otro método. El método que mejor funcionó fue el enfoque de los k-vecinos más cercanos. Este preservó la dispersión natural de los datos y mantuvo las relaciones entre las diferentes mediciones médicas más precisas que tanto el método sencillo del valor central como el modelo complejo. En el grupo de trasplante de pulmón, el modelo complejo distorsionó casi el 39 por ciento de las variables, mientras que el método de los k-vecinos más cercanos solo distorsionó alrededor del 11 por ciento. En el grupo de ataque cardíaco, el modelo complejo distorsionó el 39 por ciento de las variables, mientras que el método de los k-vecinos más cercanos distorsionó solo el 11 por ciento.

Los investigadores descubrieron que, a medida que aumentaba la cantidad de datos faltantes, todos los métodos cometían más errores, pero el método de los k-vecinos más cercanos cometía errores mucho más lentamente. Cuando una variable tenía un alto porcentaje de números faltantes, tanto el método sencillo del valor central como el modelo complejo tuvieron dificultades para mantener los datos con apariencia real, pero el método de los k-vecinos más cercanos resistió mejor. Esto se debe probablemente a que el modelo complejo intenta construir una regla matemática perfecta para cada variable, lo cual se vuelve difícil cuando hay muchas variables y no hay suficientes pacientes para aprender de ellos. El método de los k-vecinos más cercanos, por el contrario, simplemente observa a los pacientes más similares y copia su patrón, lo que funciona bien incluso cuando los datos son desordenados o incompletos.

Este estudio no sugiere que el modelo estadístico complejo sea inútil. Ese modelo está diseñado para un propósito diferente: proporcionar un rango de respuestas posibles y dar cuenta de la incertidumbre de no conocer los números reales, lo cual es crucial para ciertos tipos de análisis estadístico profundo. Sin embargo, para muchos investigadores que simplemente necesitan un conjunto de datos limpio y completo para describir a un grupo de pacientes o para explorar relaciones entre variables, el modelo complejo puede ser excesivo e incluso contraproducente. Los hallazgos sugieren que, para crear una versión única y fiable de un conjunto de datos médicos, el método de los k-vecinos más cercanos ofrece un equilibrio poderoso. Es mucho más preciso que el método sencillo del valor central, que todavía se usa ampliamente, y es más fácil de usar que el modelo complejo, ya que requiere menos decisiones técnicas por parte del investigador.

El estudio destaca una lección práctica para la ciencia médica: a veces, la herramienta más sofisticada no es la mejor para el trabajo. En la realidad desordenada de los registros hospitalarios, donde los datos suelen estar incompletos y los perfiles de los pacientes son únicos, un método que observa a pacientes similares para rellenar los huecos puede preservar mejor la verdadera historia de los datos que una fórmula matemática rígida. Al elegir la herramienta adecuada, los investigadores pueden asegurar que los patrones que descubren en sus datos reflejen la realidad de los pacientes que están estudiando, en lugar de los artefactos de cómo intentaron arreglar los números faltantes. Este trabajo proporciona un camino claro para los científicos que desean mantener la honestidad de sus datos sin estancarse en una complejidad innecesaria.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →