← Últimos artículos
📊 statistics

Comparing Missing Data Methods for Estimating Average Treatment Effects Under Time-Varying Confounding: A Simulation Study

Este estudio de simulación evalúa el desempeño de varios métodos de imputación de datos faltantes para estimar los efectos promedio del tratamiento bajo confusión variante en el tiempo, encontrando que la imputación múltiple generalmente supera a otros enfoques al reducir el sesgo y mejorar la cobertura, particularmente cuando los mecanismos de ausencia son complejos.

Autores originales: Ben Swallow, Lars Brestrich, Victor Velasco-Pardo

Publicado 2026-07-21
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ben Swallow, Lars Brestrich, Victor Velasco-Pardo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio: "¿Comer un tipo específico de caramelo te hace correr más rápido?". En el mundo real, no puedes simplemente meter a todo el mundo en un laboratorio y obligarlos a comer o no caramelos; tienes que observar a las personas que eligen sus propios bocadillos. Pero aquí está el truco: las personas que eligen el caramelo también podrían ser aquellas que ya corren más rápido porque hacen más ejercicio. Este factor adicional, el ejercicio, se llama confundidor. Para obtener la verdadera respuesta, tienes que "nivelar el campo de juego" matemáticamente para que los comedores de caramelos y los no comedores se vean lo más similares posible en todos los sentidos, excepto por el caramelo. Esto es el corazón de la inferencia causal.

Sin embargo, la vida real es desordenada. A veces, a la gente se le olvida decirte qué comió, o dejan de aparecer en la carrera por completo. Esto es datos faltantes. Si simplemente desechas a las personas con información faltante, podrías estar desechando accidentalmente a los corredores lentos que olvidaron informar, dejando con un grupo que parece súper rápido solo porque perdiste a los lentos. Esto crea una imagen sesgada. Los científicos han construido herramientas matemáticas sofisticadas para adivinar los valores faltantes y arreglar la imagen, pero necesitan saber qué herramienta funciona mejor cuando las piezas faltantes faltan por diferentes razones. Este artículo profundiza en ese problema exacto, probando qué método es el mejor detective cuando las pistas están incompletas.


La Gran Carrera de los Datos Faltantes

En este estudio, los autores, Ben, Lars y Victor, decidieron jugar un enorme juego de "¿Qué pasaría si...?" usando una simulación por computadora. En lugar de personas reales, crearon 500 versiones diferentes de un mundo falso donde se administraba una vacuna (el tratamiento) a pacientes a lo largo del tiempo. Querían ver si la vacuna funcionaba, pero sabían que los pacientes tenían diferentes historiales de salud (confundidores) que podrían arruinar los resultados.

Para complicar las cosas, rompieron deliberadamente sus propios datos. Hicieron que la información desapareciera de tres maneras diferentes:

  1. El Error Aleatorio (MCAR): Los datos desaparecen como el lanzamiento de una moneda, sin patrón alguno.
  2. El Patrón Predecible (MAR): Los datos desaparecen basándose en cosas que sabemos, como si un paciente es mayor, es más probable que tenga registros faltantes.
  3. El Secreto Sigiloso (MNAR): Los datos desaparecen basándose en el valor secreto mismo. Por ejemplo, si la salud de un paciente era realmente mala, era más probable que abandonara el estudio, y esa salud terrible es exactamente lo que falta.

Probaron cuatro diferentes "equipos de reparación" para arreglar los datos rotos:

  • El Equipo de "Solo Desecharlo" (Análisis de Caso Completo): Simplemente eliminaban a cualquiera con una pieza de información faltante.
  • El Equipo de "Adivinar lo Más Común" (Imputación de Modo Único): Si faltaba un valor, simplemente lo llenaban con la respuesta más común que veían (como suponer que todos son "Diestros" porque la mayoría lo es).
  • El Equipo de "Encontrar un Gemelo" (Hot Deck Estratificado): Buscaban a una persona que fuera exactamente igual a la que tenía los datos faltantes y tomaban prestada su respuesta.
  • El Equipo de la "Supercomputadora" (Imputación Múltiple): Este método crea cinco versiones diferentes del conjunto de datos, llena los huecos con conjeturas ligeramente diferentes cada vez, y luego promedia los resultados para tener en cuenta la incertidumbre.

Los Resultados: ¿Quién Gana la Carrera?

Después de ejecutar 500 simulaciones para cada escenario (un total de 48 mundos diferentes), los resultados fueron claros.

El Ganador: El Equipo de la Supercomputadora (Imputación Múltiple) fue el campeón indiscutible. En casi todas las situaciones, produjeron las respuestas más precisas con la menor cantidad de error. Incluso cuando los datos faltaban de la manera sigilosa y secreta (MNAR), lograron mantener honestos sus intervalos de confianza (su "margen de error"), incluso si la respuesta no era perfecta. Ellos fueron el único equipo que no se desmoronó por completo cuando los datos se volvieron desordenados.

Los Perdedores:

  • El Equipo de "Solo Desecharlo" estuvo bien cuando los datos faltaban de forma aleatoria, pero tan pronto como la ausencia de datos tuvo un patrón, empezaron a dar respuestas sesgadas. También tuvieron más dificultades cuando los "confundidores" (los factores extra) eran muy fuertes.
  • El Equipo de "Adivinar lo Más Común" tuvo un desempeño deficiente en todos los ámbitos. Llenar los datos binarios faltantes (como Sí/No) con la respuesta más común distorsionó la realidad de la situación, llevando a estimaciones erróneas.
  • El Equipo de "Encontrar un Gemelo" fue mejor que los dos primeros, pero aun así no pudieron igualar la precisión del Equipo de la Supercomputadora.

Los Giros de la Trama

El estudio encontró que la razón por la cual los datos faltaban importaba más que cualquier otra cosa. Cuando los datos faltaban debido a una razón secreta (MNAR), todos tuvieron dificultades, pero el Equipo de la Supercomputadora lo manejó mejor.

También descubrieron que el tamaño del grupo importaba. Con grupos más pequeños (1,000 personas), los resultados eran más inestables y menos fiables. Con grupos más grandes (5,000 personas), los métodos funcionaban mucho mejor.

Curiosamente, la fuerza del confundido (cuánto afectaban las cosas extra) no cambió mucho el sesgo (la dirección del error), pero sí hizo que los intervalos de confianza se encogieran o se expandieran. Cuando el confundido era muy fuerte, los equipos de "Solo Desecharlo" y "Adivinar lo Más Común" tuvieron un tiempo mucho más difícil para encontrar la verdad, mientras que el Equipo de la Supercomputadora se mantuvo relativamente estable.

La Conclusión

Este estudio de simulación sugiere que si estás tratando de descubrir la causa y el efecto en un mundo lleno de datos faltantes, la Imputación Múltiple es tu mejor opción. Es la herramienta más robusta en la caja de herramientas. Aunque los métodos más simples, como simplemente eliminar los casos faltantes, puedan parecer más fáciles, a menudo te llevan por el camino equivocado, especialmente cuando los datos faltantes no son solo mala suerte aleatoria.

Los autores advierten que, aunque sus simulaciones por computadora muestran estos resultados claramente, la vida real es aún más desordenada que sus mundos ficticios. Sugieren que la investigación futura debería observar formas aún más complejas en las que los datos pueden faltar y probar herramientas aún más sofisticadas. Pero por ahora, si quieres resolver el misterio de la causa y el efecto sin perder la cabeza por las pistas faltantes, el Equipo de la Supercomputadora es al que debes confiar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →