← Últimos artículos
🤖 machine learning

ImputeViz: A Visual Analytics Dashboard for Diagnosing Missing Data and Comparing Imputation Methods

ImputeViz es un tablero de análisis visual interactivo que permite a los investigadores diagnosticar patrones de datos faltantes, configurar y comparar diversos métodos de imputación (incluyendo un novedoso gKNN con información geográfica) y evaluar su impacto a través de vistas coordinadas y métricas cuantitativas para apoyar un análisis de datos robusto y responsable.

Autores originales: Aitik Dandapat, Lalith Punepalle Raveendrareddy, Mithilesh Kumar Singh, Klaus Mueller

Publicado 2026-07-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Aitik Dandapat, Lalith Punepalle Raveendrareddy, Mithilesh Kumar Singh, Klaus Mueller

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un misterio, pero la mitad de las pistas en tu libreta han sido arrancadas. En el mundo de la ciencia de datos, estas pistas arrancadas se llaman datos faltantes. A veces, faltan debido a un accidente aleatorio (como un derrame de café), pero a menudo faltan a propósito o debido a un patrón—como un pueblo que es demasiado pequeño para reportar sus cifras, o un tipo específico de persona que se niega a responder una encuesta. Si simplemente adivinas los números faltantes sin pensar, podrías terminar con una imagen completamente errónea del mundo.

Presentamos ImputeViz, un nuevo tablero de control digital creado por investigadores de la Universidad de Stony Brook. Piensa en esto como un "tablero de detective superpotente" que no solo llena los huecos; te ayuda a descubrir por qué están ahí los huecos, cómo llenarlos y quién te ayudó a llenarlos.

El problema con las suposiciones de "Caja Negra"

Normalmente, cuando los analistas tienen datos faltantes, eligen una herramienta estándar (como una varita mágica) para adivinar los valores faltantes y esperan lo mejor. Podrían ejecutar una herramienta, luego otra, e intentar recordar si los números se veían diferentes. Es como intentar comparar dos mapas diferentes de la misma ciudad, pero un mapa está con zoom y el otro está alejado, haciendo imposible saber qué ruta es realmente mejor. Los autores argumentan que este enfoque de "caja negra" es arriesgado porque oculta por qué se eligió un número y hace que sea difícil ver si la suposición tiene sentido.

La solución: Un tablero para escenarios de "¿Qué pasaría si...?"

ImputeViz cambia las reglas del juego al permitirte jugar con diferentes estrategias de suposición una al lado de la otra. El sistema incluye varios "motores de suposición" famosos:

  • MICE: Un método que pide ayuda a otras variables en los datos, como un chat grupal resolviendo un rompecabezas.
  • Random Forest & XGBoost: Poderosos métodos basados en árboles que buscan patrones complejos.
  • kNN (k-Nearest Neighbors): Un método que dice: "Si te pareces a tus vecinos, probablemente tengas los mismos valores".
  • gKNN (Geographically Informed kNN): Esta es la invención especial del sistema. Es una versión supercargada de kNN que no solo mira qué tan similares son las personas; también mira qué tan cerca están en un mapa.

El arma secreta: gKNN

Los investigadores introdujeron gKNN para manejar casos donde la ubicación importa. Imagina que estás tratando de adivinar la temperatura promedio en un pueblo que nunca has visitado. Un adivinador normal podría mirar un pueblo con el mismo tamaño de población, incluso si está al otro lado del país. gKNN es más inteligente: combina la "similitud social" (como ingresos o educación) con la "distancia geográfica". Pregunta: "¿Quiénes son los vecinos que son tanto socialmente similares como físicamente cercanos?".

En sus pruebas, cuando intentaron llenar datos faltantes para las tasas de mortalidad por opioides recetados en los condados de EE. UU. (de 2000 a 2022), gKNN sugirió que era el adivinador más preciso. En una prueba específica donde ocultaron datos para imitar las brechas de reporte del mundo real, gKNN tuvo un error promedio (MAE) de 2.96, mientras que los siguientes mejores métodos rondaron los 3.28 a 3.46. Los autores señalan que esta mejora fue más obvia cuando los datos faltantes estaban agrupados en áreas de pocos condados, sugiriendo que saber dónde estás ayuda a adivinar qué es lo que falta.

Sin embargo, el artículo tiene cuidado de no decir que gKNN gana en todas partes. Cuando probaron el sistema en un conjunto de datos de abandono de telecomunicaciones (que no tiene mapa ni geografía involucrada), un método diferente llamado Random Forest tomó el liderazgo, superando a MICE con una diferencia masiva de error. Esto demuestra el punto principal del artículo: no hay una única herramienta "mejor" para cada trabajo. Tienes que probarlas.

El trabajo detectivesco del "Donante"

Una de las características más geniales de ImputeViz es la proveniencia. Cuando el sistema adivina un número faltante, no solo te da el número; te muestra quién ayudó. Si el sistema adivina la tasa de mortalidad del Condado A, resalta los condados "donantes" específicos que contribuyeron a esa suposición.

En el estudio de los opioides, los investigadores encontraron que, a veces, un método estándar (kNN) adivinaba un número correctamente pero dependía de un "donante" que estaba a cientos de millas de distancia. La vista de mapa en ImputeViz hizo esto evidente, mostrando que la suposición se basaba en una conexión larga y débil. El método gKNN, por el contrario, se mantuvo con los vecinos cercanos, haciendo que la suposición se sintiera más confiable. Los autores sugieren que ver estos "senderos de donantes" ayuda a los analistas a decidir si una suposición es plausible o si es solo un accidente de suerte.

¿Qué tan seguros están?

Los investigadores no solo supusieron que esto funciona; lo midieron. Ejecutaron su sistema en dos conjuntos de datos del mundo real:

  1. Mortalidad por opioides en condados de EE. UU. (2000–2022): Probaron cuatro formas diferentes de ocultar datos (aleatoriamente, o simulando brechas de reporte reales) y encontraron que gKNN consistentemente tuvo las tasas de error más bajas en estas simulaciones.
  2. Abandono de telecomunicaciones (Telecom Churn): Un conjunto de datos no geográfico donde encontraron que los modelos basados en árboles eran mejores.

También pidieron a 7 personas que probaran el tablero. Los usuarios le dieron una puntuación de "SUS" (Escala de Usabilidad del Sistema) de 75.4 (de 100), que se considera una buena puntuación. Los evaluadores amaron poder cambiar entre métodos instantáneamente y ver cómo los resultados se actualizaban sin que las escalas cambiaran, lo que hizo que compararlos fuera mucho más fácil.

La conclusión

ImputeViz sugiere que arreglar los datos faltantes no es solo ejecutar una fórmula matemática; se trata de entender la historia detrás de los números faltantes. Al permitir que los analistas comparen diferentes métodos uno al lado del otro, verifiquen los "donantes" detrás de cada suposición y vean cómo la geografía juega un papel, el sistema les ayuda a tomar decisiones más inteligentes y transparentes. No afirma haber resuelto el problema de los datos faltantes para siempre, pero ofrece una forma mucho más clara de navegar por el caos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →