← Últimos artículos
📊 statistics

Clustering data with values missing at random using scale mixtures of multivariate skew-normal distributions

Este artículo propone un algoritmo de tipo EM aumentado para el agrupamiento basado en modelos de datos con valores faltantes al azar mediante la extensión de la mezcla finita de mezclas de escala de distribuciones normales asimétricas para manejar simultáneamente la asimetría, las colas pesadas y las observaciones incompletas.

Autores originales: Jason Pillay, Cristina Tortora, Antonio Punzo, Andriette Bekker

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jason Pillay, Cristina Tortora, Antonio Punzo, Andriette Bekker

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio agrupando sospechosos según sus hábitos. En el mundo de la ciencia de datos, esto se llama "clustering" (agrupamiento). Normalmente, un detective tiene una alineación perfecta donde cada sospechoso se presenta con un expediente completo de información. Pero en el mundo real, los expedientes suelen tener páginas faltantes, la tinta está emborronada o los testigos olvidan detalles. Esto es "datos faltantes". Si intentas resolver el misterio ignorando los archivos incompletos, podrías perderte las pistas más importantes. Si intentas adivinar lo que falta, podrías inventar accidentalmente un sospechoso que nunca existió.

Para dar sentido a la información desordenada e incompleta, los científicos suelen utilizar una herramienta llamada "modelo de mezcla" (mixture model). Piensa en esto como una bolsa de canicas de diferentes colores. Si metes la mano y sacas una, no sabes de qué color es, pero sabes que la bolsa es una mezcla de rojo, azul y verde. El objetivo es descubrir cuántos colores hay en la bolsa y cómo es el "promedio" de una canica roja. Durante mucho tiempo, los científicos asumieron que estas canicas eran perfectamente redondas y simétricas, como dados estándar. Pero los datos del mundo real suelen ser desequilibrados: algunas canicas están estiradas o tienen colas pesadas donde se encuentran los valores extremos. Para manejar esto, los científicos desarrollaron las distribuciones "skew-normal" (sesgadas normales), que son como canicas elásticas y desequilibradas que pueden deformarse para adaptarse a formas extrañas.

Sin embargo, había un problema: estas canicas sofisticadas y elásticas eran excelentes cuando los datos estaban completos, pero se desmoronaban cuando los archivos tenían páginas faltantes. No podías simplemente ignorar las partes faltantes, y adivinar era arriesgado. Este artículo interviene para cerrar esa brecha. Toma las poderosas y elásticas canicas "skew-normal" y les enseña cómo manejar la información faltante sin romper las reglas del juego.

Los autores, un equipo de estadísticos de Sudáfrica, Estados Unidos e Italia, han construido un nuevo motor matemático llamado la familia "Finite Mixture of Scale Mixtures of Multivariate Skew-Normal" (FMSMSN). Imagina esta familia como una caja de herramientas que contiene cuatro tipos diferentes de canicas elásticas y desequilibradas: la skew-normal estándar, la skew-t (que maneja valores atípicos extremos), la skew-slash (que maneja valores atípicos aún más salvajes) y la skew-variance-gamma (la más flexible de todas).

El gran avance en este artículo es que descubrieron cómo utilizar toda esta caja de herramientas incluso cuando los datos están incompletos. Lo hicieron asumiendo que los datos faltantes son "Missing At Random" (MAR - Faltantes al Azar). En términos de detective, esto significa que la razón por la que falta un archivo no es porque un sospechoso esté ocultando algo específico sobre sí mismo, sino que quizás el archivo se perdió en el correo o el testigo estaba ocupado. La ausencia no depende del valor secreto en sí. Bajo este supuesto, los autores derivaron un nuevo conjunto de reglas (un algoritmo modificado) que permite a la computadora "rellenar los huecos" matemáticamente mientras descubre los grupos, en lugar de simplemente adivinar o desechar los datos.

Para ver si su nuevo motor funcionaba, el equipo realizó una serie de simulaciones por computadora. Crearon conjuntos de datos falsos con dos grupos de datos, algunos de los cuales estaban cerca entre sí y otros alejados. Luego, borraron deliberadamente el 0%, 20%, 40%, 60% e incluso el 80% de la información de forma aleatoria. Probaron los cuatro tipos de canicas de su caja de herramientas para ver cuál podía encontrar los grupos correctamente y adivinar las formas correctas de las canicas.

Los resultados mostraron que, a medida que más datos faltaban, era más difícil para todos los modelos encontrar los grupos, lo cual es de esperar. Sin embargo, los modelos más complejos y flexibles (como la skew-variance-gamma) generalmente hicieron un mejor trabajo recuperando las formas reales de los datos, incluso con hasta un 80% de la información faltante. El equipo encontró que, aunque ningún modelo era perfecto cuando los datos faltaban, su nuevo método era muy superior a simplemente eliminar las filas incompletas, lo que habría dejado con casi ningún dato con el cual trabajar.

Finalmente, los investigadores llevaron su nuevo método fuera del laboratorio de simulación y lo aplicaron a datos del mundo real: las emisiones globales de dióxido de carbono (CO2). Observaron las emisiones de siete sectores diferentes (como electricidad, manufactura y transporte) para países de todo el mundo. ¿El problema? Más del 84% de las filas en este conjunto de datos estaban incompletas. Si hubieran usado el viejo método de "eliminar lo faltante", habrían tenido que desechar casi todo el conjunto de datos. En su lugar, utilizaron su nuevo algoritmo.

El algoritmo agrupó con éxito a los países en dos clústeres distintos. Un grupo incluía naciones con emisiones generalmente bajas, como partes del norte de África, Canadá y Japón. El otro grupo incluía países con emisiones más altas, incluyendo a EE. UU., China, India y muchas naciones del Sur Global. El análisis sugirió un vínculo entre la mejora del crecimiento económico (PIB) y el aumento de las emisiones de carbono, resaltando que las economías en desarrollo a menudo enfrentan un dilema entre el crecimiento y el impacto ambiental. El estudio concluye que, mediante el uso de este enfoque flexible y amigable con los datos faltantes, los científicos ahora pueden descubrir patrones en datos desordenados del mundo real que antes eran imposibles de ver, ofreciendo una imagen más clara de las tendencias globales sin tener que descartar información valiosa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →