Modeling and estimating skewed and heavy-tailed populations via unsupervised mixture models
Este artículo introduce un modelo de mezcla totalmente no supervisado que combina una distribución lognormal para el cuerpo y una distribución de Pareto generalizada de ubicación cero para la cola para modelar eficazmente datos de cola pesada y no negativos sin requerir la selección de un umbral, ofreciendo una alternativa fácil de estimar a los métodos existentes mediante un algoritmo EM y un paquete de R.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando describir una multitud de personas basándote en su altura. La mayoría tiene una estatura promedio, formando una hermosa y suave colina en el centro de la sala. Pero luego, tienes a unos pocos gigantes al fondo, elevándose por encima de todos los demás.
En el mundo de los datos —como las reclamaciones de seguros, el tamaño de las ciudades o las puntuaciones de baloncesto— este "colina con gigantes" es un problema muy común. La parte central (el "cuerpo") suele seguir un patrón predecible, pero los gigantes (la "cola") son tan enormes y raros que rompen las reglas. Si intentas usar una única fórmula matemática para describir a toda la multitud, generalmente fallas. O ajustas perfectamente a las personas promedio pero ignoras a los gigantes, o ajustas a los gigantes pero haces que las personas promedio parezcan extrañas.
Durante años, los estadísticos han intentado resolver esto "empalmeando" dos fórmulas diferentes: una para el cuerpo y otra para la cola. Pero esto es como intentar pegar dos telas diferentes. Tienes que elegir un punto específico para cortarlas y pegarlas, y tienes que asegurarte de que los bordes coincidan perfectamente para que no haya un bulto. Este "punto de corte" (llamado umbral) es un dolor de cabeza para encontrar, y a veces las matemáticas se vuelven tan complicadas que no puedes calcular la respuesta fácilmente.
La Nueva "Mezcla Mágica"
Marco Bee y Flavio Santi, dos investigadores de la Universidad de Trento, han propuesto una nueva forma de mirar a esta multitud. En lugar de pegar dos telas, sugieren mezclarlas como pintura.
Llaman a esto una mezcla lognormal-GPD estática. Así es como funciona:
- La Pintura del Cuerpo: Utilizan una fórmula "Lognormal", que es excelente para describir los datos cotidianos y promedio (la colina).
- La Pintura de los Gigantes: Utilizan una "Distribución Pareto Generalizada" (GPD), que es una fórmula especial diseñada específicamente para los valores atípicos masivos y raros (los gigantes).
- La Cuchara Mezcladora: No cortan y pegan. En su lugar, dicen: "Vamos a mezclar estas dos pinturas". Un cierto porcentaje de los datos proviene de la pintura Lognormal, y el resto proviene de la pintura GPD.
Lo mejor de todo es que no hay punto de corte. El modelo es "no supervisado", lo que significa que no tienes que adivinar dónde terminan las personas promedio y dónde comienzan los gigantes. La transición es suave, como un degradado, en lugar de una costura dentada.
Cómo lo Probaron
Los autores no solo supusieron que esto funcionaría; realizaron una enorme cantidad de simulaciones por computadora para ver si se mantenía en pie.
- La Prueba "Correcta": Crearon datos falsos que coincidían perfectamente con su nuevo modelo de mezcla. Cuando intentaron encontrar los ingredientes de vuelta, el método funcionó de maravilla, especialmente cuando tenían muchos datos (500 observaciones o más).
- La Prueba "Incorrecta": Intentaron ajustar su nuevo modelo a datos generados por otros métodos más complicados. Incluso cuando los datos no fueron creados por su receta específica, su modelo se ajustó sorprendentemente bien. De hecho, en una prueba utilizando una "Distribución Beta Generalizada", su modelo se ajustó a los datos mejor que los otros dos competidores principales.
- La Prueba de Velocidad: Compararon cuánto tiempo tomaba calcular la respuesta. Su método fue mucho más rápido que el método de "mezcla dinámica" (otro enfoque popular), pero ligeramente más lento que el método "empalmado" más simple. Sin embargo, los autores señalan que su método es mucho más fácil de manejar porque no requiere resolver acertijos matemáticos imposibles.
Prueba del Mundo Real
Para ver si esto funciona en el mundo real, los autores lo probaron en dos conjuntos de datos muy desordenados:
- Reclamaciones de Seguros de Automóviles: Analizaron 6,773 reclamaciones de automóviles de una aseguradora de EE. UU. Los datos estaban sesgados, con muchas reclamaciones pequeñas y algunas masivas. Su modelo de mezcla se ajustó perfectamente a los datos, mientras que los viejos métodos de una sola fórmula (solo Lognormal o solo GPD) fallaron al capturar la imagen completa.
- Fraude Bancario: Analizaron pérdidas por fraude interno en un banco italiano. Nuevamente, los datos eran salvajes y de cola pesada. El modelo de mezcla fue el único que pasó las pruebas de "bondad de ajuste", lo que significa que fue el único que realmente se parecía a los datos reales.
Lo Que Encontraron (y Lo Que No)
El hallazgo principal es que este "mezcla mágica" es una herramienta flexible, confiable y más fácil de usar para modelar datos sesgados y de cola pesada. Sugiere que puedes obtener la misma precisión que los métodos más complejos y difíciles, pero con menos dolores de cabeza computacionales.
Sin embargo, los autores tienen cuidado de no exagerar. Señalan que cuando el tamaño de la muestra es pequeño (como 100 observaciones), las matemáticas pueden volverse un poco inestables, y las estimaciones para la parte "gigante" del modelo pueden variar un poco más. También observan que, aunque el modelo es excelente para ajustar los datos y calcular el riesgo (como el Valor en Riesgo), no fue diseñado principalmente para clasificar a las personas en grupos, aunque las matemáticas sí dan una pista sobre qué "pintura" probablemente creó cada punto de datos.
La Conclusión
El artículo sugiere que para cualquiera que trabaje con datos que tienen una larga cola de valores extremos —como pérdidas de seguros o riesgos financieros— este nuevo modelo de mezcla es un fuerte contendiente. Ofrece una forma suave y sin umbrales de modelar a toda la multitud, desde el promedio hasta el extremo, sin el dolor de cabeza de encontrar el punto de corte perfecto. No es una varita mágica que resuelve todos los problemas instantáneamente, pero es una herramienta más robusta, rápida y flexible que las que están actualmente en el estante.
Todos estos métodos están disponibles de forma gratuita en un paquete de R llamado lognGPD, para que cualquiera pueda intentar mezclar sus propias pinturas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.