Challenges in the calibration of tree-based models for imbalanced classification
Este artículo demuestra que la calibración analítica de modelos basados en árboles entrenados con datos desbalanceados mediante submuestreo conduce a estimaciones de prevalencia poco fiables y sesgos inesperados, argumentando en su lugar el uso de métodos de calibración basados en el aprendizaje como la calibración beta.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La visión general: El problema de la "receta"
Imagina que eres un chef tratando de aprender a hacer una sopa perfecta. Sin embargo, tu cocina está increíblemente desequilibrada: tienes 10,000 patatas pero solo 10 zanahorias. Si intentas aprender la receta probando un tazón que tiene 10,000 patatas y 10 zanahorias, nunca aprenderás a qué sabe una zanahoria. Pensarás que la sopa es 99.9% patata.
Para solucionar esto, decides submuestrear (undersampling). Tiras la mayoría de las patatas para quedarte con un tazón de 50 patatas y 10 zanahorias. Ahora, tus datos de entrenamiento están equilibrados y puedes aprender mejor la receta.
El problema: Cuando finalmente cocinas la sopa para el mundo real (donde en realidad hay 10,000 patatas), tus papilas gustativas todavía están acostumbradas al tazón equilibrado. Piensas que la sopa es 50% zanahoria, pero en realidad sigue siendo 99.9% patata. Tus predicciones están "sesgadas".
La solución antigua: La "fórmula matemática"
Durante mucho tiempo, los científicos de datos utilizaron una fórmula matemática específica (la Ecuación 1 del artículo) para solucionar esto. La idea era simple: "Sabemos que tiramos el 90% de las patatas. Simplemente multipliquemos nuestra predicción por un número para 'sumarlas de nuevo' matemáticamente".
Los autores de este artículo dicen: "Dejen de hacer eso".
Descubrieron que esta fórmula matemática no funciona bien para los Modelos Basados en Árboles (como los Random Forests). En lugar de arreglar la sopa, la fórmula hace que el sabor sea salvajemente impredecible.
Los dos problemas principales descubiertos
1. El problema de la "perilla" (Número de predictores)
Imagina que tu Random Forest es un equipo de 500 detectives tratando de resolver un misterio.
- La regla: En cada paso, los detectives solo pueden mirar un cierto número de pistas (predictores) para decidir hacia dónde ir.
- El experimento: Los autores giraron una "perilla de pistas". A veces dejaban que los detectives miraran solo 2 pistas. Otras veces, les dejaban mirar 15 pistas.
¿Qué pasó?
Cuando usaron la vieja fórmula matemática para corregir el sesgo, la respuesta final cambiaba drásticamente dependiendo de cuántas pistas se les permitía mirar a los detectives.
- Si miraban 2 pistas, el modelo predecía 100 incendios.
- Si miraban 15 pistas, el modelo predecía 140 incendios.
La analogía: Es como pedirle a un grupo de personas que adivinen el peso de una sandía. Si les dices que solo miren el color, estiman 10 libras. Si les dices que miren el color, el tallo, el sonido al golpearla y la textura, estiman 15 libras.
En un mundo perfecto, la fórmula matemática debería haber corregido estas estimaciones para que todas llegaran al mismo peso real. Pero en cambio, la fórmula hizo que las estimaciones se alejaran más entre sí. Cuantas más pistas usaban los detectives, más subía la estimación final.
2. El "Sesgo Sorprendente" (Tasa de muestreo)
Normalmente, pensamos que si tienes muy pocos elementos de la "clase minoritaria" (como las 10 zanahorias), el modelo los ignorará y estimará un valor bajo.
- La creencia antigua: "Los árboles de decisión ignoran la clase minoritaria".
- El descubrimiento del artículo: En sus experimentos, ¡los árboles de decisión hicieron lo contrario! Sobreestimaron la clase minoritaria.
La analogía: Imagina que estás tratando de adivinar cuántas canicas rojas hay en un frasco de 1,000 canicas (990 azules, 10 rojas). Tomas una muestra pequeña.
- Esperado: Podrías decir "tal vez 1 o 2 canicas rojas" (subestimando).
- Lo que hicieron los árboles: Los árboles miraron la muestra y dijeron: "¡Vaya, las canicas rojas están por todas partes! ¡Apuesto a que hay 50 canicas rojas!".
Los autores descubrieron que a medida que cambiaban la tasa de muestreo (cuántas patatas tiraban), la sobreestimación del modelo empeoraba. La fórmula matemática intentaba corregir esto, pero como el árbol ya estaba estimando demasiado alto, la fórmula simplemente hacía que el resultado final fuera aún más caótico.
El ejemplo del mundo real: Incendios forestales
Los autores probaron esto con datos reales sobre incendios forestales en Alberta, Canadá.
- Los incendios forestales son raros (como las zanahorias).
- Utilizaron la "fórmula matemática" para corregir los modelos.
- El resultado: Dependiendo de cómo ajustaran la "perilla de pistas" (número de predictores) o de cómo muestrearan los datos, el modelo predecía que el número de futuros incendios podía variar en un 40%.
- Por qué importa esto: Si una agencia gubernamental utiliza estos modelos para decidir a dónde enviar camiones de bomberos, podrían enviar demasiados camiones a un área y ninguno a otra, simplemente porque ajustaron un parámetro en el código de la computadora.
La conclusión
El artículo concluye que la "fórmula matemática" (calibración analítica) es una herramienta rota para este trabajo específico. Crea una situación en la que:
- Cambiar un ajuste (como el número de pistas) cambia la respuesta, a pesar de que la respuesta no debería cambiar.
- Los modelos a veces estiman que la clase minoritaria es más común de lo que realmente es, y la fórmula no logra corregir esto.
La solución: En lugar de usar una fórmula matemática rígida, los autores sugieren utilizar métodos de "aprendizaje" (como la Calibración Beta). Piensa en esto como contratar a un catador que realmente prueba la sopa final y aprende cómo ajustar el sazón, en lugar de intentar calcular el ajuste con una calculadora.
Resumen en una frase
Usar una fórmula matemática simple para corregir datos "desequilibrados" en modelos basados en árboles no funciona; hace que las predicciones sean salvajemente inestables y a veces causa que el modelo sobreestime eventos raros, por lo que necesitamos formas de aprendizaje más inteligentes para corregir el sesgo en su lugar.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.