← Últimos artículos
📊 statistics

Ablation Study of Class Imbalance Techniques for Credit Default Prediction with SHAP-based Explainability Analysis

Este estudio demuestra que en tareas de predicción de incumplimiento crediticio, el parámetro integrado `scale_pos_weight` de XGBoost supera significativamente a la técnica tradicional de remuestreo SMOTE en cuanto a recall, resaltando que la estrategia óptima para manejar el desequilibrio de clases depende del clasificador específico utilizado en lugar de un método de remuestreo universal.

Autores originales: Atharv Tiwari

Publicado 2026-07-30
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Atharv Tiwari

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando encontrar a un único ladrón escondido entre una multitud de 100 personas. Noventa y dos de ellos son inocentes, y solo ocho son culpables. Si simplemente adivinas "todos son inocentes", ¡tendrías razón el 92% de las veces! Pero capturarías a cero ladrones. En el mundo de la informática, esto se llama el problema del "desequilibrio de clases". Ocurre cuando un modelo informático es entrenado con datos donde un resultado (como que un préstamo sea devuelto) sucede con mucha más frecuencia que otro (que un préstamo se impague). Debido a que la computadora ve tantos ejemplos "buenos", se vuelve perezosa y simplemente predice "bueno" para todos, fallando al detectar los casos "malos" que son poco comunes.

Durante años, la solución estándar para esto ha sido una técnica llamada SMOTE. Piensa en SMOTE como una fotocopiadora para los casos raros. Si solo tienes ocho fotos de ladrones, SMOTE crea fotos sintéticas y falsas de nuevos ladrones mezclando y combinando detalles de los reales, con la esperanza de darle a la computadora suficiente práctica para aprender el patrón. Pero hay otra forma. Algunos modelos informáticos, específicamente un tipo potente llamado XGBoost, tienen un "control de volumen" integrado para los errores. En lugar de inventar datos falsos, puedes simplemente decirle a la computadora: "¡Oye, si se te escapa un ladrón, eso es un error enorme! Si se te escapa una persona inocente, es un error pequeño". Esto obliga al modelo a prestar especial atención a los casos raros sin tocar nunca los datos originales.

La gran pregunta es: ¿Es mejor inventar datos de práctica falsos (SMote) o simplemente subir el volumen de los errores (el control integrado)? Un nuevo estudio de Atharv Tiwari, de la Escuela de Ingeniería de Punjab, pone estos dos enfoques frente a frente para ver cuál de ellos atrapa realmente a más ladrones en el mundo real de la calificación crediticia.


El Gran Duelo de las Tarjetas de Crédito

En este estudio, el investigador configuró un experimento masivo utilizando un conjunto de datos del mundo real de más de 300,000 solicitudes de préstamos. En esta multitud, el 92% de las personas pagaron sus préstamos y solo el 8% entró en mora. Era la configuración perfecta para probar qué tan bien diferentes modelos informáticos podían detectar ese 8% sin distraerse con el 92%.

El investigador no solo eligió un modelo; probó tres "detectives" diferentes:

  1. Regresión Logística: El detective de la vieja escuela, confiable, que sigue reglas estrictas.
  2. Random Forest: Un equipo de detectives donde cada uno mira las pistas de manera diferente y votan sobre la respuesta.
  3. XGBoost: Un detective superinteligente que aprende de sus errores uno por uno, volviéndose más agudo con cada ronda.

Cada detective recibió tres estrategias de entrenamiento diferentes:

  • La estrategia de "No hacer nada": Simplemente lanzar los datos brutos y ver qué sucede.
  • La estrategia del "Control de Volumen": Usar los ajustes integrados del modelo para penalizar fuertemente el no detectar a un moroso (sin datos falsos).
  • La estrategia de la "Fotocopiadora": Usar SMOTE para crear morosos falsos para equilibrar los datos de entrenamiento.

El Resultado Sorprendente

Los resultados fueron un poco como un giro de la trama en una película de misterio. La estrategia de "No hacer nada" fracasó estrepitosamente para todos, capturando casi ningún moroso (menos del 2.2% de recall). Eso era de esperar. Pero la batalla entre el "Control de Volumen" y la "Fotocopiadora" fue donde las cosas se pusieron interesantes.

Cuando el investigador utilizó XGBoost, la estrategia del "Control de Volumen" integrado aplastó a la competencia. Logró capturar el 64.8% de los morosos reales. La estrategia de la "Fotocopiadora" (SMOTE), que ha sido la solución predilecta durante décadas, solo capturó el 43.3%. Esa es una brecha masiva de 21.5 puntos porcentuales. El investigador realizó pruebas estadísticas estrictas (llamadas prueba de McNemar) y confirmó que esto no fue una casualidad; la diferencia era tan grande que era estadísticamente segura (p<106p < 10^{-6}).

Sin embargo, la historia cambió completamente cuando cambiaron a Random Forest. Para este modelo, el "Control de Volumen" apenas funcionó (capturando solo el 7.8% de los morosos), mientras que la "Fotocopiadora" (SMOTE) lo hizo mucho mejor, capturando el 41.2%.

Esto sugiere que no existe una única "solución mágica" para solucionar los datos desequilibrados. Lo que funciona para un tipo de modelo informático puede fallar para otro. El estudio sugiere que para el modelo específico y potente XGBoost, simplemente decirle al modelo que se preocupe más por los errores raros es muy superior a alimentarlo con datos sintéticos y falsos.

Por qué la Fotocopiadora Falló (y el Control Ganó)

Entonces, ¿por qué inventar datos falsos perjudicó al modelo XGBoost? El investigador explica que cuando tienes un conjunto de datos complejo con 192 características diferentes (como ingresos, edad e historial crediticio), crear una persona falsa mezclando dos personas reales puede resultar en un "monstruo" que no existe en la realidad. Es como intentar mezclar una foto de un gato y un perro para crear un nuevo animal; el resultado puede verse extraño y confundir a la computadora. El modelo termina aprendiendo del ruido en lugar de patrones reales.

El "Control de Volumen" integrado evita esta trampa por completo. No toca los datos ni crea ejemplos falsos. Solo cambia las matemáticas detrás de escena para decir: "¡No pierdas a los raros!". Esto mantuvo el entrenamiento limpio y permitió que XGBoost se desempeñara en su máximo nivel.

El "Porqué" Detrás del "Quién"

Para asegurarse de que este modelo ganador no fuera solo una caja negra haciendo conjeturas aleatorias, el investigador utilizó una herramienta llamada SHAP (que significa explicaciones aditivas de Shapley). Piensa en SHAP como una lupa que muestra exactamente qué pistas usó el detective para tomar una decisión.

El análisis reveló que el modelo se estaba comportando lógicamente. La pista más importante fue la puntuación de buró externa (un puntaje de crédito de otros bancos). Esto tiene todo el sentido: si alguien tiene un historial de pagar a otros prestamistas, es probable que también te pague a ti. El modelo también observó la relación entre el monto del préstamo y el monto del pago, así como la edad del prestatario. Crucialmente, el razonamiento del modelo era transparente y defendible, lo cual es muy importante para los bancos que necesitan explicar sus decisiones a los reguladores.

La Conclusión

El estudio concluye que antes de empezar a generar miles de puntos de datos falsos para corregir un desequilibrio, deberías probar las herramientas más simples que tu modelo ya posee. Para XGBoost, el pesaje integrado no solo fue más fácil de usar, sino que fue significativamente más efectivo, capturando casi un 22% más de morosos que el método tradicional.

Sin embargo, el investigador advierte que esto no es una regla universal. Debido a que Random Forest funcionó mejor con el método de la "Fotocopiadora", no puedes asumir que una técnica funcione para cada modelo. El mejor enfoque depende enteramente de qué "detective" estés utilizando. El mejor enfoque es probar el control de volumen primero, pero siempre verificar si encaja con tu modelo específico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →