← Últimos artículos
🤖 machine learning

An Experimental Study on the Rashomon Effect of Balancing Methods in Imbalanced Classification

Autores originales: Mustafa Cavus, Przemysław Biecek

Publicado 2026-05-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Mustafa Cavus, Przemysław Biecek

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: El Problema de las "Muchas Respuestas Correctas"

Imagina que estás intentando predecir quién ganará una partida de ajedrez. Tienes un conjunto de datos de partidas anteriores, pero hay un problema: el 90% de las partidas fueron ganadas por las blancas, y solo el 10% por las negras. Esto se llama un conjunto de datos desequilibrado.

Si entrenas un modelo informático con estos datos sin arreglarlo, la computadora se vuelve perezosa. Aprende que "las blancas siempre ganan", por lo que predice "blancas" para cada nueva partida. Obtiene un 90% de precisión, pero falla completamente al predecir las victorias de las negras.

Para solucionar esto, los científicos de datos utilizan métodos de equilibrado. Actúan como un chef que añade ingredientes a una sopa:

  • Sobre-muestreo (Oversampling): Copian las partidas raras de "victoria de las negras" para crear más de ellas (como añadir más sal).
  • Sub-muestreo (Undersampling): Tiran algunas de las partidas comunes de "victoria de las blancas" para hacer la olla más pequeña (como eliminar el exceso de agua).

El objetivo es hacer que la computadora preste atención a la clase minoritaria. Pero este artículo plantea una pregunta aterradora: ¿Arreglar los datos crea un nuevo tipo de confusión?

El Efecto Rashomon: El Fenómeno de las "Muchas Verdades"

El artículo utiliza un concepto llamado Efecto Rashomon. Imagina una escena del crimen donde cinco testigos diferentes dan cinco historias distintas. Las cinco historias son plausibles y se ajustan a los hechos igual de bien, pero se contradicen entre sí.

En el aprendizaje automático, el Conjunto de Rashomon es un grupo de diferentes modelos informáticos que todos tienen un rendimiento casi idéntico (todos son "plausibles"), pero que hacen predicciones diferentes para la misma persona o situación.

  • Modelo A dice: "Este solicitante de préstamo es seguro".
  • Modelo B dice: "Este solicitante de préstamo es arriesgado".
  • Ambos modelos tienen la misma puntuación general de precisión.

Si simplemente eliges un modelo al azar (selección ciega), podrías elegir accidentalmente el que niega un préstamo a una buena persona, incluso cuando otro modelo igualmente preciso lo habría aprobado. Esto se llama Multiplicidad Predictiva.

El Experimento: ¿Qué Sucede Cuando Equilibramos los Datos?

Los autores querían saber: ¿El uso de métodos de equilibrado (sobre-muestreo/sub-muestreo) empeora este problema de las "Muchas Verdades"?

Tomaron 21 conjuntos de datos reales diferentes (como detección de spam, fraude con tarjetas de crédito y calidad del vino) y los hicieron pasar por una "fábrica de modelos" (una herramienta llamada Forester) que crea cientos de modelos ligeramente diferentes para cada conjunto de datos. Lo hicieron dos veces:

  1. Usando los datos originales, desequilibrados.
  2. Usando datos equilibrados (después de aplicar los métodos de equilibrado).

Luego midieron tres cosas para ver cuánto discrepaban los modelos entre sí:

  1. Ambigüedad: ¿Cuántas personas reciben respuestas contradictorias? (ej. "5 de cada 100 personas reciben predicciones diferentes").
  2. Discrepancia: ¿Cuál es el peor escenario posible? (ej. "Un modelo específico discrepa con los demás en 20 personas").
  3. Oscuridad (Nueva Métrica): Esta es la nueva idea del artículo. Mide la cantidad promedio de confusión. En lugar de solo preguntar "¿Hay un conflicto?", pregunta "¿Qué desordenado es el conflicto en promedio?". Piénsalo como medir la "niebla" sobre los datos.

Los Hallazgos: La "Solución" Hizo la Niebla Más Espesa

Esto es lo que descubrieron:

  • Los Métodos de Equilibrado Aumentan la Confusión: Cuando usaron métodos de equilibrado (como SMOTE o sobre-muestreo aleatorio), la Oscuridad y la Discrepancia aumentaron.
    • La Analogía: Imagina que estás intentando encontrar un perro perdido en un parque. En el parque original (datos desequilibrados), todos los perros de búsqueda se ponen de acuerdo sobre dónde está el perro. Pero cuando añades "equilibrado" (como añadir más perros de búsqueda o cambiar el terreno), los perros de búsqueda empiezan a ladrar en direcciones diferentes. Todos siguen siendo perros "buenos", pero no pueden ponerse de acuerdo sobre la ubicación.
  • La "Parcial" Solución No Funcionó: Algunos expertos sugirieron usar "resampling parcial" (solo equilibrar los datos un poco, no al 100%) para evitar este desorden. Los autores lo probaron, pero descubrieron que no ayudó. La confusión permaneció alta independientemente de cuánto equilibraran los datos.
  • La Importancia de las Variables Cambió: También verificaron si los modelos estaban mirando pistas diferentes. Por ejemplo, un modelo podría pensar que los "ingresos" son el factor más importante, mientras que otro piensa que la "edad". Descubrieron que, aunque el orden de importancia no cambió drásticamente en un sentido estadístico, los métodos de equilibrado sí hicieron que los modelos se comportaran de manera diferente en general.

La Solución: Un Nuevo Tablero de Control

Dado que no pudieron evitar que ocurriera la confusión, los autores propusieron una forma de monitorearla.

Sugirieron usar un Gráfico Extendido de Ganancia de Rendimiento.

  • Imagina un tablero de control con dos manómetros.
  • Manómetro 1 (Horizontal): Muestra cuánto mejora el modelo al predecir correctamente (Ganancia de Rendimiento).
  • Manómetro 2 (Vertical): Muestra cuánto discrepan los modelos entre sí (Multiplicidad/Oscuridad).

La Lección: No deberías mirar solo el Manómetro 1. Podrías encontrar un método que mejore ligeramente la precisión (el Manómetro 1 sube), pero que cause una explosión masiva en la discrepancia (el Manómetro 2 sube mucho). Los autores dicen que necesitas mirar ambos manómetros para tomar una decisión responsable.

Resumen de las Afirmaciones del Artículo

  1. Equilibrar los datos es necesario para problemas desequilibrados, pero tiene un costo oculto.
  2. Los métodos de equilibrado aumentan la "Multiplicidad Predictiva". Crean una situación donde muchos modelos son igualmente precisos pero dan respuestas contradictorias a las mismas personas.
  3. Nueva Métrica: Introdujeron la "Oscuridad" para medir qué "nebuloso" o conflictivo son las predicciones de estos modelos en promedio.
  4. El Resampling Parcial no es una bala mágica. No resuelve el problema de la confusión aumentada.
  5. IA Responsable: Al elegir un modelo, debes verificar no solo si es preciso, sino si es estable. Si eliges un modelo ciegamente de un "Conjunto de Rashomon" creado por métodos de equilibrado, corres el riesgo de tomar decisiones arbitrarias que dañen a individuos.

El artículo concluye que, aunque los métodos de equilibrado son un "refugio" para resolver datos desequilibrados, los investigadores deben tener cuidado de no caminar a ciegas hacia una niebla de predicciones contradictorias. Necesitan usar el nuevo "tablero de control" (el gráfico extendido) para ver la compensación entre precisión y estabilidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →