← Últimos artículos
💻 computer science

How Class Imbalance Treatments Distort SHAP Attribution Fidelity: A Monte Carlo Investigation of Ranking and Magnitude Errors

A través de una investigación exhaustiva de Monte Carlo, este artículo demuestra que, si bien el tamaño de la muestra de entrenamiento es el principal motor de la fidelidad de la atribución SHAP, los tratamientos comunes para el desequilibrio de clases a menudo distorsionan las clasificaciones y magnitudes de las características, lo que lleva a los autores a recomendar evitar el reequilibrio en favor del pesaje de clases cuando la interpretabilidad de SHAP es una prioridad.

Autores originales: Rıdvan Kara

Publicado 2026-06-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Rıdvan Kara

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un crimen. Tienes un asistente informático (el modelo de aprendizaje automático) que observa pistas (datos) para descubrir quién lo hizo. Para confiar en la computadora, le pides que explique por qué señaló a un sospechoso específico. Ella te da una lista de razones, diciendo: "La Pista A fue responsable en un 40%, la Pista B en un 10%", y así sucesivamente. Esta herramienta de explicación se llama SHAP.

Ahora, imagina que el crimen es muy poco común. Tal vez solo 1 de cada 100 casos es un crimen, mientras que 99 son personas inocentes. Esto se llama desequilibrio de clases (class imbalance). Debido a que los ejemplos del "crimen" son tan escasos, la computadora se confunde. Para solucionar esto, los científicos de datos a menudo intentan "equilibrar" los datos de entrenamiento antes de enseñar a la computadora. Podrían:

  • Copiar y pegar los ejemplos raros del crimen (Sobremuestreo Aleatorio / Random Oversampling).
  • Desechar la mayoría de los ejemplos inocentes (Submuestreo Aleatorio / Random Undersampling).
  • Inventar ejemplos de crímenes falsos que se parezcan a los reales (SMOTE/ADASYN).
  • Decirle a la computadora que preste especial atención a los crímenes raros sin cambiar los datos (Ponderación de Clases / Class Weighting).

La gran pregunta que este artículo plantea es: Cuando arreglamos el desequilibrio de los datos, ¿rompemos accidentalmente la explicación de la computadora? ¿Se mantiene igual la lista de las "pistas más importantes"? ¿Siguen siendo precisos los números (como "40% de responsabilidad")?

El autor, Rıdvan Kara, realizó una simulación masiva (como ejecutar el mismo experimento 14,000 veces con diferentes configuraciones) para averiguarlo. Esto es lo que descubrió, utilizando analogías sencillas:

1. El tamaño de la clase importa más que el arreglo

El hallazgo más importante es que cuántos ejemplos tienes importa mucho más que qué truco de equilibrio utilices.

  • La analogía: Imagina intentar adivinar el sabor de una sopa. Si solo tienes una cucharadita (tamaño de muestra pequeño), no importa si añades sal, azúcar o pimienta a la cucharadita; tu suposición será inestable. Pero si tienes una olla gigante de sopa (tamaño de muestra grande), tu suposición será precisa sin importar lo que hayas hecho con los ingredientes.
  • El resultado: Aumentar la cantidad de datos que le das a la computadora es la mejor manera de obtener una explicación fiable. La elección del método de equilibrio es entre 3 y 5 veces menos importante que simplemente tener más datos.

2. La trampa del "Ranking" vs. la "Magnitud"

El artículo hace una distincción crucial entre dos tipos de explicaciones:

  • Ranking (Clasificación): "¿Quién es el principal sospechoso?" (¿Es la Pista A más importante que la Pista B?).
  • Magnitud: "¿Cuánto contribuyó la Pista A?" (¿Contribuyó un 10% o un 50%?).

El estudio encontró que algunos trucos de equilibrio son excelentes para obtener el orden correcto, pero terribles para obtener los números correctos.

  • La analogía: Imagina una carrera.
    • El Sobremuestreo Aleatorio (copiar y pegar ejemplos raros) es como un entrenador que se asegura de que el corredor que debería ganar esté en primer lugar (el Ranking es bueno). Sin embargo, el entrenador luego le dice a todos que el ganador corrió el doble de rápido de lo que realmente corrió (la Magnitud está inflada/es errónea).
    • El Submuestreo Aleatorio (desechar datos) es como un entrenador que despide a la mitad del equipo. Ahora, ni siquiera pueden decir quién es el mejor corredor, y los números de velocidad están completamente rotos. Fallan tanto en el ranking como en la magnitud.

3. Los mejores arreglos de "No hacer nada" y "Suaves"

Al buscar la explicación más honesta, el artículo encontró dos ganadores que no intentaron forzar los datos para que parecieran equilibrados:

  1. No reequilibrar: Simplemente usa los datos desequilibrados y desordenados tal como son.
  2. Ponderación de Clases (Class Weighting): Dile a la computadora: "Oye, los crímenes raros son importantes, así que presta especial atención a ellos", pero sin borrar ni copiar ningún dato.

Estos dos métodos se situaron en la "frontera de Pareto", lo que significa que fueron los mejores tanto en obtener el orden correcto como en mantener los números precisos. Son los tratamientos "mínimamente invasivos".

4. El problema de los datos sintéticos "Falsos"

Los métodos que inventan datos falsos (SMOTE y ADASYN) fueron aceptables para obtener el orden de los sospechosos, pero arruinaron los números.

  • La analogía: Es como un artista que dibuja una cara falsa para llenar un hueco en una foto. La cara parece una persona (el ranking es aceptable), pero si intentas medir la distancia entre los ojos, la medida es incorrecta porque la cara no es real.

5. La zona de peligro de la "Rareza Extrema"

El artículo encontró que estos problemas empeoran mucho cuando el crimen es extremadamente raro (menos del 5% de los casos) y tienes muy pocos datos.

  • La analogía: Si estás tratando de encontrar una aguja en un pajar, y solo tienes un trocito de paja para mirar, cualquier truco que uses para "equilibrar" el paja probablemente hará que pierdas la aguja o que calcules mal el tamaño de la aguja. Pero si tienes un granero entero de paja, puedes encontrar la aguja fácilmente, y los trucos importan menos.

Resumen de recomendaciones

Si estás usando IA para explicar decisiones (como en el diagnóstico médico o la calificación crediticia) y tienes datos desequilibrados:

  1. Consigue más datos primero. Esta es la herramienta más poderosa.
  2. No copies y pegues ni deseches datos si necesitas números precisos. Estos métodos distorsionan la parte del "cuánto" de la explicación.
  3. Si debes equilibrar, usa la Ponderación de Clases (decirle al modelo que se preocupe más) o simplemente deja los datos como están. Estos mantienen la explicación honesta.
  4. Verifica tanto el orden como los números. No te limites a mirar cuál característica es la número 1; verifica si el porcentaje de contribución tiene sentido, porque algunos métodos ocultan sus errores en los números.

El artículo concluye que, si bien el equilibrio de los datos ayuda a la computadora a predecir mejor, a menudo rompe la capacidad de la computadora para explicarse a sí misma con precisión. Si necesitas una explicación confiable, el enfoque más suave (Ponderación de Clases) o no aplicar ningún enfoque es generalmente la mejor opción.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →