← Últimos artículos
📊 statistics

An Insight on Evaluation Metrics Under the Imbalanced Case of Anomaly Detection

Este artículo analiza cómo se comportan las métricas comunes de detección de anomalías (AUROC, AUPR, F1-score y MCC) bajo distintos niveles de desequilibrio de clases mediante la introducción de paisajes de métricas para proporcionar una guía práctica en la interpretación y comparación de los resultados de detección a través de diferentes conjuntos de datos.

Autores originales: Romain Hermary, Nesryne Mejri, Djamila Aouada

Publicado 2026-07-27
📖 1 min de lectura☕ Lectura para el café

Autores originales: Romain Hermary, Nesryne Mejri, Djamila Aouada

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Título: Una visión sobre las métricas de evaluación bajo el caso desbalanceado de la detección de anomalías

Planteamiento del problema
La detección de anomalías se caracteriza intrínsecamente por un desbalance de clases severo, donde las anomalías son raras en comparación con los datos normales. Este desbalance complica la interpretación de las métricas de evaluación estándar. Aunque métricas como AUROC, AUPR, F1-score y el Coeficiente de Correlación de Matthews (MCC) son ampliamente utilizadas, sus valores numéricos transmiten significados distintos dependiendo de la proporción de anomalías. Un único valor escalar suele descartar información sobre el comportamiento del modelo, y puntuaciones idénticas pueden corresponder a comportamientos de clasificadores muy distintos bajo diferentes grados de desbalance. Además, en entornos no supervisados donde el entrenamiento ocurre únicamente con datos normales, la evaluación se realiza bajo distribuciones de prueba altamente sesgadas, lo que hace que la evaluación del desempeño sea delicada. Aunque existen variantes ponderadas de las medidas estándar, estas suelen evitarse en la detección de anomalías para no desacoplar la evaluación de la distribución de clases operativa. En consecuencia, existe una falta de consenso sobre cómo interpretar estas métricas estándar a través de diferentes regímenes de desbalance.

Metodología
Los autores proponen un análisis sistemático de cuatro métricas comunes de detección de anomalías (AUROC, AUPR, F1 y MCC) a través de un amplio rango de desbalances de clase. La contribución metodológica central es la introducción de los paisajes métricos (metric landscapes), un marco de visualización que mapea las puntuaciones de las métricas sobre el espacio de la Tasa de Verdaderos Positivos (TPR/Recall) y la Tasa de Verdaderos Negativos (TNR/Especificidad).

El estudio utiliza:

  1. Conjuntos de datos: Un conjunto diverso de referentes que representan Detección de Anomalías en Series Temporales (TSAD), Clasificación de Una Clase (OCC) y Detección de Anomalías en Imágenes (IAD). Esto incluye UCR, WaDi, PUMP, SWaT, PSM, CIFAR-10, ViSA y MVTec, cubriendo proporciones de anomalías desde el 0.19% hasta el 90%.
  2. Análisis Nulo: Establecimiento de líneas base computando métricas sobre 100 ejecuciones de predicciones aleatorias a través de desbalances de clase (de 99:1 a 1:99) para determinar la media, la desviación estándar y la desviación positiva media.
  3. Evolución del Paisaje: Visualización de la diferencia entre los paisajes métricos en entornos balanceados (50:50) y desbalanceados (por ejemplo, 5:95) para observar cómo cambian las preferencias de las métricas.
  4. Análisis de Factores: Investigación de las relaciones latentes entre métricas utilizando los coeficientes de congruencia de Tucker y correlaciones de Pearson a través de tres grupos de desbalance (Bajo, Medio, Alto).

Resultos Clave

  • Estabilidad de las Métricas y Líneas Base:
    • AUROC y MCC permanecen centrados alrededor de 0.5 en todos los desbalances de clase bajo predicciones aleatorias, aunque AUROC exhibe una mayor variabilidad (desviación positiva media de hasta ~0.25).
    • F1 y MCC muestran una baja varianza bajo comportamiento aleatorio, lo que las hace menos propensas a puntuaciones altas espurias.
    • AUPR la línea base varía linealmente con la proporción de anomalías, lo que hace que las desviaciones del rendimiento aleatorio sean fáciles de cuantificar, aunque muestra desviaciones ascendentes no despreciables en regímenes específicos.
  • Comportamiento del Paisaje:
    • AUROC es invariante al desbalance de clases; su estructura de paisaje permanece sin cambios independientemente de la proporción.
    • AUPR y F1 son altamente sensibles al desbalance. A medida que la clase negativa domina, los paisajes de AUPR disminuyen significativamente (en 0.2–0.4 en muchas regiones), reflejando una reducción en la influencia del rendimiento de la clase negativa. F1 requiere un TNR cada vez mayor para alcanzar la misma puntuación a medida que la proporción de anomalías disminuye.
    • MCC exhibe un patrón complejo donde los valores extremos de TNR permanecen estables, pero la distribución se comprime alrededor de valores intermedios, haciendo que la interpretación de la puntuación promedio sea menos directa bajo un desbalance severo.
  • Requerimientos Mínimos de Detección:
    • Para AUROC, no es necesario detectar muestras positivas para alcanzar una puntuación de 0.5.
    • Para AUPR, lograr puntuaciones altas en conjuntos de datos balanceados requiere la clasificación correcta del 100% de los negativos incluso con una detección mínima de positivos.
    • Para F1, aumentar la puntuación siempre requiere más positivos clasificados correctamente, pero el requerimiento para los negativos clasificados correctamente crece a medida que la proporción de anomalías disminuye.
    • Para MCC, alcanzar una puntuación de ~0.4 en conjuntos de datos altamente desbalanceados (por ejemplo, UCR) es posible sin detectar ningún positivo y con solo ~10% de los negativos clasificados correctamente, aunque esto permanece por debajo de la línea base aleatoria.
  • Relaciones entre Métricas:
    • En regímenes de desbalance Medio, todas las métricas exhiben perfiles de carga similares y altas correlaciones, lo que sugiere que capturan estructuras relacionadas.
    • En regímenes de desbalance Bajo (altamente desbalanceados), las métricas se vuelven más complementarias. AUROC y MCC permanecen estrechamente relacionados, mientras que F1 y AUROC muestran el acuerdo más débil.
    • En regímenes de desbalance Alto (clase positiva dominante), las métricas se decorrelacionan más. Notablemente, AUROC y MCC mantienen una similitud total (congruencia de Tucker de 0.997), mientras que AUPR y AUROC muestran una congruencia reducida.

Significancia y Contribuciones
El artículo argumenta que las métricas existentes siguen siendo útiles siempre que su interpretación considere explícitamente la dependencia entre el valor de la métrica, la calidad de la predicción y el desbalance de clases. La contribución principal es la introducción de los paisajes métricos como un marco intuitivo para visualizar cómo diferentes métricas enfatizan distintos compromisos entre sensibilidad y especificidad y cómo estas preferencias cambian ante un aumento del desbalance.

El trabajo proporciona orientación práctica para interpretar y comparar resultados de detección de anomalías a través de diferentes conjuntos de datos con distintos desbalances de clase. No propone una única "mejor" métrica para todos los escenarios, sino que ofrece un punto de referencia para comprender el comportamiento de las métricas bajo condiciones realistas. Los autores señalan que las puntuaciones idénticas pueden corresponder a comportamientos de clasificadores distintos, y su análisis ayuda a clarificar estas distinciones. Se identifica como trabajo futuro la extensión de este análisis a otros dominios como el monitoreo industrial, IoT, ciberseguridad y conducción autónoma.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →