← Derniers articles
📊 statistics

An Insight on Evaluation Metrics Under the Imbalanced Case of Anomaly Detection

Cet article analyse comment les métriques courantes de détection d'anomalies (AUROC, AUPR, score F1 et MCC) se comportent sous différents niveaux de déséquilibre des classes en introduisant des paysages de métriques afin de fournir des conseils pratiques pour l'interprétation et la comparaison des résultats de détection à travers différents ensembles de données.

Auteurs originaux : Romain Hermary, Nesryne Mejri, Djamila Aouada

Publié 2026-07-27
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Romain Hermary, Nesryne Mejri, Djamila Aouada

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Titre : Un aperçu sur les métriques d'évaluation dans le cas déséquilibré de la détection d'anomalies

Énoncé du problème
La détection d'anomalies est intrinsèquement caractérisée par un déséquilibre de classes sévère, où les anomalies sont rares par rapport aux données normales. Ce déséquilibre complique l'interprétation des métriques d'évaluation standard. Bien que des métriques telles que l'AUROC, l'AUPR, le score F1 et le coefficient de corrélation de Matthews (MCC) soient largement utilisées, leurs valeurs numériques véhiculent des significations différentes selon le ratio d'anomalies. Un score scalaire unique omet souvent des informations concernant le comportement du modèle, et des scores identiques peuvent correspondre à des comportements de classifieurs très différents sous des degrés de déséquilibre variables. De plus, dans les contextes non supervisés où l'entraînement se fait uniquement sur des données normales, l'évaluation est effectuée sous des distributions de test hautement asymétriques, ce qui rend l'évaluation de la performance délicate. Bien que des variantes pondérées des mesures standard existent, elles sont souvent évitées en détection d'anomalies pour éviter de découpler l'évaluation de la distribution opérationnelle des classes. Par conséquent, il existe un manque de consensus sur la manière d'interpréter ces métriques standard à travers différents régimes de déséquilibre.

Méthodologie
Les auteurs proposent une analyse systématique de quatre métriques courantes de détection d'anomalies (AUROC, AUPR, F1 et MCC) à travers une large gamme de ratios de déséquilibre de classes. La contribution méthodologique centrale est l'introduction des paysages de métriques (metric landscapes), un cadre de visualisation qui cartographie les scores des métriques sur l'espace du taux de vrais positifs (TPR/Rappel) et du taux de vrais négatifs (TNR/Spécificité).

L'étude utilise :

  1. Jeux de données : Un ensemble diversifié de benchmarks représentant la détection d'anomalies de séries temporelles (TSAD), la classification à classe unique (OCC) et la détection d'anomalies d'images (IAD). Cela inclut UCR, WaDi, PUMP, SWaT, PSM, CIFAR-10, ViSA et MVTec, couvrant des ratios d'anomalies de 0,19 % à 90 %.
  2. Analyse nulle : Établir des lignes de base en calculant les métriques sur 100 exécutions de prédictions aléatoires à travers des ratios de déséquilibre (de 99:1 à 1:99) pour déterminer la moyenne, l'écart type et la déviation positive moyenne.
  3. Évolution du paysage : Visualiser la différence entre les paysages de métriques en configuration équilibrée (50:50) et déséquilibrée (par exemple, 5:95) pour observer comment les préférences des métriques se déplacent.
  4. Analyse factorielle : Étudier les relations latentes entre les métriques en utilisant les coefficients de congruence de Tucker et les corrélations de Pearson à travers trois groupes de déséquilibre (Faible, Moyen, Élevé).

Résultats clés

  • Stabilité des métriques et lignes de base :
    • L'AUROC et le MCC restent centrés autour de 0,5 à travers tous les ratios de déséquilibre sous des prédictions aléatoires, bien que l'AUROC présente une plus grande variabilité (déviation positive moyenne allant jusqu'à ~0,25).
    • Le F1 et le MCC présentent une faible variance sous un comportement aléatoire, ce qui les rend moins sujets aux scores élevés spécieux.
    • L'AUPR de base varie linéairement avec la proportion d'anomalies, rendant les déviations par rapport à une performance aléatoire faciles à quantifier, bien qu'il montre des déviations ascendantes non négligeables dans des régimes spécifiques.
  • Comportement des paysages :
    • L'AUROC est invariant au déséquilibre de classe ; sa structure de paysage reste inchangée quel que soit le ratio.
    • L'AUPR et le F1 sont hautement sensibles au déséquilibre. À mesure que la classe négative domine, les paysages de l'AUPR diminuent considérablement (de 0,2 à 0,4 dans de nombreuses régions), reflétant une influence réduite de la performance de la classe négative. Le F1 nécessite un TNR de plus en plus élevé pour atteindre le même score à mesure que le ratio d'anomalies diminue.
    • Le MCC présente un schéma complexe où les valeurs extrêmes de TNR restent stables, mais où la distribution se comprime autour de valeurs médianes, rendant l'interprétation du score moyen moins directe sous un déséquilibre sévère.
  • Exigences minimales de détection :
    • Pour l'AUROC, aucun échantillon positif n'a besoin d'être détecté pour atteindre un score de 0,5.
    • Pour l'AUPR, obtenir des scores élevés dans des jeux de données équilibrés nécessite une classification correcte de 100 % des négatifs, même avec une détection minimale des positifs.
    • Pour le F1, augmenter le score nécessite toujours plus de positifs correctement classés, mais l'exigence pour les négatifs correctement classés augmente à mesure que le ratio d'anomalies diminue.
    • Pour le MCC, atteindre un score d'environ 0,4 sur des jeux de données hautement déséquilibrés (par exemple, UCR) est possible sans détecter aucun positif et avec seulement environ 10 % de négatifs correctement classés, bien que cela reste en dessous de la ligne de base aléatoire.
  • Relations entre les métriques :
    • Dans les régimes de déséquilibre Moyen, toutes les métriques présentent des profils de charge similaires et des corrélations élevées, suggérant qu'elles capturent des structures liées.
    • Dans les régimes de déséquilibre Faible (hautement déséquilibrés), les métriques deviennent plus complémentaires. L'AUROC et le MCC restent étroitement liés, tandis que le F1 et l'AUROC montrent l'accord le plus faible.
    • Dans les régimes de déséquilibre Élevé (classe positive dominante), les métriques se décorrèlent davantage. Notamment, l'AUROC et le MCC maintiennent une similitude totale (congruence de Tucker de 0,997), tandis que l'AUPR et l'AUROC montrent une congruence réduite.

Signification et contributions
L'article soutient que les métriques existantes restent utiles à condition que leur interprétation tienne explicitement compte de la dépendance entre la valeur de la métrique, la qualité de la prédiction et le déséquilibre des classes. La contribution principale est l'introduction des paysages de métriques comme un cadre intuitif pour visualiser comment différentes métriques mettent l'accent sur différents compromis entre sensibilité et spécificité et comment ces préférences changent avec l'augmentation du déséquilibre.

Ce travail fournit des conseils pratiques pour interpréter et comparer les résultats de détection d'anomalies à travers des jeux de données avec différents ratios de déséquilibre. Il ne propose pas une métrique unique "optimale" pour tous les scénarios, mais offre plutôt un point de référence pour comprendre le comportement des métriques dans des conditions réalistes. Les auteurs notent que des scores identiques peuvent correspondre à des comportements de classifieurs différents, et leur analyse aide à clarifier ces distinctions. Les travaux futurs sont identifiés comme l'extension de cette analyse à d'autres domaines tels que la surveillance industrielle, l'IoT, la cybersécurité et la conduite autonome.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →