← Derniers articles
💻 computer science

How Class Imbalance Treatments Distort SHAP Attribution Fidelity: A Monte Carlo Investigation of Ranking and Magnitude Errors

À travers une investigation approfondie par la méthode de Monte Carlo, cet article démontre que si la taille de l'échantillon d'entraînement est le principal moteur de la fidélité de l'attribution SHAP, les traitements courants du déséquilibre des classes faussent souvent les classements et les magnitudes des caractéristiques, amenant les auteurs à recommander d'éviter le rééquilibrage au profit de la pondération des classes lorsque l'interprétabilité SHAP est une priorité.

Auteurs originaux : Rıdvan Kara

Publié 2026-06-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rıdvan Kara

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un crime. Vous avez un assistant informatique (le modèle d'apprentissage automatique) qui examine des indices (les données) pour découvrir qui est le coupable. Pour vous permettre de faire confiance à l'ordinateur, vous lui demandez d'expliquer pourquoi il a désigné un suspect spécifique. Il vous donne une liste de raisons, disant : « L'indice A était responsable à 40 %, l'indice B à 10 % », et ainsi de suite. Cet outil d'explication s'appelle SHAP.

Imaginez maintenant que le crime est très rare. Peut-être qu'un cas sur 100 seulement est un crime, tandis que 99 sont des innocents. C'est ce qu'on appelle un déséquilibre de classes (class imbalance). Comme les exemples de « crime » sont si rares, l'ordinateur s'embrouille. Pour corriger cela, les scientifiques des données essaient souvent d'« équilibrer » les données d'entraînement avant d'enseigner à l'ordinateur. Ils peuvent :

  • Copier-coller les exemples de crimes rares (Suréchantillonnage aléatoire / Random Oversampling).
  • Jeter la plupart des exemples d'innocents (Sous-échantillonnage aléatoire / Random Undersampling).
  • Inventer de faux exemples de crimes qui ressemblent aux vrais (SMOTE/ADASYN).
  • Dire à l'ordinateur de prêter une attention particulière aux crimes rares sans modifier les données (Pondération des classes / Class Weighting).

La grande question posée par cet article est la suivante : Lorsque nous corrigeons le déséquilibre des données, cassons-nous accidentellement l'explication de l'ordinateur ? Est-ce que la liste des « indices les plus importants » reste la même ? Est-ce que les chiffres (comme « 40 % de responsabilité ») restent précis ?

L'auteur, Rıdvan Kara, a mené une simulation massive (comme lancer le même test 14 000 fois avec des réglages différents) pour le découvrir. Voici ce qu'il a découvert, en utilisant des analogies simples :

1. La taille de la classe importe plus que la correction

La découverte la plus importante est que combien d'exemples vous avez importe bien plus que quelle astuce de rééquilibrage vous utilisez.

  • L'analogie : Imaginez essayer de deviner la saveur d'une soupe. Si vous n'avez qu'une minuscule cuillère (petit échantillon), peu importe si vous ajoutez du sel, du sucre ou du poivre à la cuillère ; votre supposition sera incertaine. Mais si vous avez une marmite géante de soupe (grand échantillon), votre supposition sera précise, peu importe ce que vous avez fait aux ingrédients.
  • Le résultat : Augmenter la quantité de données que vous donnez à l'ordinateur est le meilleur moyen d'obtenir une explication fiable. Le choix de la méthode de rééquilibrage est environ 3 à 5 fois moins important que le simple fait d'avoir plus de données.

2. Le piège du « Classement » vs la « Magnitude »

L'article fait une distinction cruciale entre deux types d'explications :

  • Classement (Ranking) : « Qui est le suspect numéro un ? » (L'indice A est-il plus important que l'indice B ?)
  • Magnitude : « À quel point l'indice A a-t-il contribué ? » (A-t-il contribué à 10 % ou 50 % ?)

L'étude a révélé que certaines astuces de rééquilibrage sont excellentes pour obtenir l'ordre correct, mais terribles pour obtenir les chiffres corrects.

  • L'analogie : Imaginez une course.
    • Le Suréchantillonnage aléatoire (copier-coller des exemples rares) est comme un entraîneur qui s'assure que le coureur qui devrait gagner arrive bien en première place (le classement est bon). Cependant, l'entraîneur dit ensuite à tout le monde que le vainqueur a couru deux fois plus vite qu'en réalité (la magnitude est gonflée/fausse).
    • Le Sous-échantillonnage aléatoire (jeter des données) est comme un entraîneur qui licencie la moitié de son équipe. Désormais, ils ne peuvent même plus dire qui est le meilleur coureur, et les chiffres de vitesse sont complètement brisés. Ils échouent tant au classement qu'à la magnitude.

3. Les meilleurs correctifs « de non-intervention » et « doux »

En cherchant l'explication la plus honnête, l'article a trouvé deux gagnants qui n'ont pas tenté de forcer les données à paraître équilibrées :

  1. Aucun rééquilibrage : Utilisez simplement les données déséquilibrées telles quelles.
  2. Pondération des classes (Class Weighting) : Dites à l'ordinateur : « Hé, les crimes rares sont importants, donc prête une attention particulière à ces cas », mais ne supprimez ni ne copiez aucune donnée.

Ces deux méthodes se situaient sur la « frontière de Pareto », ce qui signifie qu'elles étaient les meilleures à la fois pour obtenir l'ordre correct et pour maintenir l'exactitude des chiffres. Ce sont les traitements « les moins invasifs ».

4. Le problème des données synthétiques « fausses »

Les méthodes qui inventent de fausses données (SMOTE et ADASYN) étaient correctes pour obtenir l'ordre des suspects, mais elles faussaient les chiffres.

  • L'analogie : C'est comme un artiste qui dessine un faux visage pour combler un vide dans une photo. Le visage ressemble à une personne (le classement est correct), mais si vous essayez de mesurer la distance entre les yeux, la mesure est fausse car le visage n'est pas réel.

5. La zone de danger de l'« Extrême Rareté »

L'article a découvert que ces problèmes s'aggravent considérablement lorsque le crime est extrêmement rare (moins de 5 % des cas) et que vous avez très peu de données.

  • L'analogie : Si vous essayez de trouver une aiguille dans une botte de foin, et que vous n'avez qu'un minuscule morceau de foin pour regarder, n'importe quelle astuce que vous utiliserez pour « équilibrer » le foin vous fera probablement rater l'aiguille ou deviner mal sa taille. Mais si vous avez une grange entière de foin, vous pouvez trouver l'aiguille facilement, et les astuces importent peu.

Résumé des recommandations

Si vous utilisez l'IA pour expliquer des décisions (comme dans le diagnostic médical ou l'évaluation de crédit) et que vous avez des données déséquilibrées :

  1. Obtenez d'abord plus de données. C'est l'outil le plus puissant.
  2. Ne copiez-collez pas et ne jetez pas de données si vous avez besoin de chiffres précis. Ces méthodes déforment la partie « combien » de l'explication.
  3. Si vous devez équilibrer, utilisez la Pondération des classes (dire au modèle d'en avoir plus à cœur) ou laissez simplement les données telles quelles. Ces méthodes maintiennent l'honnêteté de l'explication.
  4. Vérifiez à la fois l'ordre et les chiffres. Ne regardez pas seulement quel trait est le n°1 ; vérifiez si le pourcentage de contribution fait sens, car certaines méthodes cachent leurs erreurs dans les chiffres.

L'article conclut que si l'équilibrage des données aide l'ordinateur à prédire mieux, il casse souvent la capacité de l'ordinateur à s'expliquer avec précision. Si vous avez besoin d'une explication digne de confiance, l'approche la plus douce (Pondération des classes) ou l'absence totale d'approche est généralement la meilleure option.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →