← Derniers articles
🤖 machine learning

An Experimental Study on the Rashomon Effect of Balancing Methods in Imbalanced Classification

Auteurs originaux : Mustafa Cavus, Przemysław Biecek

Publié 2026-05-18
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mustafa Cavus, Przemysław Biecek

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Vue d'Ensemble : Le Problème des « Plusieurs Bonnes Réponses »

Imaginez que vous essayez de prédire qui va gagner une partie d'échecs. Vous disposez d'un ensemble de données de parties passées, mais il y a un problème : 90 % des parties ont été gagnées par les Blancs, et seulement 10 % par les Noirs. C'est ce qu'on appelle un jeu de données déséquilibré.

Si vous entraînez un modèle informatique sur ces données sans les corriger, l'ordinateur devient paresseux. Il apprend que « les Blancs gagnent toujours », alors il prédit « Blancs » pour chaque nouvelle partie. Il obtient 90 % de précision, mais échoue complètement à prédire les victoires des Noirs.

Pour corriger cela, les scientifiques des données utilisent des méthodes d'équilibrage. Ils agissent comme un chef ajoutant des ingrédients à une soupe :

  • Suréchantillonnage (Oversampling) : Ils copient les rares parties « victoire des Noirs » pour en avoir plus (comme ajouter plus de sel).
  • Sous-échantillonnage (Undersampling) : Ils jettent certaines des parties communes « victoire des Blancs » pour réduire la quantité de soupe (comme retirer l'excès d'eau).

L'objectif est de faire en sorte que l'ordinateur prête attention à la classe minoritaire. Mais ce document pose une question effrayante : La correction des données crée-t-elle un nouveau type de confusion ?

L'Effet Rashomon : Le Phénomène des « Plusieurs Vérités »

Le document utilise un concept appelé l'Effet Rashomon. Imaginez une scène de crime où cinq témoins différents racontent cinq histoires différentes. Les cinq histoires sont plausibles et correspondent aux faits tout aussi bien, mais elles se contredisent.

En apprentissage automatique, l'Ensemble de Rashomon est un groupe de différents modèles informatiques qui performe presque exactement de la même manière (ils sont tous « plausibles »), mais qui font des prédictions différentes pour la même personne ou la même situation.

  • Modèle A dit : « Ce demandeur de prêt est sûr. »
  • Modèle B dit : « Ce demandeur de prêt est risqué. »
  • Les deux modèles ont le même score de précision globale.

Si vous choisissez simplement un modèle au hasard (sélection aveugle), vous pourriez accidentellement choisir celui qui refuse un prêt à une personne de bonne foi, alors qu'un autre modèle tout aussi précis l'aurait approuvé. C'est ce qu'on appelle la Multiplicité Prédictive.

L'Expérience : Que se passe-t-il lorsque nous équilibrons les données ?

Les auteurs voulaient savoir : L'utilisation de méthodes d'équilibrage (suréchantillonnage/sous-échantillonnage) aggrave-t-elle ce problème des « Plusieurs Vérités » ?

Ils ont pris 21 jeux de données réels différents (comme la détection de spam, la fraude par carte de crédit et la qualité du vin) et les ont fait passer dans une « usine à modèles » (un outil appelé Forester) qui crée des centaines de modèles légèrement différents pour chaque jeu de données. Ils ont fait cela deux fois :

  1. En utilisant les données originales, déséquilibrées.
  2. En utilisant des données équilibrées (après application des méthodes d'équilibrage).

Ils ont ensuite mesuré trois choses pour voir à quel point les modèles étaient en désaccord les uns avec les autres :

  1. Ambiguïté : Combien de personnes reçoivent des réponses contradictoires ? (par exemple, « 5 personnes sur 100 reçoivent des prédictions différentes. »)
  2. Discrépance : Quel est le scénario du pire cas ? (par exemple, « Un modèle spécifique est en désaccord avec les autres sur 20 personnes. »)
  3. Obscurité (Nouvelle Métrique) : C'est la nouvelle idée du document. Elle mesure la quantité moyenne de confusion. Au lieu de simplement demander « Y a-t-il un conflit ? », elle demande « À quel point le conflit est-il embrouillé en moyenne ? ». Pensez-y comme à la mesure du « brouillard » au-dessus des données.

Les Résultats : Le « Correctif » a Épaissi le Brouillard

Voici ce qu'ils ont découvert :

  • Les Méthodes d'Équilibrage Augmentent la Confusion : Lorsqu'ils ont utilisé des méthodes d'équilibrage (comme SMOTE ou le suréchantillonnage aléatoire), l'Obscurité et la Discrépance ont augmenté.
    • L'Analogie : Imaginez que vous essayez de retrouver un chien perdu dans un parc. Dans le parc original (données déséquilibrées), tous les chiens de recherche s'accordent sur l'endroit où se trouve le chien. Mais lorsque vous ajoutez de l'« équilibrage » (comme ajouter plus de chiens de recherche ou modifier le terrain), les chiens de recherche se mettent à aboyer dans des directions différentes. Ce sont toujours tous de « bons » chiens, mais ils ne peuvent pas s'accorder sur l'emplacement.
  • Le Correctif « Partiel » N'a Pas Fonctionné : Certains experts ont suggéré d'utiliser un « rééchantillonnage partiel » (équilibrer les données seulement un peu, pas à 100 %) pour éviter ce désordre. Les auteurs l'ont testé, mais ont constaté que cela n'a pas aidé. La confusion est restée élevée, peu importe la quantité d'équilibrage appliquée aux données.
  • L'Importance des Variables a Changé : Ils ont également vérifié si les modèles regardaient des indices différents. Par exemple, un modèle pourrait penser que le « revenu » est le facteur le plus important, tandis qu'un autre pense que c'est l'« âge ». Ils ont constaté que, bien que l'ordre d'importance n'ait pas changé de manière drastique d'un point de vue statistique, les méthodes d'équilibrage ont tout de même fait que les modèles se comportaient différemment dans l'ensemble.

La Solution : Un Nouveau Tableau de Bord

Puisqu'ils ne pouvaient pas empêcher la confusion de se produire, les auteurs ont proposé un moyen de la surveiller.

Ils ont suggéré d'utiliser un Graphique Étendu de Gain de Performance.

  • Imaginez un tableau de bord avec deux cadrans.
  • Cadran 1 (Horizontal) : Montre à quel point le modèle s'améliore dans la prédiction correcte (Gain de Performance).
  • Cadran 2 (Vertical) : Montre à quel point les modèles sont en désaccord les uns avec les autres (Multiplicité/Obscurité).

La Leçon : Vous ne devriez pas regarder uniquement le Cadran 1. Vous pourriez trouver une méthode qui améliore légèrement la précision (le Cadran 1 monte), mais qui provoque une explosion massive de désaccords (le Cadran 2 monte beaucoup). Les auteurs disent qu'il faut regarder les deux cadrans pour prendre une décision responsable.

Résumé des Affirmations du Document

  1. Équilibrer les données est nécessaire pour les problèmes déséquilibrés, mais cela a un coût caché.
  2. Les méthodes d'équilibrage augmentent la « Multiplicité Prédictive ». Elles créent une situation où de nombreux modèles sont également précis mais donnent des réponses contradictoires aux mêmes personnes.
  3. Nouvelle Métrique : Ils ont introduit l'« Obscurité » pour mesurer à quel point ces prédictions de modèles sont « brumeuses » ou contradictoires en moyenne.
  4. Le Rééchantillonnage Partiel n'est pas une solution miracle. Il ne résout pas le problème de la confusion accrue.
  5. IA Responsable : Lors du choix d'un modèle, vous devez vérifier non seulement s'il est précis, mais aussi s'il est stable. Si vous choisissez un modèle aveuglément dans un « Ensemble de Rashomon » créé par des méthodes d'équilibrage, vous risquez de prendre des décisions arbitraires qui nuisent aux individus.

Le document conclut que, bien que les méthodes d'équilibrage soient un « havre » pour résoudre les données déséquilibrées, les chercheurs doivent faire attention à ne pas marcher aveuglément dans un brouillard de prédictions contradictoires. Ils doivent utiliser le nouveau « tableau de bord » (le graphique étendu) pour voir le compromis entre précision et stabilité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →