← Derniers articles
🤖 machine learning

XMix: Combating Extremely Noisy Labels via Local Smoothness in Self-Supervised Feature Space

Mix est un nouveau cadre qui exploite la lissité locale dans les espaces de caractéristiques auto-supervisés pour estimer les taux de bruit, sélectionner des échantillons propres équilibrés et générer des pseudo-étiquettes fiables, surpassant ainsi de manière significative les méthodes existantes pour gérer des étiquettes extrêmement bruitées sans nécessiter de connaissance préalable du bruit.

Auteurs originaux : Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

Publié 2026-07-28
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à reconnaître des animaux. Vous lui montrez des milliers d'images, mais voici le hic : les étiquettes sur les images ont été écrites par un humain fatigué, distrait ou même malicieux. Parfois, une photo de chat est étiquetée « chien », et une photo de voiture est étiquetée « avion ». C'est la réalité désordonnée de l'« Apprentissage avec des Étiquettes Bruyantes » (Learning with Noisy Labels). Dans le monde de l'intelligence artificielle, les modèles ont généralement besoin de données parfaites pour apprendre, mais dans le monde réel, les données parfaites sont rares et coûteuses. Les scientifiques essaient de construire des robots capables d'ignorer les mauvaises étiquettes et d'apprendre à partir des bonnes. Mais quand le bruit devient vraiment élevé — par exemple, quand 90 % des étiquettes sont fausses — la plupart des robots abandonnent ou s'embrouillent.

Le document que vous allez lire traite exactement de ce problème. Il présente une nouvelle méthode appelée XMix. Voyez cela comme un détective qui ne se contente pas de faire confiance aux étiquettes écrites sur les fichiers. Au lieu de cela, il examine les images elles-mêmes pour voir lesquelles « se ressemblent » et semblent appartenir au même groupe. Si une photo de chat ressemble beaucoup à d'autres photos de chats dans la mémoire du robot, le détective suppose qu'elles sont toutes des chats, même si les étiquettes disent le contraire. Cette approche utilise un concept appelé « lissage local » (local smoothness), ce qui est une façon sophistiquée de dire : « Les choses qui se ressemblent appartiennent généralement au même groupe. » En utilisant cette logique, XMix tente de nettoyer le désordre et d'enseigner au robot bien mieux que les méthodes précédentes, surtout lorsque les données sont un véritable désastre.

Le Problème : Une classe remplie de farceurs

Imaginez une salle de classe où un enseignant essaie d'apprendre aux élèves à identifier différents types de fruits. L'enseignant a une pile de fiches illustrées, mais un groupe de farceurs a interverti les étiquettes. Certains pommes sont étiquetées « bananes », et certaines oranges sont étiquetées « raisins ».

Par le passé, des programmes informatiques intelligents (appelés modèles d'apprentissage profond) avaient un tour dans leur sac appelé l'« effet de mémorisation ». Ils étudiaient les cartes et réalisaient : « Hé, je suis très doué pour deviner l'étiquette de cette carte spécifique, mais je suis très mauvais pour celle-là. » Ils supposaient que ceux pour lesquels ils devinaient bien étaient les vrais (données propres) et que ceux avec lesquels ils avaient du mal étaient les mensonges des farceurs (données bruyantes).

Mais voici le problème : quand les farceurs deviennent fous et intervertissent 90 % des étiquettes, l'ordinateur s'embrouille. Il ne peut plus faire la différence entre une vraie pomme et une banane étiquetée comme une pomme. De plus, l'ordinateur finit souvent par ne choisir qu'un seul type de fruit à étudier, ignorant les autres, ce qui le rend incapable de reconnaître toute la variété. Il a besoin d'une nouvelle stratégie qui ne dépend pas de la connaissance exacte du nombre de farceurs présents dans la pièce.

La Solution : XMix et la règle du « Ressemble à »

Entrez en scène XMix, le nouveau détective. Au lieu de simplement regarder les étiquette écrites, XMix utilise une paire de lunettes spéciales (un encodeur de caractéristiques auto-supervisé) pour examiner les détails visuels du fruit. Il sait qu'un fruit rouge, rond et avec une tige ressemble beaucoup à d'autres fruits rouges, ronds et avec des tiges.

Voici comment XMix résout les trois grands problèmes :

1. Deviner le niveau de bruit sans fiche de triche
D'habitude, ces programmes informatiques ont besoin de savoir exactement combien d'étiquettes sont fausses (par exemple, « 50 % sont fausses ») pour définir leurs règles. S'ils se trompent dans leur estimation, ils échouent. XMix n'a pas besoin de cette fiche de triche. Il regarde un fruit et ses voisins les plus proches, ses « semblables », dans le monde de l'image. Si les voisins ont tous des étiquettes différentes, XMix calcule : « Wow, le bruit doit être très élevé ici. » Il utilise un tour mathématique appelé « maximum de vraisemblance » pour estimer automatiquement le niveau de bruit. C'est comme un détective regardant une scène de crime et disant : « D'après le nombre de vitres brisées, je dirais qu'il s'agit d'une émeute », sans avoir besoin d'un rapport de police.

2. Trouver plus de bons élèves (Sélection équilibrée et étendue)
Lorsque le bruit est extrême, les anciennes méthodes ne trouvent que quelques échantillons « propres » (bons élèves) à étudier. XMix dit : « Attendez, si nous avons trouvé une bonne pomme, et qu'elle ressemble exactement à ces cinq autres pommes à proximité, confions-nous aussi à ces cinq-là ! » Il élargit le groupe des échantillons de confiance en incluant ses voisins.
Crucialement, il corrige également le problème du « déséquilibre des classes ». Si les farceurs ont caché toutes les étiquettes « banane », l'ordinateur pourrait arrêter d'étudier les bananes complètement. XMix remarque cela et dit : « Nous avons besoin de plus de bananes ! » Il cherche plus loin pour trouver des semblables de bananes afin de s'assurer que chaque fruit a une chance équitable d'être étudié. Cela garantit que le robot apprend un régime de connaissances équilibré, et non pas seulement son fruit préféré.

3. Une meilleure estimation pour l'inconnu
Enfin, pour les cartes dont il n'est toujours pas sûr (les étiquettes bruyantes), XMix ne devine pas au hasard. Il demande aux voisins : « Qu'en pensez-vous ? » Il prend les opinions des voisins les plus fiables (les propres) et fait la moyenne de leurs avis pour créer une « pseudo-étiquette » (une étiquette de la meilleure estimation). C'est comme demander à un groupe d'experts de voter sur un objet mystère. Comme les experts sont choisis en fonction de leur ressemblance avec l'objet, leur vote est beaucoup plus fiable qu'une supposition aléatoire.

Ce qu'ils ont trouvé : Battre les probabilités

Les chercheurs ont testé XMix sur des ensembles de données d'images célèbres comme CIFAR-10 et CIFAR-100, qui contiennent des photos de voitures, d'avions, d'animaux et plus encore. Ils ont délibérément faussé les étiquettes pour créer des scénarios extrêmes :

  • 90 % de Bruit Symétrique : Imaginez que 90 étiquettes sur 100 sont complètement aléatoires.
  • 98 % de Bruit : Presque tout est un mensonge.

Dans ces conditions brutales, les méthodes précédentes (comme DivideMix et ProMix) commencent à s'effondrer. Par exemple, sur CIFAR-10 avec 90 % de bruit, l'ancienne meilleure méthode (DivideMix) n'obtenait qu'environ 76 % de précision. XMix, cependant, a fait grimper ce chiffre à 91,2 %. Sur CIFAR-100 avec 95 % de bruit, l'ancienne méthode atteignait 19,1 %, tandis que XMix atteignait 31,4 %.

Le document montre que XMix ne fonctionne pas seulement un peu mieux ; il excelle lorsque la situation est la plus désespérée. Il a réussi à identifier beaucoup plus d'échantillons « réellement propres » que les anciennes méthodes, doublant ou triplant parfois le nombre de bons exemples dont le robot peut apprendre.

Le Verdict

XMix prouve que vous n'avez pas besoin de connaître le niveau exact de chaos dans vos données pour les nettoyer. En faisant confiance aux similitudes visuelles entre les images — en utilisant le « lissage local » de l'espace des caractéristiques — il peut ajuster automatiquement sa stratégie, trouver plus de bonnes données et apprendre au robot à ignorer le bruit.

Les auteurs suggèrent que cette méthode est une étape importante, surtout pour les scénarios du monde réel où les données sont désordonnées et où nous n'avons pas de manuel nous indiquant à quel point elles sont mauvaises. Bien que ce ne soit pas une baguette magique qui répare tout parfaitement (il fait encore quelques erreurs, surtout quand le bruit est faible et que l'extension n'est pas nécessaire), il surpasse systématiquement les méthodes de pointe actuelles dans les environnements les plus difficiles et les plus bruyants. Il transforme une classe chaotique de farceurs en un lieu où l'apprentissage peut encore avoir lieu.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →