← Derniers articles
🤖 AI

An automated method of identifying incorrectly labelled images based on the sequences of loss functions of deep learning networks

Cet article propose et valide une méthode automatisée pour identifier les images médicales incorrectement étiquetées en analysant les séquences de fonctions de perte du deep learning, démontrant que la correction de ces erreurs améliore considérablement la qualité du jeu de données et la performance du modèle dans le dépistage de la rétinopathie diabétique.

Auteurs originaux : Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu

Publié 2026-07-07
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à reconnaître différents types de fruits. Vous lui montrez des milliers d'images, mais certaines d'entre elles ont de mauvaises étiquettes collées dessus. Par exemple, vous pourriez accidentellement étiqueter une banane comme une pomme. Si vous laissez le robot étudier ces mauvaises étiquettes, il sera confus et apprendra de mauvaises choses.

Dans le monde médical, c'est exactement ce qui se passe avec l'IA qui analyse les scanners oculaires. Les médecins doivent étiqueter manuellement des milliers d'images pour entraîner ces systèmes d'IA. Mais les médecins sont humains ; ils se fatiguent, les images peuvent être floues ou les pathologies peuvent se ressembler énormément. Les auteurs de cet article estiment que jusqu'à 10 % de ces étiquettes médicales pourraient être erronées.

Le Problème : L'Élève « Confus »
Les chercheurs ont remarqué quelque chose d'intéressant sur la façon dont l'IA « apprend ». Lorsqu'une IA regarde une image avec la bonne étiquette, elle gagne rapidement en confiance. Son « score d'erreur » (appelé fonction de perte) descend de manière fluide, comme un élève qui comprend la leçon et obtient de meilleures notes chaque jour.

Cependant, lorsqu'une IA regarde une image avec une mauvaise étiquette, elle s'enferme dans une boucle de confusion. Elle essaie d'apprendre, échoue, réessaie, et échoue encore. Son « score d'erreur » oscille de manière sauvage ou reste élevé, comme un élève qui est constamment confus par les instructions du professeur.

La Solution : Écouter le « Battement de Cœur » de l'IA
L'article propose une méthode ingénieuse et automatisée pour trouver ces mauvaises étiquettes sans avoir besoin qu'un humain vérifie chaque image. Voici comment ils ont procédé :

  1. La Longue Distance : Ils ont laissé l'IA étudier le jeu de données de nombreuses fois (comme courir un marathon de sessions d'entraînement).
  2. L'Histoire du Score : Au lieu de simplement regarder le résultat final, ils ont enregistré le « score d'erreur » de l'IA après chaque session d'entraînement. Cela a créé une « histoire » ou une séquence unique pour chaque image.
  3. Trouver les Motifs : Ils ont utilisé un outil mathématique pour examiner ces histoires. Ils ont découvert que les histoires des images correctement étiquetées se ressemblaient toutes (une descente fluide). Les histoires des images incorrectement étiquetées étaient totalement différentes (accidentées, plates ou chaotiques).
  4. Le Tri : Ils ont utilisé un algorithme informatique pour regrouper ces histoires en deux tas : « Les Confuses » (étiquettes probablement fausses) et « Les Confiantes » (étiquettes probablement correctes).

L'Expérience : Nettoyer la Salle de Classe
Pour tester si cela fonctionnait, les chercheurs ont pris un ensemble parfait de 10 788 images oculaires et ont secrètement inversé les étiquettes de 6 % d'entre elles (648 images), simulant ainsi des erreurs du monde réel.

  • La Chasse : Ils ont appliqué leur nouvelle méthode sur ce jeu de données désordonné. Elle a réussi à trouver 75 % des étiquettes inversées.
  • Le Filet de Sécurité : Crucialement, elle n'a pas trop crié au loup. Elle n'a accusé à tort que environ 5 % des étiquettes correctes.
  • Le Nettoyage : Ils ont pris les images signalées par l'ordinateur, ont demandé à des médecins seniors de réviser spécifiquement ces cas, et ont corrigé les étiquettes. Cela a réduit le taux d'erreur de l'ensemble du jeu de données de 6 % à 1,5 %.

Le Résultat : Une IA plus Intelligente
Enfin, ils ont réentraîné l'IA en utilisant ce jeu de données « nettoyé ». Le résultat ? L'IA est devenue meilleure dans son travail. Sa précision sur un ensemble de test est passée de 95,93 % à 96,50 %. Bien que ce chiffre paraisse faible, dans le monde de l'IA médicale, se rapprocher du score « parfait » (qui était de 96,57 % lors de l'entraînement sur les données originales non corrompues) est une étape majeure.

En Résumé
L'article démontre qu'en écoutant comment le « score d'erreur » d'une IA évolue au fil du temps, nous pouvons identifier automatiquement les images qui portent de mauvais noms. Cela permet aux médecins de concentrer leur temps uniquement sur les images qui nécessitent une correction, rendant le jeu de données final plus propre et l'IA médicale résultante plus précise.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →