← Derniers articles
💻 computer science

Image Thresholding: Understanding Bias of Evaluation Metrics towards Specific Evaluation Functions

Ce papier révèle un biais inhérent à l'évaluation de la segmentation d'images, démontrant que la fonction objectif de la variance inter-classe d'Otsu présente une corrélation plus forte avec des métriques de qualité standard telles que le SSIM et le PSNR que l'entropie de Kapur, remettant ainsi en cause l'hypothèse de neutralité des métriques.

Auteurs originaux : Eslam Hegazy, Mohamed Gabr

Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Eslam Hegazy, Mohamed Gabr

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de découper un gâteau en parts parfaites. Dans le monde de la vision par ordinateur, ce « gâteau » est une image, et le « découper » signifie séparer différentes parties de l'image (comme le ciel du sol, ou une tumeur du tissu sain). Ce processus s'appelle le seuillage d'image.

Pour ce faire, les ordinateurs ont besoin d'un manuel de règles, ou d'une fonction objective, pour leur indiquer où couper. Deux des manuels les plus célèbres sont :

  1. La méthode d'Otsu : Ce manuel dit : « Coupez le gâteau là où la différence entre les parties claires et sombres est la plus grande. » C'est comme essayer de maximiser le contraste entre le glaçage et la génoise.
  2. La méthode de Kapur : Ce manuel dit : « Coupez le gâteau là où le contenu informationnel est le plus équilibré. » C'est une règle plus complexe basée sur la quantité de « surprise » ou de variété présente dans chaque part.

Une fois que l'ordinateur a fait une coupe, nous devons vérifier s'il a bien travaillé. Pour ce faire, nous utilisons des métriques d'évaluation, qui agissent comme des juges notant la coupe. Les deux juges les plus populaires dans ce domaine sont :

  • SSIM (Indice de similarité structurelle) : Un juge qui examine à quel point les formes et les structures de l'image coupée sont similaires à l'originale.
  • PSNR (Rapport signal-à-bruit de crête) : Un juge qui mesure la quantité de « bruit » ou d'erreur introduite lors de la coupe.

Le Grand Problème : Le Juge est Biaisé

Les auteurs de cet article, Eslam Hegazy et Mohamed Gabr, ont remarqué quelque chose de suspect. Dans presque toutes les études comparant ces méthodes, la méthode d'Otsu semble l'emporter lorsqu'elle est notée par le SSIM et le PSNR. Les chercheurs ont supposé que cela signifiait que la méthode d'Otsu était simplement un meilleur manuel de règles.

Mais les auteurs ont posé une question différente : « Et si les juges (SSIM et PSNR) étaient secrètement biaisés en faveur du manuel de règles d'Otsu ? »

Imaginez une compétition de cuisine.

  • Otsu est un chef spécialisé dans la préparation de plats à fort contraste (très salés, très sucrés).
  • Kapur est un chef qui prépare des plats équilibrés et complexes.
  • SSIM et PSNR sont les juges.

Les auteurs soupçonnaient que le SSIM et le PSNR étaient en réalité des juges « biaisés par la saveur ». Ils sont programmés pour aimer les plats à fort contraste. Ainsi, même si Kapur prépare un plat parfaitement équilibré, les juges pourraient lui attribuer une note inférieure simplement parce qu'il ne ressemble pas à ce qu'ils préfèrent.

Comment Ils L'Ont Testé

Pour le prouver, ils n'ont pas utilisé une intelligence artificielle sophistiquée pour trouver la meilleure coupe. Au lieu de cela, ils ont fait quelque chose de très minutieux : ils ont essayé chaque coupe possible sur 500 images naturelles différentes (issues d'un ensemble de données appelé BSDS500).

Pour chaque coupe, ils ont calculé :

  1. La qualité de la coupe selon le manuel d'Otsu.
  2. La qualité de la coupe selon le manuel de Kapur.
  3. La note attribuée à cette coupe par les juges (SSIM et PSNR).

Ensuite, ils ont examiné la relation (corrélation) entre les manuels de règles et les juges.

Les Résultats : Le Biais est Réel

Les conclusions étaient claires et frappantes :

  1. Otsu et les Juges sont les Meilleurs Amis : Lorsque le manuel d'Otsu déclarait qu'une coupe était « bonne », les juges (SSIM et PSNR) étaient presque toujours d'accord. En fait, pour 100 % des images, les scores d'Otsu évoluaient en parfaite synchronisation avec les scores PSNR. Pour 91 % des images, ils évoluaient en synchronisation avec le SSIM.

    • Analogie : C'est comme si Otsu et les juges parlaient la même langue. Lorsque Otsu lève la main, les juges lèvent la leur immédiatement.
  2. Kapur et les Juges sont des Inconnus : Le manuel de Kapur avait un lien beaucoup plus faible avec les juges. Parfois, ils étaient d'accord, parfois non. La relation était désordonnée et imprévisible.

    • Analogie : Kapur essaie de parler un dialecte différent. Les juges le comprennent parfois, mais souvent, ils haussent les épaules et lui attribuent une note médiocre, même si la coupe était en réalité bonne.

Ce Que Cela Signifie

L'article conclut que la raison pour laquelle les méthodes basées sur Otsu gagnent souvent dans les articles de recherche n'est pas nécessairement qu'elles sont meilleures pour découper le gâteau. C'est parce que le système de notation (SSIM et PSNR) est truqué pour favoriser Otsu.

Si un chercheur invente un nouvel algorithme d'intelligence artificielle ultra-intelligent pour aider Kapur à trouver les meilleures coupes, mais qu'il utilise toujours le SSIM et le PSNR pour le noter, le nouvel algorithme pourrait sembler être un échec. Pourquoi ? Parce que les juges sont biaisés contre le style de Kapur, indépendamment de la qualité de l'IA.

L'Essentiel

Les auteurs mettent en garde la communauté scientifique : Ne faites pas confiance aux juges aveuglément.

Si vous voulez comparer équitablement différentes méthodes de découpe d'images, vous ne pouvez pas vous contenter d'utiliser le SSIM et le PSNR. Vous devez réaliser que ces outils préfèrent intrinsèquement une méthode spécifique (Otsu) aux autres. Pour obtenir une image fidèle de qui est le meilleur « chef », vous pourriez avoir besoin de nouveaux juges qui n'ont pas de saveur préférée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →