← Nieuwste papers
💻 computer science

Image Thresholding: Understanding Bias of Evaluation Metrics towards Specific Evaluation Functions

Dit artikel onthult een inherente bias in de evaluatie van beeldsegmentatie en toont aan dat Otsu's objectiefunctie voor interklassenvariantie consequent een sterkere correlatie vertoont met standaard kwaliteitsmetrieken zoals SSIM en PSNR dan Kapur's entropie, waardoor de aanname van metriekneutraliteit wordt betwist.

Oorspronkelijke auteurs: Eslam Hegazy, Mohamed Gabr

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Eslam Hegazy, Mohamed Gabr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een taart in perfecte stukken probeert te snijden. In de wereld van computer vision is deze "taart" een afbeelding, en het "snijden" ervan betekent het scheiden van verschillende delen van de afbeelding (zoals de lucht van de grond, of een tumor van gezond weefsel). Dit proces heet beelddrempelwaardebepaling.

Om dit te doen, hebben computers een regelboek nodig, of een doelfunctie, om hen te vertellen waar ze moeten snijden. Twee van de beroemdste regelboeken zijn:

  1. Otsu's Methode: Dit regelboek zegt: "Snijd de taart waar het verschil tussen de lichte en donkere delen het grootst is." Het is alsof je probeert het contrast tussen de glazuur en de spons te maximaliseren.
  2. Kapur's Methode: Dit regelboek zegt: "Snijd de taart waar de informatie-inhoud het meest in evenwicht is." Het is een complexere regel gebaseerd op hoeveel "verrassing" of variatie er in elk stuk zit.

Zodra de computer een snede maakt, moeten we controleren of hij het goed heeft gedaan. Hiervoor gebruiken we evaluatiemetingen, die fungeren als juryleden die de snede beoordelen. De twee populairste juryleden in dit veld zijn:

  • SSIM (Structural Similarity Index): Een jurylid dat kijkt hoe vergelijkbaar de vormen en structuren van de gesneden afbeelding zijn met het origineel.
  • PSNR (Peak Signal-to-Noise Ratio): Een jurylid dat meet hoeveel "ruis" of fout er tijdens de snede is geïntroduceerd.

Het Grote Probleem: De Jury is Bevooroordeeld

De auteurs van dit artikel, Eslam Hegazy en Mohamed Gabr, merkten iets verdachts op. In bijna elke studie waarin deze methoden worden vergeleken, lijkt Otsu's Methode te winnen wanneer deze wordt beoordeeld met SSIM en PSNR. Onderzoekers gingen er vanuit dat dit betekende dat Otsu gewoon een beter regelboek was.

Maar de auteurs stelden een andere vraag: "Wat als de juryleden (SSIM en PSNR) in het geheim bevooroordeeld zijn ten gunste van Otsu's regelboek?"

Stel je dit voor als een kookwedstrijd.

  • Otsu is een chef die gespecialiseerd is in het maken van gerechten met hoog contrast (zeer zout, zeer zoet).
  • Kapur is een chef die gebalanceerde, complexe gerechten maakt.
  • SSIM en PSNR zijn de juryleden.

De auteurs vermoedden dat SSIM en PSNR eigenlijk "smaak-bevooroordeelde" juryleden zijn. Ze zijn geprogrammeerd om van gerechten met hoog contrast te houden. Dus, zelfs als Kapur een perfect gebalanceerd gerecht maakt, kunnen de juryleden het een lagere score geven, simpelweg omdat het niet smaakt zoals ze dat prefereren.

Hoe Ze Het Testten

Om dit te bewijzen, gebruikten ze geen geavanceerde AI om de beste snede te vinden. In plaats daarvan deden ze iets zeer grondigs: ze probeerden elke mogelijke snede op 500 verschillende natuurlijke afbeeldingen (uit een dataset genaamd BSDS500).

Voor elke enkele snede berekenden ze:

  1. Hoe goed de snede was volgens Otsu's regel.
  2. Hoe goed de snede was volgens Kapur's regel.
  3. Hoe de juryleden (SSIM en PSNR) die snede beoordeelden.

Vervolgens keken ze naar het verband (correlatie) tussen de regelboeken en de juryleden.

De Resultaten: De Bias Is Echt

De bevindingen waren duidelijk en opvallend:

  1. Otsu en de Juryleden zijn Beste Vrienden: Wanneer Otsu's regelboek zei dat een snede "goed" was, waren de juryleden (SSIM en PSNR) bijna altijd het ermee eens. Sterker nog, voor 100% van de afbeeldingen bewogen Otsu's scores in perfect synchronisme met de PSNR-scores. Voor 91% van de afbeeldingen bewogen ze in synchronisme met SSIM.

    • Analogie: Het is alsof Otsu en de juryleden dezelfde taal spreken. Wanneer Otsu zijn hand opsteekt, steken de juryleden direct de hunne op.
  2. Kapur en de Juryleden zijn Vreemden: Kapur's regelboek had een veel zwakkere connectie met de juryleden. Soms waren ze het eens, soms niet. Het verband was rommelig en onvoorspelbaar.

    • Analogie: Kapur probeert een ander dialect te spreken. De juryleden begrijpen hem soms, maar vaak trekken ze alleen maar hun schouders op en geven ze een gemiddelde score, zelfs als de snede eigenlijk goed was.

Wat Dit Betekent

Het artikel concludeert dat de reden waarom Otsu-gebaseerde methoden vaak "winnen" in onderzoeksartikelen niet noodzakelijk is omdat ze beter zijn in het snijden van de taart. Het is omdat het beoordelingssysteem (SSIM en PSNR) is ingericht om Otsu te bevoordelen.

Als een onderzoeker een nieuwe, superintelligente AI-algoritme bedenkt om Kapur te helpen bij het vinden van de beste sneden, maar ze gebruiken nog steeds SSIM en PSNR om het te beoordelen, kan het nieuwe algoritme eruitzien als een mislukking. Waarom? Omdat de juryleden bevooroordeeld zijn tegen Kapur's stijl, ongeacht hoe goed de AI is.

De Conclusie

De auteurs waarschuwen de wetenschappelijke gemeenschap: Vertrouw de juryleden niet blindelings.

Als je eerlijk verschillende manieren van afbeeldingen snijden wilt vergelijken, kun je niet alleen SSIM en PSNR gebruiken. Je moet beseffen dat deze tools van nature de voorkeur geven aan één specifieke methode (Otsu) boven andere. Om een waarheidsgetrouw beeld te krijgen van wie de beste "chef" is, heb je misschien nieuwe juryleden nodig die geen favoriete smaak hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →