← Nieuwste papers
📊 statistics

Impact of Label Noise from Large Language Models Generated Annotations on Evaluation of Diagnostic Model Performance

Deze studie toont aan dat labelruis door grote taalmodellen (LLM's) bij het evalueren van diagnostische modellen systematische, prevalentie-afhankelijke vertekeningen veroorzaakt, waarbij de specificiteit van de LLM cruciaal is in situaties met een lage ziekteprevalentie en de sensitiviteit in situaties met een hoge prevalentie.

Oorspronkelijke auteurs: Mohammadreza Chavoshi, Hari Trivedi, Janice Newsome, Aawez Mansuri, Chiratidzo Rudado Sanyika, Rohan Satya Isaac, Frank Li, Theo Dapamede, Judy Gichoya

Gepubliceerd 2026-04-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mohammadreza Chavoshi, Hari Trivedi, Janice Newsome, Aawez Mansuri, Chiratidzo Rudado Sanyika, Rohan Satya Isaac, Frank Li, Theo Dapamede, Judy Gichoya

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuw, slimmedoctor (een kunstmatige intelligentie) hebt getraind om longkanker op röntgenfoto's te herkennen. Je wilt weten: werkt deze dokter echt goed?

Om dat te testen, heb je een "gouden standaard" nodig: een lijstje met de juiste antwoorden. Maar in de echte wereld zijn er miljoenen foto's, en het kost een menselijke specialist jaren om ze allemaal na te kijken.

Daarom denken veel onderzoekers: "Laten we een Super-AI (een Large Language Model of LLM) vragen om die lijstjes te maken door de medische verslagen te lezen." Het klinkt als een perfecte oplossing, totdat je beseft dat die Super-AI ook fouten kan maken.

Dit onderzoek van de auteurs van Emory University vraagt zich af: Wat gebeurt er met onze testresultaten als de Super-AI die de antwoorden maakt, niet 100% perfect is?

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. De Vergelijking: De Onvolmaakte Scheidsrechter

Stel je een voetbalwedstrijd voor.

  • De AI-dokter is de speler die doelpunten probeert te maken (hij probeert ziektes te vinden).
  • De Super-AI is de scheidsrechter die beslist of het een doelpunt was of niet.
  • De echte waarheid is wat er echt gebeurd is op het veld.

In dit onderzoek kijken ze wat er gebeurt als de scheidsrechter (de Super-AI) soms een beetje slordig is. Hij roept soms "Doelpunt!" terwijl het er geen was, of "Geen doelpunt!" terwijl het er wel een was.

2. Het Grote Geheim: Het hangt af van hoe vaak de ziekte voorkomt

De belangrijkste ontdekking van dit onderzoek is dat de fouten van de scheidsrechter anders werken, afhankelijk van hoe zeldzaam de ziekte is.

Scenario A: De Zeldzame Ziekte (Bijvoorbeeld 1 op de 100 patiënten)

Stel, je zoekt naar een heel zeldzame ziekte. Van de 100 mensen heeft er maar 1 de ziekte.

  • Als de scheidsrechter (Super-AI) niet goed genoeg is in het herkennen van gezonde mensen (hij maakt te veel "valse alarmen"), roept hij bij 99 gezonde mensen misschien toch "Ziek!".
  • Het gevolg: De AI-dokter ziet dat de scheidsrechter bij 99 mensen "ziek" zegt. Als de AI-dokter dan probeert die ene echte zieke te vinden, lijkt het alsof hij faalt. De scheidsrechter heeft namelijk zo veel "valse alarmen" gemaakt, dat de echte ziekte erin verdwijnt.
  • De les: Bij zeldzame ziektes is het ontzettend belangrijk dat de Super-AI heel streng is en niet te veel gezonde mensen ziek noemt. Als hij dat wel doet, denken we dat onze AI-dokter slecht is, terwijl hij misschien juist perfect is.

Scenario B: De Veelvoorkomende Ziekte (Bijvoorbeeld 90 op de 100 patiënten)

Nu is het andersom. De ziekte zit bij bijna iedereen.

  • Als de scheidsrechter nu niet goed is in het herkennen van de ziekte (hij mist te veel echte gevallen), dan zegt hij bij 10 zieke mensen "Geen ziekte".
  • Het gevolg: De AI-dokter ziet dat de scheidsrechter veel mensen als "gezond" bestempelt. Als de AI-dokter die mensen toch als ziek aanwijst, denkt de scheidsrechter: "Hé, jij hebt het fout!".
  • De les: Bij veelvoorkomende ziektes is het belangrijk dat de Super-AI geen echte ziekte over het hoofd ziet.

3. De "Onderdrukking" van de Waarheid

Het meest verrassende is wat de onderzoekers ontdekten: We denken vaak dat onze AI-dokter slechter presteert dan hij echt is.

Zelfs als de Super-AI maar een klein beetje fouten maakt (bijvoorbeeld 95% in plaats van 100% goed), kan dit leiden tot een enorme onderdrukking van de score.

  • Vergelijking: Stel je voor dat je een zeer nauwkeurige weegschaal hebt. Maar je gebruikt een verkeerd gewicht om te kalibreren. De weegschaal geeft dan niet alleen een klein foutje, maar hij kan plotseling aangeven dat je 10 kilo lichter bent dan je bent.
  • In het onderzoek zagen ze dat bij een zeldzame ziekte, een Super-AI die 95% goed was, de prestatie van een perfecte AI-dokter liet lijken alsof hij maar 53% goed deed. Dat is een gigantisch verschil!

4. Wat betekent dit voor de toekomst?

De onderzoekers zeggen: "We moeten oppassen!"

Als we AI-detectoren in ziekenhuizen willen testen, kunnen we niet zomaar een computer laten zeggen wat er in de verslagen staat. We moeten slimme instructies (prompt engineering) geven aan die computer, afhankelijk van de ziekte:

  • Zoek je naar iets zeldzaams? Geef de computer de opdracht: "Wees extreem voorzichtig. Zeg alleen 'ziek' als je 100% zeker bent, anders zeg je 'gezond'." (Focus op het vermijden van valse alarmen).
  • Zoek je naar iets vaaks? Geef de opdracht: "Probeer niets te missen." (Focus op het vinden van alle ziektes).

Conclusie

Deze studie waarschuwt ons dat het gebruik van AI om de prestaties van andere AI's te testen, een valkuil kan zijn. Als de "scheidsrechter" (de label-generator) niet perfect is, kunnen we een goede AI-dokter onterecht afkraken, vooral bij zeldzame ziektes.

Het is alsof je een speler beoordeelt op basis van een scheidsrechter die zelf niet goed kan fluiten. Je moet eerst weten hoe goed die scheidsrechter is, voordat je de speler een cijfer geeft!

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →