Beyond Accuracy: A Comprehensive Evaluation of ResNet50 and Vision Transformer for Trustworthy Pneumonia Detection from Chest X-Ray Images
Deze studie presenteert een uitgebreide evaluatie van ResNet50 en Vision Transformer (ViT-B16) voor de detectie van pneumonie op borstfoto's, waarbij wordt onthuld dat hoewel ResNet50 superieure nauwkeurigheid, kalibratie en efficiëntie biedt, ViT-B16 een grotere robuustheid vertoont tegen beelddegradaties, wat daarmee de noodzaak van een multidimensionale beoordeling voor betrouwbare diagnostische systemen onderstreept.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van te zoeken naar vingerafdrukken, zoek je naar onzichtbare aanwijzingen in de borstkas van een persoon. Dit is de wereld van medische beeldvorming, waar artsen speciale camera's gebruiken om foto's van longen te maken om te zien of ze ziek zijn. Lange tijd waren de beste detectives menselijke artsen, maar zij worden moe, en soms zijn de aanwijzingen zo klein of wazig dat zelfs de scherpste ogen ze missen. Om te helpen, hebben wetenschappers "digitale detectives" gebouwd met behulp van een tak van de informatica genaamd Deep Learning. Denk aan deze digitale detectives als superintelligente robots die leren door naar duizenden foto's te kijken totdat ze zelfstandig een probleem kunnen herkennen.
Er zijn twee hoofdtypen van deze robotdetectives. Het eerste type is als een zorgvuldige kunstenaar die naar een foto kijkt, penseelstreek voor penseel, en ziet hoe randen en texturen met elkaar verbonden zijn. Dit wordt een Convolutional Neural Network (CNN) genoemd. Het tweede type is als een vogel die hoog boven een bos vliegt; het kijkt niet naar elk afzonderlijk blaadje, maar ziet hoe het hele bos vanuit de verte met elkaar verbonden is en interageert. Dit wordt een Vision Transformer (ViT) genoemd. Beiden zijn ongelooflijk krachtig, maar artsen moeten weten welke er daadwerkelijk beter is in het redden van levens voordat ze hen in een ziekenhuis vertrouwen. Het is niet genoeg om alleen maar snel te zijn of meestal het juiste antwoord te geven; de robot moet ook eerlijk zijn over hoe zeker hij is, taai genoeg om slechte foto's te verwerken, en begrijpelijk voor een menselijke arts.
In dit onderzoek besloot een onderzoeker genaamd Vishal Manta van het Indian Institute of Technology Guwahati om twee van deze digitale detectives tegenover elkaar te zetten in een eerlijk gevecht om te zien welke de meest betrouwbare is voor het opsporen van pneumonie (longontsteking), een ernstige longinfectie. De twee tegenstanders waren ResNet50, de zorgvuldige kunstenaar (CNN), en ViT-B16, de hoogvliegende vogel (Vision Transformer). Ze vroegen niet alleen: "Wie heeft de meeste antwoorden goed?" In plaats daarvan zetten ze een enorme hindernisbaan op om alles te testen: hoe nauwkeurig ze waren, hoe eerlijk ze waren over hun vertrouwen, hoe snel ze waren en hoe goed ze een wazige of ruisachtige foto konden verwerken.
De resultaten van deze race waren vrij duidelijk. Wanneer het kwam op de belangrijkste taak van het opsporen van pneumonie, was ResNet50 de kampioen. Het identificeerde gevallen van pneumonie in 84,56% van de gevallen correct, terwijl de Vision Transformer op 81,14% uitkwam. De onderzoeker gebruikte een speciale statistische test genaamd de McNemar-test om er zeker van te zijn dat dit geen gelukje was, en de wiskunde bevestigde dat ResNet50 inderdaad significant beter was. Maar het verhaal eindigde daar niet. De studie vond dat ResNet50 ook de eerlijkere detective was. Wanneer hij zei dat hij "90% zeker" was, had hij meestal gelijk. De Vision Transformer had echter de neiging om overmoedig te zijn, waarbij hij vaak beweerde dat hij zeker was terwijl dat eigenlijk niet zo was. In de wereld van de geneeskunde is overmoed gevaarlijk, omdat een arts een foutief antwoord dan te veel kan vertrouwen.
De Vision Transformer was echter geen totale verliezer; hij had een superkracht. Wanneer de onderzoekers de testfoto's opzettelijk verpestten door ruis toe te voegen, ze wazig te maken of de helderheid te veranderen, hield de Vision Transformer zijn rug rechter dan ResNet50. Hoewel beide modellen slechter werden bij slechte foto's, daalde de nauwkeurigheid van de Vision Transformer minder sterk. Het lijkt erop dat omdat de "vogel" naar het hele plaatje tegelijk kijkt, hij nog steeds dingen kan ontdekken, zelfs als delen van de afbeelding wazig zijn. Maar deze superkracht kwam met een zware prijs. De Vision Transformer was een reus, die 85,80 miljoen instelbare instellingen (parameters) nodig had om te werken, vergeleken met de 23,51 miljoen van ResNet50. Het duurde ook veel langer om na te denken, waarbij het 55,60 seconden nodig had om een batch afbeeldingen te verwerken, tegenover 38,57 seconden voor ResNet50, en het vereiste veel meer computerkracht om te draaien.
Om er zeker van te zijn dat de robots daadwerkelijk naar de longen keken en niet gewoon gokten, gebruikte de onderzoeker een hulpmiddel genaamd Grad-CAM, dat werkt als een hittekaart om aan te geven waar de robot naar kijkt. De zorgvuldige kunstenaar (ResNet50) richtte zijn aandacht nauwgezet op de zieke delen van de longen, wat precies is wat een arts wil zien. De hoogvliegende vogel (ViT) had een wat verspreide aandacht. Wanneer de robots fouten maakten, misten ze meestal de gevallen van pneumonie, waarbij ze vol vertrouwen "Normaal" zeiden terwijl de longen eigenlijk ziek waren. Dit suggereert dat hoewel deze robots beter worden, ze nog steeds worstelen met de meest sluipende, subtiele gevallen van de ziekte.
Uiteindelijk suggereert deze studie dat als je een betrouwbare, snelle en eerlijke assistent nodig hebt voor een ziekenhuis dat misschien niet over een supercomputer beschikt, de zorgvuldige kunstenaar ResNet50 momenteel de betere keuze is. Het is nauwkeuriger, eerlijker over zijn vertrouwen en goedkoper in gebruik. De Vision Transformer is een sterke concurrent die goed omgaat met slechte foto's, maar is op dit moment te zwaar en te duur voor veel klinieken in de echte wereld. De belangrijkste les is dat het bouwen van een betrouwbare medische AI niet alleen gaat over wie de hoogste score haalt op een test; het gaat over het vinden van de juiste balans tussen slim zijn, eerlijk zijn, snel zijn en taai genoeg zijn voor de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.