Reliable Evaluation of Transductive Population Graph Neural Networks for Multisite Autism fMRI
Deze studie toont aan dat hoewel graph neural networks een hoge nauwkeurigheid kunnen bereiken bij de classificatie van autisme op multisite fMRI-data door gebruik te maken van cohort-specifieke context en supervisie, zij er niet in slagen te generaliseren naar ongeziene acquisitiesites, wat het kritieke belang benadrukt van rigoureuze leave-one-site-out evaluatie om onderscheid te maken tussen cohort-geconditioneerde prestaties en ware generalisatie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In de wereld van medische beeldvorming richten wetenschappers zich steeds vaker op kunstmatige intelligentie om te helpen bij het diagnosticeren van aandoeningen zoals autisme. Deze systemen leren door hersenscans te bestuderen, waarbij ze zoeken naar subtiele patronen die de ene groep mensen van de andere onderscheiden. Er ontstaat echter een grote uitdaging wanneer deze tools worden getest op gegevens van verschillende ziekenhuizen of verschillende scanners. Een model dat perfect werkt op gegevens uit de ene stad, kan volledig falen wanneer het wordt geconfronteerd met een scan uit een andere stad, simpelweg omdat de machines of de mensen die daar werden gerekruteerd, net iets anders waren. Dit staat bekend als het probleem van generalisatie. Om dit op te lossen, hebben onderzoekers een slim type computerprogramma ontwikkend: een population graph neural network. In plaats van elke hersenscan geïsoleerd te bekijken, bouwt dit programma een kaart die alle mensen in een studie met elkaar verbindt. Het koppelt hen op basis van hoe vergelijkbaar hun hersenscans en andere details zijn, waardoor de computer informatie van de ene persoon naar de andere kan doorgeven over de gehele groep. Deze aanpak heeft opmerkelijk succes laten zien; sommige studies rapporteren dat deze modellen autisme met een extreem hoge nauwkeurigheid kunnen identificeren, waarmee ze schijnbaar het puzzelstukje hebben opgelost van hoe men deze complexe hersenkaarten kan lezen.
Maar een team van onderzoekers besloot beter te kijken naar dit succes. Ze wilden weten of de hoge nauwkeurigheid werkelijk kwam doordat de computer de biologische tekenen van autisme had geleerd, of dat het stiekem vertrouwde op sluiproutes gerelateerd aan de herkomst van de gegevens. Met behulp van een grote, bekende collectie hersenscans van twintig verschillende locaties, bouwden ze het succesvolle model vanaf nul opnieuw op in een gecontroleerde omgeving. Vervolgens voerden ze een reeks zorgvuldige experimenten uit, waarbij ze werkten als een wetenschapper die een hypothese test door telkens één klein dingetje tegelijk te veranderen. Ze vroegen zich af: moet het model de specifieke hersenscan van de persoon zien die het probeert te diagnosticeren? Moet het weten welk ziekenhuis die persoon heeft bezocht? En het belangrijkste: werkt het nog steeds als het wordt getoond aan een hersenscan van een ziekenhuis dat het nog nooit eerder heeft gezien?
De onderzoekers ontdekten dat de indrukwekkende prestaties van het model binnen de bekende groep echt waren, maar dat dit niet vertaalde naar nieuwe omgevingen. Wanneer het model gebruik mocht maken van informatie over welk ziekenhuis een deelnemer had bezocht om de verbindingen te leggen, behaalde het een AUC van 0,94. Dit was even hoog als wanneer het alle beschikbare informatie gebruikte, wat suggereerde dat het kennen van de locatie de sleutel tot het succes was. Echter, toen ze het model testten op een volledig nieuwe locatie — één die geen deel uitmaakte van de oorspronkelijke groep van twintig — daalde de prestatie aanzienlijk. Het vermogen van het model om onderscheid te maken tussen autistische en niet-autistische individuen daalde naar een niveau van ongeveer 0,52, met betrouwbaarheidsintervallen die de 0,5 bevatten, wat geen duidelijk bewijs leverde voor discriminatie die verder gaat dan toeval. Dit stond in scherp contrast met eenvoudigere methoden die deze complexe verbindingen niet gebruikten, die erin slaagden een iets beter, maar nog steeds bescheiden niveau van nauwkeurigheid op ongeziene gegevens te behouden, met ongeveer 65 procent.
Het onderzoek onthulde precies waar de sluiproute lag. De hoge nauwkeurigheid hing af van het vermogen van het model om de testpersoon te verbinden met andere mensen van hetzelfde ziekenhuis die al gelabeld waren. Een graaf die alleen locatiegegevens gebruikte, behield een vergelijkbaar hoge discriminatie, wat suggereerde dat het model de specifieke "vingerafdruk" van de gegevens van een ziekenhuis leerde in plaats van de universele tekenen van autisme. Wanneer de onderzoekers het model blokkeerden om labels van hetzelfde ziekenhuis tijdens de training te gebruiken, stortte de AUC in tot ongeveer 0,48, wat bewees dat het systeem niet de ziekte zelf leerde, maar de context van de gegevens. Bovendien ontdekten ze dat dit effect specifiek was voor de manier waarop het model informatie verwerkte. Als ze het deel van het computerprogramma veranderden dat de verbindingen tussen mensen afhandelde, of als ze een ander, meer standaard type netwerkarchitectuur gebruikten, verdween de hoge nauwkeurigheid onmiddellijk. Het model werkte alleen zo goed omdat het op een zeer specifieke manier was gebouwd die het toeliet om de gedeelde kenmerken van de groep van dezelfde locatie uit te buiten.
Deze studie dient als een cruciale reality check voor het vakgebied van de medische kunstmatige intelligentie. Het laat zien dat een model een briljant diagnostisch instrument kan lijken wanneer het wordt getest op een groep mensen die het al heeft gezien, maar volledig kan falen wanneer het wordt geconfronteerd met een nieuwe groep van een andere locatie. De onderzoekers toonden aan dat de hoge scores die in eerder werk werden gerapporteerd, niet noodzakelijkerwijs een teken waren dat de computer de biologie van autisme onder de knie had, maar eerder dat hij de patronen van de specifieke dataset waarop hij getraind was, onder de knie had. Door het vermogen van het model om te leren van de huidige groep te scheiden van het vermogen om te generaliseren naar nieuwe groepen, bood het team een duidelijke strategie voor het evalueren van toekomstige tools. Hun werk suggereert dat voor kunstmatige intelligentie om werkelijk betrouwbaar te zijn in een ziekenhuissetting, het niet alleen getest moet worden op de gegevens die het kent, maar ook op de gegevens die het nog nooit heeft gezien. Totdat een model die test kan doorstaan, is de hoge nauwkeurigheid mogelijk een illusie, een reflectie van de herkomst van de gegevens in plaats van de conditie van de patiënt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.