From Algorithms to Clinics: Evaluating AI’s Role in Pediatric Autism Diagnosis
Deze kritische review synthetiseert bewijs dat aantoont dat hoewel AI-modellen voor de diagnose van autisme bij kinderen in gecureerde omgevingen vaak een hoge nauwkeurigheid rapporteren, hun klinische bruikbaarheid wordt beperkt door methodologische gebreken en problemen met de generaliseerbaarheid, wat ondersteunt dat hun gebruik primair gericht moet zijn op adjuvante screeningsinstrumenten in plaats van op autonome diagnostische autoriteiten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Autisme is een levenslange manier van zijn die bepaalt hoe een persoon de wereld ervaart, van hoe zij contact maken met anderen tot hoe zij geluiden en beelden verwerken. Het identificeren ervan is zelden een eenvoudige kwestie van het afvinken van een vakje; het is een zorgvuldig proces waarbij artsen en specialisten de geschiedenis van een kind in elkaar puzzelen, kijken naar hoe zij spelen en interageren, en luisteren naar de mensen die hen het beste kennen. Dit proces kost tijd, en deskundige professionals die dit kunnen doen zijn niet altijd beschikbaar wanneer gezinnen hen het hardst nodig hebben. Vanwege deze kloof hebben onderzoekers zich tot computers gewend, in de hoop dat kunstmatige intelligentie als een helper zou kunnen fungend. Het idee is dat een computerprogramma patronen in de stem van een kind, hun gezicht of hun bewegingen zou kunnen opmerken die mensen missen, wat zorgt voor snellere screening en eerdere ondersteuning.
Echter, een nieuwe review van het vakgebied suggereert dat hoewel deze computertools indrukwekkend zijn in het laboratorium, ze nog niet klaar zijn om het zorgvuldige oordeel van een arts te vervangen. De auteurs, onderzoekers van Coventry University, bekeken tientallen studies die beweerden dat kunstmatige intelligentie autisme met bijna perfecte nauwkeurigheid kon diagnosticeren. Zij ontdekten dat deze hoge scores vaak voortkwamen uit tests die te makkelijk waren of te klein om de werkelijkheid te weerspiegelen. Wanneer deze zelfde tools werden getest in verschillende klinieken, met verschillende gezinnen, of onder realistische omstandigheden, daalde hun prestatie aanzienlijk. De review stelt dat we moeten stoppen met het verwarren van het vermogen van een computer om gegevens te sorteren met het vermogen om een mens te diagnosticeren.
De onderzoekers begonnen met het onderzoeken van vijf specifieke rapporten die in het vakgebied circuleerden, waarbij zij deze gebruikten als startpunt om het bredere landschap te begrijpen. Een hiervan was een ingetrokken artikel, wat betekent dat het door het tijdschrift dat het publiceerde was teruggenomen omdat de gegevens niet geverifieerd konden worden en de methoden onduidelijk waren. Een andere was een studentenproject dat een apparaat voorstelde maar het nooit daadwerkelijk op patiënten had getest. Door deze voorbeelden te analyseren, benadrukte het team een terugkerend probleem: veel studies claimen succes op basis van "interne" testen, waarbij de computer wordt getest op precies dezelfde gegevens waarop hij is getraind. Dit is als een student die een toets maakt met exact dezelfde vragen die hij heeft bestudeerd uit het antwoordenmodel; hij zal een perfecte score halen, maar dat betekent niet dat hij het onderwerp begrijpt.
Toen de review keek naar studies die verder gingen door de tools te testen op nieuwe groepen kinderen of op verschillende locaties, waren de resultaten bescheidener. Zo vond een studie die thuisvideo's gebruikte om het gedrag van kinderen te observeren, dat hoewel de computer goed functioneerde op de eerste set video's die hij zag, de nauwkeurigheid daalde toen hij nieuwe video's probeerde te analyseren die opgenomen waren in verschillende huizen met verschillende belichting en camera's. Een andere grote studie die medische dossiers gebruikte om autisme te voorspellen, vond dat het succespercentage daalde van bijna 90 procent in de eigen data naar ongeveer 79 procent bij het testen op een aparte groep kinderen. Deze dalingen zijn geen fouten van de technologie zelf, maar eerder een teken dat de echte wereld rommelig en onvoorspelbaar is, in tegen tegenstelling tot de schone, gecontroleerde omgevingen van een computervlab.
De review wees ook op het feit dat de tools die gebouwd worden vaak twee zeer verschillende taken verwarren: screening en diagnose. Screening is als een net dat wijd wordt uitgeworpen om iedereen te vangen die hulp zou kunnen hebben; het wordt verwacht dat het enkele mensen vangt die de conditie niet daadwerkelijk hebben, alleen maar om er zeker van te zijn dat niemand die het wel heeft, gemist wordt. Diagnose daarentegen is de definitieve, zorgvuldige bevestiging dat een kind autisme heeft. Veel van de computerprogramma's die momenteel worden ontwikkeld, zijn goed in de eerste taak — het signaleren van kinderen voor nadere inspectie — maar ze zijn niet klaar voor de tweede. De auteurs waarschuwen dat het noemen van een computer een "diagnosticus" gevaarlijk is, omdat het suggereert dat de machine de definitieve beslissing kan nemen, terwijl de machine in werkelijkheid slechts een suggestie kan bieden die een mens moet verifiëren.
Nog een belangrijk punt dat het artikel behandelt, is de vraag van eerlijkheid. Veel van de studies gebruikten gegevens van specifieke groepen mensen, vaak zij die al gediagnosticeerd waren of uit bepaalde achtergronden kwamen. Dit betekent dat de computer kan leren om autisme te herkennen op een manier die past bij die specifieke mensen, maar anderen kan missen. Bijvoorbeeld, een tool die getraind is op data uit één land, werkt misschien niet goed in een ander land, omdat de manier waarop kinderen spelen, spreken of interageren met camera's sterk kan variëren tussen culturen. De review benadrukt dat een tool die werkt voor sommigen maar niet voor anderen, geen oplossing is voor iedereen. Het merkt ook op dat de mensen die de beoogde begunstigden van deze tools zijn — autistische individuen zelf — zelden betrokken waren bij het ontwerpen van de tools of bij het beslissen hoe die tools eruit moeten zien.
De onderzoekers stellen een nieuwe manier voor om deze tools te beoordelen, een die verder gaat dan alleen kijken naar een enkel cijfer voor nauwkeurigheid. Ze suggereren een vijfstappenpad dat een tool moet bewandelen voordat deze in een kliniek vertrouwd kan worden. Ten eerste moet de data die gebruikt wordt om de computer te onderwijzen eerlijk en representatief zijn voor de echte wereld. Ten tweede moet de computer bewijzen dat hij kan werken met data die hij nog nooit eerder heeft gezien. Derde moet het aantonen dat het werkt op verschillende plaatsen en met verschillende soorten mensen. Ten slotte moet de tool daadwerkelijk het werk van artsen makkelijker of sneller maken, in plaats van slechts een extra stap aan het proces toe te voegen. Ten slotte moet de tool eerlijk en respectvol zijn, om ervoor te zorgen dat het niemand schade berokkent of gezinnen uitsluit die de hulp het hardst nodig hebben.
Uiteindelijk concludeert het artikel dat kunstmatige intelligentie een rol speelt, maar dat dit een ondersteunende rol is. Het kan helpen informatie te organiseren, kinderen signaleren die een nadere blik nodig hebben, of artsen helpen hun tijd beter te beheren. Maar het kan de menselijke verbinding, het genuanceerde begrip van het verhaal van een familie, of het professionele oordeel dat vereist is voor een diagnose niet vervangen. De meest veelbelovende studies zijn die welke hun beperkingen erkennen, hun tools in de echte wereld testen en een mens de leiding laten houden over de uiteindelijke beslissing. De weg vooruit is niet het bouwen van een machine die op zichzelf autisme kan diagnosticeren, maar het bouwen van een systeem dat artsen helpt om hun beste werk te doen voor elk kind, overal.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.