Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review
Deze scoping review van 49 klinische XAI-studies onthult dat evaluaties overweldigend de voorkeur geven aan gebruikersvertrouwen en percepties boven kritische toezichtcapaciteiten zoals fout- en biasdetectie, waarbij zwaar wordt geleund op niet-gevalideerde maten en zelden de prestaties op geïmplementeerde systemen worden beoordeeld.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In moderne ziekenhuizen vertrouwen artsen steeds vaker op computerprogramma's om bij te helpen bij het diagnosticeren van ziekten en het suggereren van behandelingen. Deze hulpmiddelen, gebouwd op complexe wiskundige modellen, kunnen enorme hoeveelheden patiëntgegevens sneller verwerken dan een mens. Deze modellen werken echter vaak als een "black box", waarbij ze een aanbeveling doen zonder uit te leggen hoe ze tot die conclusie zijn gekomen. Om deze ondoorzichtigheid op te lossen, hebben onderzoekers een vakgebied ontwikkeld genaamd uitlegbare kunstmatige intelligentie (explainable artificial intelligence). Het doel is simpel: de redenering van de computer naast het antwoord te bieden, net zoals een arts zijn werk laat zien op een schoolbord. De hoop is dat de clinicus, door de logica achter een suggestie te zien, kan beslissen of hij deze kan vertrouwen, een fout kan ontdekken, of de advies kan negeren als het gevaarlijk is. Dit vermogen om de machine te controleren en te corrigeren staat bekend als menselijk toezicht (human oversight), en wordt als essentieel beschouwd voor de veiligheid bij medische beslissingen met hoge inzet.
Een nieuwe review van wetenschappelijk onderzoek suggereert echter dat de huidige manier waarop we deze verklaringen testen, het meest cruciale deel van de taak mist. Nicolas Frey en zijn collega's van Charité – Universitätsmedizin Berlin onderzochten drieënveertig studies gepubliceerd tussen 2015 en begin 2026 die testten hoe artsen en medische stagiairs interageren met deze uitlegbare hulpmiddelen. De onderzoekers wilden weten of de studies daadwerkelijk bewezen dat verklaringen clinici helpen fouten te ontdekken, of dat ze slechts maten hoeveel clinici van het uiterlijk van de verklaring hielden. Ze vonden een aanzienlijke kloof. Terwijl de studies artsen vaak vroegen of ze de verklaringen betrouwbaar of begrijpelijk vonden, testten ze bijna nooit of die verklaringen artsen daadwerkelijk hielpen wanneer de computer het fout had.
De review bracht precies in kaart wat deze drieënveertig studies maten. De resultaten toonden een zware focus op gevoelens en percepties. In drieënveertig van de studies vroegen onderzoekers aan deelnemers hoeveel zij het systeem vertrouwden. In vierendertig studies vroegen ze of de verklaringen nuttig waren, en in drieendertig vroegen ze of ze begrijpelijk waren. Deze vragen leunen op zelfrapportage, waarbij een arts simpelweg zegt: "Ik voel me zelfverzekerd over dit antwoord." De onderzoekers ontdekten dat slechts een fractie van de studies een stap verder ging om daadwerkelijk gedrag te testen. Slechts drie studies testten of een arts een specifieke fout in de logica van de computer kon ontdekken, en slechts één studie testte of een arts een systematische bias in het advies van het systeem kon herkennen. Misschien nog wel het meest opvallend: geen enkele studie testte of een arts correct kon voorspellen wat de computer zou doen in een nieuwe situatie, een vaardigheid die fundamenteel zou zijn voor echt begrip.
Het bewijs suggereert dat het huidige onderzoekslandschap prioriteit geeft aan het gevoel van veiligheid boven de mechanica van veiligheid. De meeste studies vonden plaats in gecontroleerde, gesimuleerde omgevingen in plaats van in echte, drukke ziekenhuizen. In deze simulaties kregen artsen vaak zowel correct als incorrect advies van de computer te zien, maar de studies maten zelden of de artsen het foutieve advies succesvol verwierpen. In plaats daarvan maten ze vaak of de artsen het eens waren met de computer, zonder te weten of die instemming voortkwam uit een juist of een onjuist antwoord. De onderzoekers merkten op dat een arts een hoog vertrouwen in een systeem kan rapporteren en toch blindelings een gevaarlijke aanbeveling kan opvolgen, of dat een arts verward kan zijn door een verklaring maar toch de juiste beslissing kan nemen door de computer te negeren. Omdat de studies zo zwaar gericht waren op het eerste — wat de artsen zeiden te voelen — boden ze weinig bewijs dat de verklaringen artsen daadwerkelijk hielpen om fouten te ontdekken wanneer de computer het fout had.
Bovendien waren de methoden die werden gebruikt om deze gegevens te verzamelen vaak zwak. Meer dan de helft van de metingen vertrouwde op ad-hoc vragen of niet-geverifieerde schalen in plaats van gevestigde, wetenschappelijk geteste instrumenten. Slechts tien van de tweehonderdvijftig drie datapunten in de review gebruikten een gevalideerd instrument, wat een standaard, betrouwbare test is voor zaken als vertrouwen of tevredenheid. De overgrote meerderheid van de data kwam uit eenvoudige enquêtes waarbij artsen hun ervaring op een schaal beoordeelden. De review benadrukte ook dat slechts twee van de drieënveertig studies keken naar systemen die daadwerkelijk waren ingezet en werden gebruikt in echte klinische settings. De rest waren experimenten waarbij het gedrag van de computer door de onderzoekers werd gecontroleerd, wat betekent dat we niet weten of de verklaringen standhouden wanneer een arts onder tijdsdruk staat, moe is of te maken heeft met een complexe patiëntencasus.
De auteurs betogen dat deze onbalans zorgt voor een vals gevoel van veiligheid. Ze wijzen erop dat vertrouwen een houding is, terwijl toezicht een handeling is. Een arts kan veel vertrouwen hebben in een systeem, maar nog steeds nalaat een foutieve aanbeveling te overrulen. Om echt te weten of een verklaring veilig is, moeten onderzoekers specifieke gedragingen testen: Kan de arts voorspellen wat de computer hierna zal zeggen? Kan hij een fout ontdekken wanneer de computer het fout heeft? Kan hij herkennen wanneer de computer bevooroordeeld is tegenover bepaalde patiëntengroepen? De review vond dat deze specifieke, voor de veiligheid cruciale vaardigheden bijna volledig afwezig waren in de huidige literatuur. De studies lieten ons zien hoe verklaringen aan een clinicus voelen, maar ze lieten niet zien of die verklaringen een clinicus helpen zijn werk beter te doen wanneer de machine faalt.
Het artikel concludeert dat voor uitlegbare kunstmatige intelligentie echt nuttig en veilig te zijn, de manier waarop we het testen moet veranderen. Toekomstige studies moeten verder gaan dan vragen hoe artsen zich voelen en beginnen met het testen van wat ze daadwerkelijk doen. Dit betekent het ontwerpen van experimenten waarbij de juistheid van de computer wordt gemanipuleerd om te zien of artsen het onderscheid kunnen maken tussen juist en onjuist. Het betekent het gebruik van bewezen, betrouwbare instrumenten om attitudes te meten in plaats van te gokken op basis van eenvoudige enquêtes. Ten slotte betekent het het testen van deze systemen in de echte wereld, over een langere periode, om te zien of de verklaringen de besluitvorming blijven ondersteunen wanneer de inzet hoog is en de druk reëel is. Totdat deze verschuivingen plaatsvinden, zal de medische gemeenschap een duidelijk beeld hebben van hoeveel artsen de verklaringen waarderen, maar heel weinig bewijs dat die verklaringen de patiënten daadwerkelijk veilig houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.