How Best to Explain Machine Learning Models to Clinicians: A User Study of Explanation Types
Deze gebruikersstudie met 39 clinici toont aan dat hoewel attributiegebaseerde verklaringen het meest significant het vertrouwen en het begrip van machine learning-voorspellingen in klinische settings verbeteren, bijna de helft van de deelnemers de voorkeur geeft aan het bekijken van meerdere typen verklaringen, wat suggereert dat toekomstige implementaties prioriteit moeten geven aan attributiemethoden terwijl ze diverse formaten aanbieden die zijn afgestemd op specifieke klinische rollen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je voor dat je een super-slimme robotarts hebt gebouwd die naar de gegevens van een patiënt kan kijken en kan voorspellen of iemand ziek gaat worden. Maar hier komt de adder onder het gras: de robot is een "black box". Hij geeft je een antwoord, maar hij vertelt je niet waarom. Het is als een magische 8-ball die zegt "Ja, gevaar!", maar weigert uit te leggen welke kristallen bol hij daarvoor heeft gebruikt.
Om dit op te lossen, besloten de onderzoekers in dit artikel drie verschillende manieren te testen om de manier van denken van de robot uit te leggen aan echte artsen (verpleegkundigen en medici). Ze wilden zien welke uitlegstijl ervoor zorgde dat artsen de robot meer vertrouwden, hem beter begrepen en daadwerkelijk van mening veranderden over wat er mis was met de patiënt.
De Drie "Zaklamp"-stijlen
Het team testte drie verschillende manieren om een licht te schijnen op de beslissing van de robot:
- De Attributie-zaklamp (De "Scorekaart"): Deze methode geeft elk stukje data een score. Het is alsof een docent een toets nakijkt en precies highlight welke antwoorden goed of fout waren en hoeveel punten elk antwoord waard was. Het zegt: "Je hartslag was hoog, en dat voegde 4,5 punten toe aan de risicoscore."
- De Counterfactual-zaklamp (De "Wat als"): Deze speelt een spellet van "wat als". Het laat de arts zien hoe hij de cijfers van de patiënt kan veranderen om een ander resultaat te krijgen. Het is als een cheatcode in een videogame die zegt: "Als je de hartslag verlaagt en de bloeddruk verhoogt, zal de robot stoppen met schreeuwen: 'Gevaar!'"
- De Regelgebaseerde Zaklamp (Het "Recept"): Deze methode geeft een eenvoudige lijst met regels, zoals een kookrecept. Het zegt: "ALS de lactaat hoog is EN de ademhaling snel is, DAN voorspelt de robot gevaar."
De Grote Onthulling: De Scorekaart wint
Nadat deze drie stijlen aan 39 artsen en verpleegkundigen waren getoond, waren de resultaten duidelijk. De Attributie-zaklamp (de Scorekaart) was de duidelijke winnaar.
- Vertrouwen: Wanneer artsen de scorekaart zagen, vertrouwden ze de voorspelling van de robot meer dan bij de andere twee stijlen.
- Begrip: De scorekaart was het makkelijkst te begrijpen. Artsen hadden het gevoel dat ze het echt "doorhadden".
- Invloed: Dit is het belangrijkste deel. De scorekaart veranderde daadwerkelijk wat de artsen belangrijk vonden. Wanneer zij de scorekaart zagen, waren ze eerder geneigd om te zeggen: "Oh, ik zat ernaast over wat de oorzaak van het risico was; de robot wijst naar iets anders."
Het artikel suggereert dat hoewel de andere twee methoden (de "Wat als"-stijl en de "Recept"-stijl) nuttig waren, ze niet dezelfde impact hadden. De "Wat als"-stijl werd in de vrije tekstreacties het minst gewaardeerd; veel artsen vonden het verwarrend of minder bruikbaar.
Artsen versus Verpleegkundigen: Een verhaal van twee workflows
Hier is een leuke wending: de twee soorten medische professionals reageerden verschillend.
- De Medici: Voordat ze de uitleg zagen, waren ze al vrij geïnteresseerd in de uitleg. Maar na het gebruik van de scorekaart, groeide hun interesse. Het is alsof ze dachten: "Ik wist al dat dit belangrijk was, maar nu zie ik hoe het mij helpt bij het maken van mijn grote beslissingen."
- De Verpleegkundigen: Zij vonden uitleg vanaf het begin al belangrijk, maar het zien van de uitleg veranderde hun mening niet echt. Het artikel suggereert dat dit kan komen omdat verpleegkundigen vaak strikte, stap-voor-stap protocollen volgen (zoals een checklist), waardoor een complexe uitleg hun workflow niet zo verandert als bij een arts die een diagnose stelt vanuit het niets.
Wat de artsen wilden
De studie vroeg ook aan de artsen wat zij het liefst op hun scherm zouden zien.
- Meer is beter (Maar niet te veel): Bijna de helft van de artsen (46,2%) zei dat ze alle drie de soorten uitleg tegelijkertijd wilden zien. Ze wilden niet kiezen voor slechts één stijl; ze wilden de scorekaart, de "wat als" en het recept allemaal samen om het volledige plaatje te krijgen.
- Houd het kort en krachtig: Wat betreft de details, wilden de artsen de "korte en bondige" versie. Ongeveer 77% van hen wilde alleen de top paar belangrijkste kenmerken op de scorekaart zien, in plaats van een lange lijst van alles. Op dezelfde manier wilden 84% van hen een korte lijst met regels, geen romanlengte recept.
Wat het artikel NIET zegt
Het is belangrijk om te weten wat deze studie niet heeft bewezen. De onderzoekers hebben niet gezegd dat deze uitleg de robotarts perfect maakt of dat het een betere patiëntuitkomst in de echte wereld garandeert. Ze hebben alleen gemeten wat de artsen zeiden en dachten tijdens een enquête. Ze hebben deze methoden ook niet getest op elk mogelijk type robotarts of elk soort ziekenhuis. De resultaten zijn gebaseerd op een specifieke robot die getraind is op tijdreeksgegevens (zoals de vitale functies van een patiënt in de loop van de tijd) en een specifieke groep van 39 artsen en verpleegkundigen van twee universiteiten.
De Kern van het Zaken
Als je een robotarts voor een ziekenhuis bouwt, geef de mens dan niet slechts één enkele uitleg. Het artikel suggereert dat je prioriteit moet geven aan de Attributie-scorekaart, omdat dit het meeste vertrouwen en begrip opbouwt. Echter, aangezien veel artsen alles willen zien, kun je hen waarschijnlijk de Scorekaart plus de andere stijlen laten zien, maar houd de lijsten kort en gemakkelijk leesbaar. En onthoud, als je met een verpleegkundige praat, zal de uitleg hun workflow misschien niet zozeer veranderen als die van een arts, dus pas je aanpak daarop aan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.