← Nieuwste papers
🏥 surgery

Calibrating trust in AI-assisted pituitary surgery

Deze studie toont aan dat het verbeteren van een door AI ondersteund beslissingsondersteunend systeem voor hypofysechirurgie met verklarende functies en betrouwbaarheidslabels de kalibratie van klinisch vertrouwen verbetert — het verminderen van overmatige afhankelijkheid tijdens slechte AI-prestaties — en zorgt voor een grotere consistentie en prestaties op seniorniveau vergeleken met een basisinterface.

Oorspronkelijke auteurs: Hudson, G. R., Khan, D. Z., Fayez, F., Bhatia, S., Bano, S., Costanza, E., Blandford, A., Stoyanov, D., McCulloch, P., Marcus, H. J., University College London Collaborators,

Gepubliceerd 2026-06-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hudson, G. R., Khan, D. Z., Fayez, F., Bhatia, S., Bano, S., Costanza, E., Blandford, A., Stoyanov, D., McCulloch, P., Marcus, H. J., University College London Collaborators,

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je voor dat je een chirurg bent die een delicate operatie uitvoert op een piepkleine, complexe structuur diep in de schedel, de hypofyse. Het is alsof je door een doolhof probeert te navigeren terwijl je geblinddoekt bent, maar je hebt een high-tech GPS (Artificiële Intelligentie) die een gloeiende lijn op je scherm tekent om aan te geven waar het veilige pad ligt.

De grote vraag van dit onderzoek was: In hoeverre moet je die GPS vertrouwen?

Als je er te veel op vertrouwt wanneer hij het fout heeft, kun je crashen. Als je er niet genoeg op vertrouwt wanneer hij het goed heeft, mis je misschien een kortere route. De onderzoekers wilden zien of het veranderen van het "uiterlijk en gevoel" van de GPS kon helpen om chirurgen een perfecte balans in vertrouwen te laten vinden.

Het Experiment: Twee Typen GPS

De onderzoekers verzamelden 70 ervaren chirurgen en medische studenten en plaatsten hen in een virtueel reality-achtige online test. Ze vroegen hen om de contouren van de hypofyse te tekenen op zes verschillende videoclips van echte operaties.

De deelnemers werden verdeeld in twee groepen, die elk een andere versie van de AI-helper gebruikten:

  1. De "Basale" GPS: Deze versie tekende alleen de lijn. Het was als een standaard GPS die zegt: "Sla hier linksaf," maar geen uitleg geeft over waarom of hoe zeker hij is.
  2. De "Verbeterde" GPS: Deze versie was als een GPS met een pratende copiloot. Hij tekende niet alleen de lijn; hij toonde ook een betrouwbaarheidsmeter (een percentage dat aangeeft hoe zeker de AI is) en gaf een korte briefing over hoe de AI getraind was en hoe betrouwbaar deze gewoonlijk is.

De Twist: De GPS Raakt Gestrest

Om vertrouwen te testen, lieten de onderzoekers niet alleen perfecte video's zien. Ze lieten de clips zo volgorde zetten dat de AI begon te zijn perfect, vervolgens geleidelijk slechter en verwarder werd, om aan het einde weer iets beter te worden. Het was alsof je door een heldere stad rijdt, dan door dichte mist rijdt, en vervolgens een bouwzone raakt waar de GPS vreemde instructies begint te geven.

Wat Er Gebeurde

1. Wanneer de AI perfect was:
Beide groepen vertrouwden de AI evenveel. Interessant genoeg vertrouwde de "Verbeterde" groep (degenen met de pratende copiloot) de AI niet méér dan de "Basale" groep. Echter, de ervaren chirurgen in de "Verbeterde" groep deden het daadwerkelijk iets beter bij het tekenen van de lijnen. Het lijkt erop dat de extra informatie de experts hielp om genoeg vertrouwen te voelen om het hulpmiddel effectiever te gebruiken, bijna alsof ze de beste delen van het advies van de AI "uitkozen".

2. Wanneer de AI in de war raakte (Het Mistige Deel):
Dit is waar de studie echt interessant werd. Terwijl de AI fouten begon te maken, bleef de "Basale" groep er een beetje te veel op vertrouwen. Ze waren als bestuurders die een GPS blijven volgen, zelfs als deze zegt dat ze een meer in moeten rijden.

De "Verbeterde" groep daarentegen stopte veel sneller met het vertrouwen ervan. Omdat zij zagen dat de "betrouwbaarheidsmeter" daalde en wisten dat de AI moeite had, verlaagden zij hun vertrouwen aanzienlijk. Dit wordt vertrouwen kalibreren genoemd. Ze realiseerden zich: "Hé, dit hulpmiddel heeft een slechte dag, ik moet er niet blind op vertrouwen."

3. Het Resultaat van Lager Vertrouwen:
Hoewel de "Verbeterde" groep de AI minder vertrouwde wanneer deze fouten maakte, tekenden zij niet noodzakelijkerwijs de lijnen beter dan de "Basale" groep. Hun resultaten waren echter wel consistenter. Ze maakten geen wilde, gevaarlijke fouten. Het is alsof de "Verbeterde" groep besloot: "De GPS is kapot, dus ik rijd gewoon voorzichtig en vertrouw op mijn eigen instincten," terwijl de "Basale" groep probeerde de kapotte GPS te blijven volgen en daardoor alle kanten op schoot.

De Kern van het Verhaal

De studie toonde aan dat het geven van meer informatie aan chirurgen (zoals betrouwbaarheidsscores en achtergrondinformatie over de AI) hen helpt om hun vertrouwen te kalibreren.

  • Goede AI: De extra informatie helpt experts om het hulpmiddel zelfs nog beter te gebruiken.
  • Slechte AI: De extra informatie fungeert als een veiligheidscontrole, waardoor chirurgen beseffen: "Dit werkt niet," en voorkomt dat ze een fout blindelings volgen.

De onderzoekers concluderen dat hoewel deze extra informatie de AI niet magisch perfect maakt, het chirurgen wel helpt te weten wanneer ze het moeten vertrouwen en wanneer ze het moeten negeren. Dit is een cruciale veiligheidsfunctie voordat deze hulpmiddelen ooit in een echte operatiekamer worden gebruikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →