Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark
Deze studie toont aan dat hoewel jonge urologen op het gebied van urologische oncologie aanzienlijk beter presteren dan consumentgerichte grote taalmodellen wat betreft algemene nauwkeurigheid, veiligheid en responsstabiliteit, onderstrepen de frequente veiligheidskritische fouten en inconsistente outputs van de modellen de noodzaak voor klinisch toezicht in plaats van autonome inzet.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het snel evoluerende landschap van de moderne geneeskunde is kunstmatige intelligentie begonnen een nieuwe vorm van ondersteuning te bieden, in staat om enorme bibliotheken aan medische literatuur te lezen en complexe vragen binnen enkele seconden te beantwoorden. Deze systemen, bekend als grote taalmodellen, functioneren door de meest waarschijnlijke woorden te voorspellen die op een prompt volgen, waardoor ze coherente en vaak overtuigende antwoorden op klinische scenario's kunnen genereren. Voor artsen belooft deze technologie een krachtig hulpmiddel om informatie te organiseren, richtlijnen te controleren en besluitvorming te ondersteunen. De medische sector is echter gebouwd op een fundament van precisie en veiligheid, waarbij een enkele fout in oordeelsvorming levensveranderende gevolgen kan hebben. De kritische vraag waar de medische gemeenschap voor staat is niet alleen of deze machines deskundig kunnen klinken, maar of ze erop vertrouwd kunnen worden om veilige, consistente en volledige beslissingen te nemen wanneer de gezondheid van een patiënt op het spel staat.
Om dit te beantwoorden, ontwierp een team onderzoekers in Turkije een rigoureuze test om te zien hoe goed drie populaire, voor consumenten toegankelijke kunstmatige intelligentiesystemen presteerden in de hoogwaardige wereld van de urologische oncologie, die gaat over kankers van het urinestelsel. Ze creëerden honderd gedetailleerde, synthetische patiëntverhalen, variërend over vijf verschillende soorten kanker en diverse stadia van zorg, van de initiële diagnose tot de langetermijnopvolging. Deze verhalen werden gepresenteilt aan de drie kunstmatige intelligentiemodellen, evenals aan twee jonge urologen die onlangs hun gespecialiseerde opleiding hadden voltooid. De artsen en de machines kregen exact dezelfde instructies en mochten geen antwoorden opzoeken of externe bronnen gebruiken. Twee onafhankelijke experts, die niet wisten of de antwoorden van een mens of een machine kwamen, beoordeelden vervolgens elk antwoord aan de hand van een strikte set richtlijnen die door de Europese Vereniging voor Urologie was vastgesteld. Bij de beoordeling werd gelet op vier zaken: of het advies overeenkwam met de huidige medische richtlijnen, of het veilig was voor de patiënt, of het alle noodzakelijke stappen dekte, en of het ziektestadium correct werd geïdentificeerd.
De resultaten toonden een duidelijke kloof tussen de prestaties van de menselijke artsen en de kunstmatige intelligentiesystemen. De twee jonge urologen bereikten een hoog succesniveau, waarbij zij in tachtig-vijf en achtentig procent van de gevallen veilige en volledige antwoorden gaven. In contrast hiermee waren de kunstmatige intelligentiemodellen succesvol in slechts zestig tot zeventig procent van de gevallen. Hoewel de machines vaak antwoorden produceerden die aan de oppervlakte correct leken, misten ze regelmatig cruciale details of faalden ze in het opnemen van specifieke veiligheidswaarschuwingen die de menselijke artsen wel oppikten. De meest verontrustende bevinding was gerelateerd aan de patiëntveiligheid. Ongeveer één op de vier reacties van de kunstmatige intelligentiesystemen bevatte een fout die ernstige schade had kunnen veroorzaken, zoals het aanbevelen van een behandeling die gevaarlijk was voor de patiënt of het missen van een kritiek waarschuwingssignaal. De menselijke artsen maakten in vergelijking daarmee dergelijke veiligheidskritische fouten in slechts één of twee procent van de gevallen.
Naast de nauwkeurigheid van de antwoorden onderzocht de studie ook hoe betrouwbaar de kunstmatige intelligentiesystemen waren wanneer ze herhaaldelijk naar dezelfde vraag werden gevraagd. In de echte wereld zou een arts elke keer dat hij het geval beoordeelt, hetzelfde advies geven voor dezelfde patiënt. De onderzoekers ontdekten dat de kunstmatige intelligentiemodellen verrassend inconsistent waren. Wanneer dezelfde patiëntverhaal drie keer achter elkaar werd gevraagd, gaf het systeem minder dan de helft van de tijd exact dezelfde classificatie van succes of falen. Nog verontrustender was dat het systeem soms een veilig antwoord gaf bij de eerste poging, een onveilig antwoord bij de tweede, en weer een veilig antwoord bij de derde. Dit gebrek aan stabiliteit betekent dat de output van deze tools onvoorspelbaar kan veranderen, wat het moeilijk maakt om ze te vertrouwen voor consistente medische adviezen.
De onderzoekers concludeerden dat hoewel deze kunstmatige intelligentiesystemen nuttige informatie kunnen genereren, ze nog niet klaar zijn om onafhankelijk te opereren in een klinische setting. De studie suggereert dat het beste gebruik voor deze tools op dit moment een gesuperviseerde assistent is, waarbij een menselijke arts elke aanbeveling beoordeelt voordat deze op een patiënt wordt toegepast. De machines kunnen helpen bij het organiseren van informatie of het suggereren van opties, maar de uiteindelijke beslissing moet in menselijke handen blijven om veiligheid en consistentie te waarborgen. Totdat deze systemen de betrouwbaarheid en het veiligheidsrecord van menselijke specialisten kunnen evenaren, zou hun rol in de kankerzorg ondersteunend moeten zijn in plaats van autonoom, dienend als een tweede paar ogen in plaats van de primaire besluitvormer.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.