Comparative Performance of Frontier Large Language Models for Extracting High-Risk Pathologic Features from Unstructured Gastrointestinal Oncology Reports: A Systematic Benchmarking Study with Human and Traditional NLP Baselines
Deze systematische benchmarkstudie toont aan dat grensverleggende grote multimodale modellen, met name Gemini 2.5 Pro en GPT-4o, zowel onder tijdsdruk staande menselijke experts als traditionele NLP-baselines significant overtreffen bij het extraheren van de kritieke status van perineurale invasie uit ongestructureerde gastro-intestinale pathologierapporten, terwijl een nieuwe taxonomie van faalmodi bruikbare richtlijnen biedt voor modelselectie op basis van specifieke foutensignaturen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van medische dossiers voor als een gigantische, chaotische bibliotheek waar elk boek is geschreven in een ander dialect. In deze bibliotheek schrijven artsen lange, slordige verhalen over wat ze onder een microscoop zien, en verborgen in die verhalen zitten kleine, cruciale aanwijzingen die het toekomstige behandeltraject van een patiënt bepalen. Een van de belangrijkste aanwijzingen is iets dat "perineurale invasie" (PNI) wordt genoemd. Denk aan PNI als een sluwe dief die kankercellen langs de kleine zenuwen in het lichaam laat glippen, wat de ziekte moeilijker te bestrijden maakt. Als een arts deze aanwijzing mist, geven ze de patiënt misschien niet de juiste soort bestraling of extra medicatie die nodig is.
Jarenlang hebben computers geprobeerd deze verhalen te lezen om de aanwijzingen te vinden, maar ze raken vaak in de war door het slordige handschrift van menselijke taal. Ze kunnen een "nee" missen of blijven steken in een ingewikkelde zin. Nu is er een nieuwe generatie superintelligente computerbreinen gearriveerd, "Large Language Models" genoemd (zoals de modellen die chatbots aansturen). Dit zijn niet zomaar eenvoudige zoekmachines; het zijn als briljante studenten die een heel verhaal kunnen lezen, de context begrijpen en kunnen uitzoeken wat de arts echt bedoelde, zelfs als de woorden lastig zijn. De grote vraag die iedereen zich stelt is: zijn deze nieuwe AI-studenten slim genoeg om de sluwe kankerclues beter te vinden dan een vermoeide menselijke arts of een ouderwets computerprogramma?
Dit artikel is als een gigantische, prestigieuze spellingbee, maar in plaats van woorden te spellen, proberen de deelnemers die sluwe kankerclues te vinden in 445 echte medische rapporten. De onderzoekers hebben een race opgezet tussen vier van de krachtigste AI-modellen van dit moment: GPT-4o, Gemini 2.5 Pro, Claude 3.7 Sonnet en DeepSeek-R1. Maar ze lieten de AI niet alleen tegen elkaar strijden; ze voegden twee andere teams toe aan de race om te zien wie zou winnen. Het eerste team bestond uit een groep artsen-in-opleiding (assistenten) die de rapporten moesten lezen binnen een hectische tijdslimiet van 90 seconden, wat simuleert hoe druk echte artsen het hebben. Het tweede team was een traditioneel, ouder computerprogramma (BioBERT) dat specifiek was getraind op medische teksten, maar het gebrek aan "gezond verstand" heeft van de nieuwere AI.
De resultaten waren een duidelijke overwinning voor de nieuwe AI-modellen, maar met enkele interessante wendingen. De winnaar van de race voor pure nauwkeurigheid was Gemini 2.5 Pro, die in 95,8% van de gevallen het juiste antwoord gaf. Het werd zeer dicht gevolgd door GPT-4o, die 94,2% goed had. Beide AI-supersterren presteerden aanzienlijk beter dan de menselijke assistenten, die onder tijdsdruk slechts 77,2% goed hadden, en het ouderwetse BioBERT-programma, dat een score van 79,6% behaalde. Sterker nog, het beste AI-model was bijna 10% nauwkeuriger dan het gehaaste menselijke team.
Echter, het artikel stelt ook vast dat de AI nog niet perfect is. Zelfs de beste AI-modellen presteerden nog niet zo goed als een team van deskundige pathologen die de tijd namen en geen stopwatch boven hun hoofd hadden hangen (die 97,2% goed hadden). Dit betekent dat de AI erg goed is in het doen van de eerste ronde van het werk, het signaleren van de belangrijke gevallen, maar dat er nog steeds een menselijke expert nodig is om de definitieve beslissing te controleren.
De studie ontdekte ook dat elk AI-model verschillende soorten fouten maakt, zoals het hebben van verschillende "karakterfouten". Gemini 2.5 Pro was het beste in het halen van de algemene score, maar raakte soms in de war door negatieve woorden. Als een rapport zei "geen bewijs van invasie", miste Gemini soms de "geen" en dacht het dat de kanker aanwezig was. Aan de andere kant waren GPT-4o en Claude 3.7 Sonnet erg voorzichtig. Als het rapport vage woorden gebruikte zoals "mogelijk" of "waarschijnlijk", kozen deze modellen er vaak voor om te zeggen: "Ik weet het niet zeker", in plaats van te gokken. Hoewel dit veilig is, betekent het dat ze misschien gevallen missen die een mens wel zou opmerken.
Uiteindelijk suggereert het artikel dat deze nieuwe AI-modellen klaar zijn om te worden gebruikt als een "eerste verdedigingslinie" in ziekenhuizen. Ze kunnen honderden rapporten veel sneller en nauwkeuriger scannen dan een vermoeide mens, en zo de gevaarlijke aanwijzingen vinden die aandacht behoeven. Maar omdat ze nog steeds specifieke soorten fouten maken en niet zo perfect zijn als een zorgvuldige expert, is het beste plan om de AI het zware werk te laten doen en vervolgens een menselijke arts de definitieve goedkeuring te laten geven. Het is een teaminspanning waarbij de AI de supersnelle verkenner is en de mens de wijze kapitein die de uiteindelijke beslissing neemt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.