← Nieuwste papers
📄 otolaryngology

Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals

Deze studie toont aan dat huidige grote taalmodellen er niet in slagen een interbeoordelaarsbetrouwbaarheid te bereiken die vergelijkbaar is met die van medische professionals bij het extraheren van gestructureerde klinische informatie uit KNO-elektronische patiëntendossiers, wat suggereert dat ze het best geschikt zijn voor initiële data-extractie die menselijke verificatie vereist in plaats van autonome klinische inzet.

Oorspronkelijke auteurs: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.
Gepubliceerd 2026-08-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Ziekenhuizen genereren tegenwoordig een enorme oceaan aan schriftelijke verslagen. Elk patiëntenbezoek, elke testuitslag en elke behandelbeslissing wordt vastgelegd in digitale aantekeningen die bekend staan als elektronische patiëntendossiers. Deze documenten zijn rijk aan details en bevatten de specifieke taal die artsen gebruiken om symptomen te beschrijven, aandoeningen te diagnosticeren en zorg te plannen. Decennialang was het omzetten van deze ongestructureerde verhalen naar georganiseerde, doorzoekbare gegevens een moeilijke taak, die vaak vereiste dat mensen de informatie lazen en met de hand overschreven. Onlangs is er een nieuw type computerprogramma opgekomen, een groot taalmodel (large language model). Deze systemen zijn getraind op enorme hoeveelheden tekst en kunnen menselijke taal lezen, begrijpen en samenvatten met een verrassende vloeiendheid. Ze hebben bewezen medische vragen te kunnen beantwoorden en licentie-examens te kunnen halen, wat velen doet afvragen of ze ook patiëntendossiers kunnen lezen en de vitale feiten daarin automatisch kunnen extraheren.

Deze vraag gaat niet alleen over het besparen van tijd; het gaat over veiligheid en nauwkeurigheid. Als een computer artsen moet helpen bij het beheren van de patiëntenzorg, moet hij de juiste informatie vinden zonder dingen te verzinnen of cruciale details te missen. Een nieuwe studie zette uit om deze capaciteit direct te testen. Onderzoekers verzamelden bijna honderd echte patiëntendossiers van oor-, neus- en keelklinieken en vroegen zowel menselijke artsen als zeven verschillende grote taalmodellen om deze te lezen. De taak was om specifieke feiten naar voren te halen, zoals de leeftijd van de patiënt, hun symptomen, hun diagnose en de behandelingen die zij hebben ontvangen. Om ervoor te zorgen dat iedereen dezelfde taal sprak, vereisten de onderzoekers dat elk stuk informatie werd vertaald naar een gestandaardiseerde code die wereldwijd door ziekenhuizen wordt gebruikt. Dit maakte een nauwkeurige vergelijking mogelijk van hoe goed de machines presteerden ten opzichte van de mensen.

De resultaten toonden een duidelijke kloof tussen menselijke expertise en de huidige kunstmatige intelligentie. Wanneer de veertien artsen in de studie dezelfde dossiers lazen, stemden zij in 81 procent van de gevallen overeen over de geëxtraheerde informatie. Dit hoge niveau van overeenstemming toonde aan dat de artsen de aantekeningen consistent interpreteerden. Echter, wanneer de computermodellen werden vergeleken met de artsen, daalde de overeenstemming aanzienlijk naar ongeveer 66 procent. Met andere woorden: de machines waren nog niet zo betrouwbaar als de mensen in het identificeren van dezelfde feiten uit dezelfde tekst. De studie testte modellen van verschillende groottes, van massieve systemen met honderden miljarden verbindingen tot kleinere systemen die op lokale computers kunnen draaien. Geen van hen bereikte het niveau van consistentie dat door de medische professionals werd getoond.

De prestaties varieerden afhankelijk van het soort informatie dat werd geëxtraheerd. De modellen waren vrij goed in het vinden van behandelingen en testresultaten, die vaak op een duidelijke, standaard manier zijn opgeschreven. Ze waren minder succesvol met symptomen en diagnoses, die vaak een dieper begrip van de klinische context vereisen. Interessant genoeg hadden de computers de neiging om meer informatie te vinden dan de artsen deden, met name met betrekking tot risicofactoren. Terwijl artsen zich vaak richten op het onmiddellijke probleem, leken de modellen elke genoemde mogelijke risicofactor te signaleren. Dit suggereert dat de machines niet alleen menselijk gedrag kopiëren, maar de tekst anders verwerken, waarbij ze soms details oppikken die een mens over het hoofd zou kunnen zien, maar ook potentieel zaken signaleren die klinisch niet relevant zijn.

Ondanks deze verschillen toonden de machines aan dat ze nuttige hulpmiddelen konden zijn als ze correct worden gebruikt. De studie vond dat wanneer de modellen een stuk informatie identificeerden, ze meestal juist waren, met een precisiegraad van 97 procent. Dit betekent dat ze zelden feiten verzinnen die er niet zijn. Ze misten echter informatie in ongeveer 15 procent van de gevallen. Dit patroon wijst op een specifieke rol voor deze tools in de toekomst: ze zijn het best geschikt om als eerste passage te dienen, waarbij ze snel dossiers scannen om waarschijnlijke kandidaten te extraheren voor de arts om te beoordelen. De uiteindelijke beslissing en verificatie zouden nog steeds van een mens moeten komen. De onderzoekers concludeerden dat hoewel deze modellen krachtig zijn, ze nog niet klaar zijn om zelfstandig in een klinische setting te werken. Ze zijn het best te zien als assistenten die kunnen helpen bij het organiseren van de vloedgolf aan medische gegevens, mits er altijd een menselijke expert aanwezig is om hun werk te controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →