Evaluating Clinical Symptom Extraction and Reasoning in Local Large Language Models: A Proof-of-Concept Study of Symptom-Specific Performance in Cardiology
Deze proof-of-concept studie evalueert lokaal geïmplementeerde grote taalmodellen (Gemma3 en Qwen3.5) op Japanse cardiologische ontslagbrieven, waarbij wordt onthuld dat hoewel de algehele nauwkeurigheid van symptoomextractie hoog is, de prestaties variëren per specifiek symptoom en de modellen vaak condities zoals hartkloppingen of vermoeidheid afleiden uit objectieve klinische bevindingen in plaats van uit expliciete patiëntenklachten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Ziekenhuizen genereren elke dag enorme hoeveelheden schriftelijke verslagen, van de initiële beschrijving van de pijn van een patiënt tot de laatste aantekeningen over hun herstel. Veel van deze informatie zit opgesloten in vrij lopende tekstparagrafen, wat het moeilijk maakt om snel te sorteren, te zoeken of te analysen. Decennialang hebben artsen en onderzoekers vertrouwd op handmatige inspanning om deze aantekeningen te lezen en specifieke details eruit te halen, een traag en tijdrovend proces dat gevoelig is voor menselijke fouten. Onlangs is er een nieuw type computerprogramma bekend als een groot taalmodel (large language model) opgekomen als een potentiële oplossing. Deze systemen zijn getraind op enorme bibliotheken van tekst en kunnen de menselijke taal goed genoeg begrijpen om een medische aantekening te lezen en specifieke feiten te identificeren, zoals of een patiënt melding maakte van kortademigheid of het ervaren van pijn op de borst. Omdat deze hulpmiddelen volledig binnen de eigen beveiligde computers van een ziekenhuis kunnen werken zonder privégegevens naar de buitenwereld te sturen, bieden ze een veelbelovende manier om rommelige handgeschreven of getypte aantekeningen om te zetten in schone, georganiseerde gegevens die gebruikt kunnen worden om de patiëntenzorg te verbeteren.
Een team van onderzoekers aan de Universiteit van Tokio zette zich scharpe om te testen hoe goed twee van deze lokale computerprogramma's deze taak konden uitvoeren in het specifieke en risicovolle gebied van hartfalen. Ze richtten zich op patiënten met gevorderd hartfalen die werden geëvalueerd voor een harttransplantatie, een groep wiens symptomen complex en gevarieerd zijn. De onderzoekers kozen tien echte patiëntendossiers uit hun eigen ziekenhuis, die de periode tussen 2017 en 2023 beslaan. Deze dossiers waren geschreven in het Japans en bevatten het volledige verhaal van het ziekenhuisverblijf van elke patiënt, inclusief waar zij over klaagden, wat de artsen vonden tijdens onderzoeken en hoe hun toestand in de loop van de tijd veranderde. Het team vroeg de computerprogramma's om naar deze tien verhalen te kijken en de aanwezigheid of afwezigheid van acht specifieke symptomen te identificeren die vereist zijn voor de plaatsing op een transplantatielijst, zoals hartkloppingen, extreme vermoeidheid en flauwvallen. Om de zekerheid te geven dat de antwoorden van de computer accuraat waren, beoordeelden vijf expert-hartspecialisten onafhankelijk dezelfde tien verhalen en kwamen zij tot een overeenstemming over een "ground truth" voor elk symptoom, waardoor een betrouwbare standaard werd gecreëerd waartegen de machines konden worden afgemeten.
De onderzoekers testten de computerprogramma's onder verschillende sets instructies om te zien hoe de formulering van de opdracht de resultaten veranderde. In één scenario kregen de programma's de opdracht om de volledige medische geschiedenis te scannen op enige vermelding van de symptomen. In een ander scenario kregen ze expliciet de instructie om symptomen te negeren die mogelijk in de medische geschiedenis van de patiënt werden genoemd en zich alleen te concentreren op wat er gebeurde tijdens deze specifieke ziekenhuisopname. Ze testten ook of het vragen aan de programma's om "hardop na te denken" en hun redenering uit te leggen voordat ze een antwoord gaven, de nauwkeurigheid zou verbeteren. De studie toonde aan dat beide computerprogramma's over het algemeen zeer goed waren in de taak en in de meeste gevallen correct de aanwezigheid of afwezigheid van symptomen identificeerden. De prestaties waren echter niet perfect, en de fouten waren niet willekeurig. De programma's hadden de meeste moeite met twee specifieke symptomen: hartkloppingen, wat de sensatie is van een racende of bonzende hartslag, en vermoeidheid (fatigability), of een overweldigend gevoel van uitputting.
Wanneer de onderzoekers de fouten onderzochten die de computers maakten, ontdekten ze een duidelijk patroon in hoe de machines dachten. Voor het symptoom hartkloppingen besloten de programma's vaak dat een patiënt ze ervoer simpelweg omdat het medisch dossier een abnormale hartritme of een snelle hartslag liet zien, zelfs als de patiënt nooit daadwerkelijk had geschreven of gezegd dat hij of zij een racend hart voelde. De computer concludeerde het symptoom uit de objectieve medische gegevens in plaats van uit een directe klacht van de patiënt. Op een vergelijkbare manier concludeerden de programma's bij vermoeidheid vaak dat een patiënt moe was omdat de patiënt hartfalen had, een aandoening die bekend staat om het veroorzaken van vermoeidheid, zelfs wanneer de specifieke aantekening helemaal niet over vermoeidheid sprak. De computer vulde de hiaten in met medische logica in plaats van zich strikt aan de tekst te houden. Deze neiging was zo sterk dat de computer in sommige gevallen correct identificeerde dat een patiënt een onregelmatige hartslag had, maar nog steeds onterecht beweerde dat de patiënt hartkloppingen voelde, terwijl het in andere gevallen met dezelfde medische bevindingen correct zei dat de patiënt ze niet voelde, wat een inconsistentie in de redenering toonde.
De studie onthulde ook dat de wijze waarop de instructies werden geformuleerd ertoe deed. Wanneer de onderzoekers een van de programma's vertelden de eerdere medische geschiedenis te negeren en zich alleen te concentreren op het huidige ziekenhuisverblijf, werd het programma veel voorzichtiger met het vinden van symptomen, maar het miste ook veel symptomen die er daadwerkelijk waren. Het werd zo strikt in het negeren van alles wat niet expliciet in de huidige context werd beschreven, dat het er niet in slaagde symptomen te vangen die duidelijk deel uitmaakten van de huidige toestand van de patiënt. Dit suggereert dat hoewel deze computerprogramma's krachtige hulpmiddelen zijn, ze niet simpelweg woorden lezen zoals een mens dat doet; ze interpreteren de tekst op basis van medische associaties en patronen die ze hebben geleerd. Ze kunnen afleiden dat een symptoom bestaat op basis van andere feiten, wat nuttig kan zijn maar ook leidt tot fouten wanneer die afleiding onjuist is. De onderzoekers merkten op dat deze bevindingen gebaseerd zijn op een klein aantal gevallen en dat de programma's anders reageerden afhankelijk van de specifieke instructies, wat aangeeft dat de technologie nog in ontwikkeling is.
Uiteindelijk laat dit werk zien dat hoewel lokale computerprogramma's de extractie van medische informatie kunnen automatiseren, ze nog niet het zorgvuldige oordeel van een menselijke lezer vervangen. De machines zijn in staat de context van een medische aantekening te begrijpen, maar soms laten ze hun kennis van hoe ziekten werken de feiten op de pagina overschaduwen. Om deze hulpmiddelen echt bruikbaar te maken in een ziekenhuisomgeving, zullen ontwikkelaars precies moeten begrijpen hoe de programma's hun diagnose redeneren en hoe ze hen kunnen sturen om te vertrouwen op expliciete patiëntklachten in plaats van medische aannames. De studie dient als een bewijs van concept (proof of concept), dat aantoont dat deze systemen binnen het beveiligde netwerk van een ziekenhuis kunnen werken en complexe medische teksten kunnen verwerken, maar het benadrukt ook de noodzaak van nauwlettend toezicht om ervoor te zorgen dat de geautomatiseerde extractie van symptomen accuraat en betrouwbaar blijft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.