Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models
Deze studie toont aan dat hoogwaardige open-source grote taalmodellen, in het bijzonder Llama 3.3 70B, complexe percutane coronaire interventieprocedures accuraat en automatisch kunnen identificeren en belangrijke variabelen uit vrije tekst van hartkatheterisatieverslagen kunnen extraheren, wat een schaalbaar alternatief biedt voor de arbeidsintensieve handmatige abstractie voor cardiovasculair onderzoek.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Ziekenhuizen genereren dagelijks een enorme oceaan aan ongestructureerde tekst. Een van de meest kritieke documenten hiervan zijn de narratieve rapporten die worden geschreven na een hartkatheterisatie, een procedure waarbij artsen een dunne slang door de slagaders leiden om de bloedvaten van het hart te onderzoeken. Deze rapporten zijn rijk aan details over de anatomie van het hart van een patiënt en de specifieke technieken die worden gebruikt om blokkades te verhelpen, maar ze zijn geschreven in vrij lopende paragrafen in plaats van in nette, selectievakjes. Voor onderzoekers en teams voor kwaliteitsverbetering creëert dit een aanzienlijke flessenhals. Om te bestuderen hoe goed deze procedures werken of om de complexiteit van gevallen over een heel gezondheidssysteem te volgen, moeten menselijke experts duizenden van deze rapporten handmatig lezen en specifieke datapunten extraheren. Dit proces is traag, duur en moeilijk schaalbaar, wat de omvang en snelheid van belangrijke medische studies vaak beperkt.
De opkomst van grote taalmodellen, een type kunstmatige intelligentie dat in staat is om mensachtige tekst te begrijpen en te genereren, biedt een potentiële oplossing voor dit probleem. Deze systemen kunnen worden getraind om complexe documenten te lezen en specifieke feiten eruit te halen, vergelijkbaar met een zeer snelle, onvermoeibare onderzoeksassistent. Het bleef echter onduidelijk of deze tools de genuanceerde, gespecialiseerde taal konden hanteren die in hartprocedureverslagen wordt gevonden, met name wanneer gevraagd werd om "complexe" gevallen te identificeren die betrokken zijn bij meerdere blokkades of moeilijke technieken. Een team van onderzoekers zette zich af om deze vraag te testen met behulp van een grote collectie echte hartkatheteriserapportages.
De onderzoekers verzamelden 1.412 gede-identificeerde procedureverslagen van drie verschillende ziekenhuizen binnen het Yale New Haven Health-systeem. Deze documenten besloegen procedures die werden uitgevoerd tussen 2011 en 2017 en bevatten een mix van diagnostische onderzoeken en daadwerkelijke interventies waarbij artsen stents plaatsten of ballonnen gebruikten om geblokkeerde slagaders te openen. Om een betrouwbare standaard voor vergelijking te creëren, hebben een groep expert hartspecialisten elk verslag handmatig gelezen. Ze bepaalden eerst of een rapport een procedure beschreef waarbij een stent of ballon daadwerkelijk werd gebruikt om een kransslagader te behandelen. Voor de gevallen waarin dat wel het geval was, extraheerden zij vervolgens zes specifieke details die een "complexe" procedure definiëren: het aantal behandelde bloedvaten, het aantal afzonderlijke blokkades die zijn verholpen, het totale aantal geplaatste stents, of er een specifieke twee-stent-techniek werd gebruikt voor een vertakkend vat, de totale lengte van alle stents gecombineerd, en of een chronische totale occlusie — een volledige, langdurige blokkade — werd behandeld.
Met deze door mensen geverifieerde "gouden standaard" op de hand, testte het team drie verschillende modellen voor kunstmatige intelligentie om te zien of ze het werk van de experts konden evenaren. Ze kozen voor modellen die open-source zijn, wat betekent dat hun code en gewichten publiekelijk beschikbaar zijn, waardoor de onderzoekers ze op beveiligde, lokale computers konden draaien om de privacy van patiënten te beschermen. Eén model was een massief, algemeen systeem met 70 miljard parameters, een maatstaf voor de grootte en het vermogen tot redeneren. De andere twee waren kleinere modellen die specifiek waren voorgetraind op medische literatuur, met elk 7 miljard parameters, ontworpen om medische terminologie te begrijpen. De onderzoekers voerden dezelfde tekstprompts en rapporten aan alle drie de modellen, waarbij ze vroegen of een procedure heeft plaatsgevonden en om de zes specifieke variabelen te extraheren.
De resultaten toonden een duidelijk onderscheid in capaciteit. Het grote, algemene model presteerde aanzienlijk beter dan de twee kleinere, medisch gespecialiseerde modellen. Wanneer simpelweg werd gevraagd om te identificeren of een rapport een hartprocedure beschreef, bereikte het grote model een perfecte sensitiviteit, wat betekent dat het nul werkelijke procedures miste, en identificeerde het niet-procedures met een hoge nauwkeurigheid. In contrast hiermee worstelden de kleinere modellen; één model zag niet-procedureverslagen vaak aan voor procedures, en de ander herkende bijna geen enkele werkelijke procedure.
De kloof werd groter toen de taak vereiste om de zes complexe details te extraheren. Het grote model identificeerde het aantal stents en de totale lengte van de stents met een zeer hoge nauwkeurigheid, vaak meer dan 90 procent. Het presteerde ook goed bij het identificeren van het aantal behandelde vaten. Echter, de prestaties namen af bij variabelen die meer interpretatie vereisten, zoals het tellen van het exacte aantal afzonderlijke blokkades of het bepalen of een specifieke twee-stent-techniek werd gebruikt voor een vertakkend vat. In die gevallen miste het model soms details of interpreteerde het de context verkeerd, hoewel het nog steeds veel nauwkeuriger was dan de kleinere modellen. De kleinere medische modellen, ondanks hun gespecialiseerde training, slaagden er niet in om deze details consistent te extraheren, en produceerden vaak resultaten die te onbetrouwbaar waren voor wetenschappelijk onderzoek.
De studie onderzocht ook of de modellen anders presteerden over de drie ziekenhuislocaties heen. Hoewel het grote model een hoge nauwkeurigheid behield op alle drie de locaties, waren er merkbare variaties in hoe goed het op elke locatie presteerde, waarschijnlijk door verschillen in de manier waarop artsen op elk ziekenhuis hun verslagen schreven. De kleinere modellen vertoonden een nog grotere inconsistentie, waarbij hun prestaties sterk fluctueerden afhankelijk van de locatie. Dit suggereert dat, hoewel het grote model robuust is, de manier waarop informatie wordt gedocumenteerd de resultaten nog steeds kan beïnvloeden.
De onderzoekers analyseerden de fouten die door het best presterende model werden gemaakt om te begrijpen waar het moeite mee had. Ze ontdekten dat fouten vaak voorkwamen wanneer de documentatie ambigu of gefragmenteerd was. Bijvoorbeeld, het model verwarde soms een diagnostische test met een behandeling, of het had moeite om het onderscheid te maken tussen een stent die succesvol was geplaatst en een stent die wel geprobeerd maar niet geplaatst was. Het had ook moeite wanneer een rapport melding maakte van een blokkade die niet daadwerkelijk werd behandeld, of wanneer de beschrijving van een chronische totale occlusie eerder geïmpliceerd dan expliciet vermeld werd. Deze fouten benadrukken dat, hoewel de technologie krachtig is, deze nog niet perfect is in het navigeren door de rommelige, inconsistente realiteit van menselijke medische verslaglegging.
Uiteindelijk demonstreert de studie dat een groot, open-source model voor kunstmatige intelligentie accuraat complexe gegevens kan extraheren uit ongestructureerde hartprocedureverslagen, een taak die traditioneel uren aan handmatige arbeid vereist. De bevindingen suggereren dat voor veel variabelen, met name die expliciet vermeld worden zoals het aantal stents, deze tools een nauwkeurigheidsniveau kunnen bereiken dat geschikt is voor onderzoek. Echter, voor variabelen die diepe contextuele interpretatie vereisen, staat de technologie nog steeds voor uitdagingen. Het werk geeft aan dat de toekomst van schaalbaar cardiovasculair onderzoek kan liggen in het gebruik van deze krachtige modellen om het grootste deel van de data-extractie af te handelen, potentieel gecombineerd met menselijk toezicht voor de moeilijkste gevallen, in plaats van uitsluitend te vertrouwen op kleinere, gespecialiseerde modellen of handmatige controle.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.