Towards understanding the disease landscape of clinical trials in Germany: Ontology and embedding-based pipelines versus Large Language Models for ICD-10 Harmonization
Deze studie toont aan dat hoewel een deterministische ontologie en een op embeddings gebaseerde pipeline de heterogene klinische proefgegevens in Duitsland gedeeltelijk kunnen harmoniseren met de ICD-10-standaarden, Large Language Models (specifiek GPT-4o) dit aanzienlijk overtreffen door een bijna perfecte overeenstemming met de codering door menselijke experts te bereiken, waardoor zij een superieure oplossing bieden voor cross-register ziektebeeldanalyse.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek probeert te organiseren waar elk boek in een andere taal is geschreven, een ander alfabet gebruikt, en waar soms gewoon een plakbriefje met "iets over een zieke persoon" op zit in plaats van een titel. Dit is de huidige staat van klinische trialdata. Wetenschappers voeren duizenden experimenten uit om nieuwe medicijnen te testen, maar ze registreren deze trials in verschillende databases over de hele wereld. Sommigen gebruiken strikte medische codes, anderen gebruiken chique medische woordenboeken, en sommigen schrijven het gewoon in gewone Engelse of Duitse taal op. Het is alsof je probeert te tellen hoeveel mensen "hartproblemen" bestuderen wanneer de ene database "cardiale problemen" zegt, een andere "hartproblemen" en een derde gewoon "au, mijn borst doet pijn" zegt. Zonder een manier om al deze verschillende beschrijvingen naar één gemeenschappelijke taal te vertalen, is het ontzettend moeilijk om het grote plaatje te zien van welke ziekten wetenschappers daadwerkelijk bestuderen en waar de hiaten zitten.
Om dit op te lossen, hebben onderzoekers een vertaler nodig. In de medische wereld is de "universele taal" voor ziekten de ICD-10, een gigantische lijst met codes die elke bekende gezondheidstoestand categoriseert. De uitdaging is om de rommelige, door elkaar gehusselde beschrijvingen uit trial-registers automatisch om te zetten in de juiste ICD-10-code. Lange tijd hebben wetenschappers geprobeerd computerprogramma's te bouwen die fungeren als strikte bibliothecarissen, die een rigide regelboek volgen om woorden aan codes te koppelen. Recentelijk is er een nieuw type superintelligent computerbrein, een Large Language Model (LLM), "in de chat" gekomen. Deze modellen zijn getraind op enorme hoeveelheden tekst en zijn erg goed in het begrijpen van context en nuance, bijna als een mens die tussen de regels door kan lezen. De grote vraag is: kunnen deze AI-hersenen een betere taak uitvoeren bij het vertalen van trial-beschrijvingen dan de oude, op regels gebaseerde systemen?
Dit artikel duikt direct in die vraag door een hoogtechnologische pijplijn te bouwen om klinische trial-beschrijvingen van vier belangrijke registers in Duitsland te vertalen naar de standaard ICD-10-codes. De onderzoekers creëerden een "deterministische pijplijn", wat een chique manier is om een proces met meerdere stappen te zeggen. Eerst extraheert de robot de ziektemeldingen. Vervolgens probeert het ze te koppelen met behulp van een strikt medisch woordenboek (ontologie) en een slimme zoekmachine die zoekt naar vergelijkbare betekenissen (embeddings). Ze voegden zelfs een tweede versie toe die de topvoorspellingen opnieuw rangschikt om te zien of het de juiste kan vinden. Maar ze stopten daar niet. Ze testten ook een krachtig Large Language Model (GPT-4o), maar met een twist: ze dwongen de AI om exact dezelfde stapsgewijze logica en regels te volgen die menselijke experts gebruiken, enkel om te zien of de AI een betere "bibliothecaris" kon zijn dan de robot.
De resultaten waren een schok voor de ouderwetse aanpak. Toen ze de op regels gebaseerde robot-pijplijn testten tegen een "gouden standaard" van codes geschreven door menselijke medische experts, kreeg de robot slechts ongeveer 49% van de tijd gelijk bij het zoeken naar de specifieke driecijferige code. De robot was redelijk in het raden van de algemene categorie (zoals "hartziekte" versus "longziekte"), waarbij het ongeveer 59% goed had, maar het worstelde met de details. De robot raakte vaak in de war door ziekten die op elkaar lijken of kon de juiste code niet vinden in zijn woordenboek.
Het Large Language Model bevond zich echter in een totaal andere klasse. Toen dezelfde AI dezelfde regels en dezelfde taak kreeg, behaalde het een verbazingwekkende nauwkeurigheid van 96,7%. Het stemde bijna perfect overeen met de menselijke experts. Het artikel suggereert dat de superkracht van de AI niet alleen het kennen van de codes is, maar het vermogen om de context van een zin te begrijpen. Als een trial bijvoorbeeld "diabetes bij volwassenen" vermeldt, weet de AI direct dat dit Type 2-diabetes betekent, terwijl de robot misschien vastloopt bij het proberen de exacte woorden te matchen. De AI slaagde er ook in om plausibele codes toe te wijzen aan ongeveer 82% van de meldingen die de robot had opgegeven en afgewezen.
De auteurs kwamen tot de conclusie dat de belangrijkste fout van de robot niet lag in het rangschikken van de codes, maar in het überhaupt vinden van de juiste code. Als de juiste code niet in de initiële lijst met kandidaten van de robot stond, kon geen enkele herrangschikking het nog redden. De AI was daarentegen veel beter in staat om uit te vogelen wat de juiste code zou moeten zijn, zelfs wanneer de tekst rommelig of vaag was. De studie concludeert dat hoewel de oude op regels gebaseerde systemen oké zijn voor het krijgen van een ruwe indruk van ziektetrends, Large Language Models de duidelijke winnaars zijn voor het krijgen van de details goed. Ze suggereren dat toekomstige studies die naar het landschap van klinische trials kijken, deze AI-tools moeten gebruiken om een veel duidelere, nauwkeurigere kijk te krijgen op welke ziekten worden bestudeerd, wat helpt om ervoor te zorgen dat onderzoeksinspanningen daadwerkelijk gericht zijn op de gezondheidsbehoeften die er echt toe doen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.