← Nieuwste papers
📄 health informatics

Interoperability of standardised electronic healthcare records facilitates transfer learning of clinical language models

Deze studie toont aan dat het standaardiseren van elektronische patiëntendossiers naar het OMOP common data model effectief het transfer learning van klinische taalmodellen over diverse Britse datasets mogelijk maakt, waarbij een hoge voorspellende prestatie voor spoedige ziekenhuisheropname wordt bereikt ondanks demografische verschillen en beperkingen in de vocabulaire.

Oorspronkelijke auteurs: Remfry, E., Henkin, R.

Gepubliceerd 2026-09-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Remfry, E., Henkin, R.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Ziekenhuizen en dokterspraktijken genereren een enorme, continue stroom van digitale aantekeningen over patiënten. Deze elektronische dossiers bevatten de geschiedenis van elk bezoek, elk recept en elke testuitslag. De manier waarop verschillende systemen deze informatie opschrijven, is echter vaak inconsistent. De ene kliniek gebruikt misschien een specifieke code voor een hoge bloeddrukmeting, terwijl een andere een compleet andere code gebruikt voor precies hetzelfde ding. Dit gebrek aan uniformiteit maakt het moeilijk om gegevens uit verschillende bronnen te combineren om patronen te vinden of om computers te leren gezondheidstrends te herkennen. Om dit op te lossen, hebben onderzoekers een universele vertaler voor medische gegevens ontwikkeld, een gemeenschappelijk datamodel. Denk aan een gedeeld woordenboek dat verschillende coderingssystemen dwingt om het eens te worden over de betekenis van een medische gebeurtenis, waardoor een chaotische mix van lokale afkortingen wordt omgezet in een enkele, gestandaardiseerde taal. De hoop is dat als computers leren deze universele taal van de ene groep patiënten te begrijpen, ze die kennis ook kunnen toepassen op een compleet andere groep patiënten elders, zonder dat ze vanaf nul opnieuw getraind hoeven te worden.

In een recente studie hebben onderzoekers getest of dit idee in de echte wereld werkt met behulp van twee grote collecties gezondheidsgegevens uit het Verenigd Koninkrijk. Ze richtten zich op een specifieke taak: voorspellen of een patiënt binnen dertig dagen na ontslag weer naar het ziekenhuis moet terugkeren voor een spoedgeval. De twee databronnen die ze kozen, waren behoorlijk verschillend. Eén dataset kwam van een netwerk van huisartsenpraktijken in heel Engeland, terwijl de andere alleen afkomstig was van praktijken in Londen. Deze groepen mensen verschilden in leeftijd, etniciteit en economische achtergrond, en de computers in elk systeem hadden de medische geschiedenissen oorspronkelijk met verschillende coderingssystemen vastgelegd. De onderzoekers vertaalden eerst beide sets gegevens naar de eerder genoemde standaard universele taal. Vervolgens trainden ze een geavanceerd computerprogramma, een klinisch taalmodel genoemd, om de patronen in de eerste dataset te begrijpen. Dit programma leerde de sequentie van medische gebeurtenissen te lezen en de waarschijnlijkheid van een toekomstige spoedopname in te schatten.

De cruciale test kwam toen de onderzoekers dit getrainde programma vroegen om naar de tweede dataset te kijken, de dataset uit Londen, zonder het nieuwe training te geven. Ze wilden zien of de kennis die was opgedaan bij de eerste groep, kon worden overgedragen naar de tweede groep. De resultaten waren bemoedigend. Het model, dat de Londense data nog nooit eerder had gezien, presteerde bijna even goed op de nieuwe groep als een model dat specifiek voor die groep vanaf het begin was getraind. Het identificeerde patiënten met een risico correct met een hoge mate van nauwkeurigheid, waarmee het een model dat vanaf nul was opgebouwd zonder voorafgaande kennis, ruim overtrof. Dit suggereert dat de standaardisering van de gegevens de computer in staat stelde om algemene principes over gezondheidsrisico's te leren die van toepassing waren op verschillende populaties, zelfs wanneer die populaties op papier zeer verschillend waren.

De onderzoekers gingen ook dieper in op de vraag welke delen van de medische dossiers deze voorspellingen aanstuurden. Ze ontdekten dat de belangrijkste informatie voortkwam uit de geschiedenis van de aandoeningen van de patiënt en de observaties van artsen, zoals aantekeningen over symptomen of bevindingen bij lichamelijk onderzoek. Interessant genoeg varieerde het belang van andere factoren, zoals medicatielijsten of specifieke meetwaarden, afhankelijk van welke dataset werd gebruikt. In de ene groep verbeterde het verwijderen van medicatiegegevens de prestaties van het model zelfs, terwijl in de andere groep het verwijderen van meetgegevens hetzelfde effect had. Dit geeft aan dat hoewel de universele taal de computer hielp om het grote plaatje te begrijpen, de specifieke details die het meest van belang zijn, nog steeds kunnen afhangen van hoe de gegevens oorspronkelijk zijn verzameld en georganiseerd.

Ondanks deze successen benadrukte de studie ook enkele praktische beperkingen. Het proces van het vertalen van de dossiers naar de standaardtaal was niet perfect; sommige informatie ging verloren omdat bepaalde lokale codes geen directe overeenkomst hadden in het universele woordenboek. Het computerprogramma had ook een beperkte woordenschat, wat betekende dat het niet elke enkele code die het in de nieuwe dataset tegenkwam, kon herkennen. Desalniettemin blijft de kernbevinding robuust: door rommelige, lokale medische dossiers om te zetten in een gestandaardiseerd formaat, kunnen onderzoekers krachtige instrumenten bouwen die werken in verschillende ziekenhuizen en regio's. Deze aanpak biedt een veelbelovend pad voor het creëren van medische voorspellingsinstrumenten die niet gebonden zijn aan één enkel systeem, waardoor inzichten uit de ene gemeenschap potentieel de patiënten in een andere kunnen ten goede komen, ongeacht de verschillen in hun lokale codering of demografische samenstelling.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →