← Nieuwste papers
💻 computer science

ICD2Bert: ICD Bert Encodings for Clinical Outcome Prediction on Routine Health Insurance Data

Dit artikel introduceert ICD2BERT, een standaard BERT-model dat is voorgetraind op ICD-codes zonder domeinspecifieke aanpassingen, en demonstreert door middel van uitgebreide benchmarking dat dergelijke architecturale complexiteiten vaak niet in staat zijn om eenvoudigere baselines te overtreffen, waarbij wordt benadrukt dat datakwaliteit, schaal en voorgetraindheid kritischer zijn voor de voorspelling van klinische uitkomsten dan modelverfijning.

Oorspronkelijke auteurs: Jonas Harriehausen, Miriam Cindy Maurer, Jacqueline Michelle Metsch, Zully Ritter, Lisa Weller, Thorsten Pollmann, Matthias Kretzler, Thomas Grobe, Anne-Christin Hauschild

Gepubliceerd 2026-09-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jonas Harriehausen, Miriam Cindy Maurer, Jacqueline Michelle Metsch, Zully Ritter, Lisa Weller, Thorsten Pollmann, Matthias Kretzler, Thomas Grobe, Anne-Christin Hauschild

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Ziekenhuizen en verzekeringsmaatschappijen over de hele wereld vertrouwen op een universele taal om vast te leggen wat er mis is met een patiënt. Deze taal bestaat uit codes, korte reeksen letters en cijfers die staan voor specifieke ziekten, blessures en medische procedures. Deze codes werden oorspronkelijk gemaakt om administratie en facturatie af te handelen, maar tegenwoordig zijn ze de primaire manier waarop artsen en computers de medische geschiedenis van een patiënt begrijpen. Omdat deze gegevens zo omvangrijk en gestandaardiseerd zijn, hopen wetenschappers al lang kunstmatige intelligentie te gebruiken om verborgen patronen in deze gegevens te vinden, patronen die kunnen voorspellen wie opnieuw ziek zal worden, wie mogelijk zal overlijden, of wie een specifieke behandeling nodig heeft. Om dit te doen, bouwen wetenschappers complexe computerprogramma's die ontworpen zijn om deze codes te lezen zoals een mens een verhaal leest, waarbij ze zoeken naar context en verbanden tussen verschillende gebeurtenissen in het leven van een patiënt.

Een team onderzoekers zette zich scharpe om te testen of deze geavanceerde computerprogramma's werkelijk noodzakelijk zijn, of dat de extra complexiteit die ze toevoegen slechts een afleiding is. Ze richtten zich op een specifiek type kunstmatige intelligentie dat een transformer wordt genoemd, een krachtig hulpmiddel dat de manier waarop computers taal begrijpen heeft gerevolutioneerd. In de medische wereld hebben wetenschappers deze hulpmiddelen aangepast door extra lagen informatie toe te voegen, zoals de leeftijd van een patiënt of het aantal keren dat zij een arts hebben bezocht, in de hoop dat deze details de computer zouden helpen betere voorspellingen te doen. De onderzoekers wilden weten of deze aangepaste toevoegingen de resultaten werkelijk verbeterden, of dat een simpelere, standaardversie van het hulpmiddel hetzelfde werk even goed kon doen. Ze wilden ook zien of deze geavanceerde systemen konden leren van één groep patiënten en die kennis konden toepassen op een volledig andere groep, bijvoorbeeld uit een ander land of een ander zorgsysteem.

Om deze vragen te beantwoorden, bouwde het team een nieuwe, standaardversie van het computerprogramma dat alleen de medische codes leest, zonder de extra informatie over leeftijd of bezoeken die andere onderzoekers hadden toegevoegd. Ze noemden dit nieuwe model ICD2BERT. Vervolgens onderwierpen ze dit model aan een test tegenover verschillende andere populaire, complexere modellen met behulp van drie zeer verschillende sets medische gegevens. Eén set kwam van een groot ziekenhuis in de Verenigde Staten en bevatte gegevens van zowel oudere als nieuwere coderingssystemen. Een andere set bestond uit een kleine groep patiënten met zeer gedetailleerde geschiedenissen, ontworpen om te testen hoe goed een model kan leren van zeer weinig gegevens. De derde set was enorm en bevatte miljoenen records van routinematige verzekeringsclaims in Duitsland, die een grote en diverse populatie besloeg.

De resultaten waren verrassend. Toen de onderzoekers het standaardmodel vergeleken met de complexe, aangepaste modellen, ontdekten ze dat de extra functies de computer niet slimmer maakten. Het model dat simpelweg de codes las, presteerde net zo goed als de modellen die ook de leeftijd of de bezoekgeschiedenis van de patiënt kenden. Sterker nog, de onderzoekers ontdekten dat de kwaliteit en de omvang van de gegevens waarvan het model leerde, veel belangrijker waren dan de complexiteit van het computerprogramma zelf. Nog onverwachtter was dat een zeer eenvoudige methode, die de codes behandelde als een lijst met categorieën zonder te proberen de volgorde of de context van de gebeurtenissen te begrijpen, vaak net zo goed presteerde als de meest geavanceerde kunstmatige intelligentie. Deze eenvoudige benadering was in veel gevallen in staat om toekomstige ziekten, sterfte en heropnames in het ziekenhuis met een nauwkeurigheid te voorspellen die overeenkwam met de complexe systemen.

De studie onthulde ook dat het specifieke type medische code cruciaal is. In de Amerikaanse ziekenhuisgegevens bevatte het oudere coderingssysteem nog steeds vitale informatie die het nieuwere systeem niet volledig verving; toen de onderzoekers de oudere codes verwijderden, daalde de prestatie van de computer aanzienlijk. Echter, in de Duitse verzekeringsgegevens, die alleen de nieuwere codes gebruikten, worstelde de computer als de codes werden ingekort tot hun meest basale categorieën, wat suggereert dat de fijne details in die specifieke dossiers essentieel waren. De onderzoekers ontdekten ook dat de complexe modellen konden leren van de Amerikaanse gegevens en deze konden toepassen op de Duitse gegevens, maar het omgekeerde was niet waar. Een model dat alleen op de Duitse gegevens was getraind, faalde wanneer het werd gevraagd naar de Amerikaanse gegevens, waarschijnlijk omdat het het oudere coderingssysteem nooit had gezien. Dit suggereert dat voor een computer om echt nuttig te zijn binnen verschillende zorgsystemen, deze getraind moet worden op de breedst mogelijke variëteit aan gegevens.

Ten slotte keken het team naar hoe gemakkelijk het was om te begrijpen waarom deze modellen de beslissingen namen die ze namen. Omdat hun standaardmodel geen extra, op maat gemaakte lagen had, kon het worden geanalyseerd met bestaande hulpmiddelen die precies laten zien welke medische codes een voorspelling beïnvloedden. Ze ontdekten dat specifieke codes voor aandoeningen zoals diabetes en hoge bloeddruk de sterkste drijfveren waren voor het voorspellen van sterfte of heropname in het ziekenhuis. Deze transparantie is cruciaal voor artsen die de adviezen van de computer moeten kunnen vertrouwen. De studie suggereert dat ziekenhuizen, voordat ze investeren in het bouwen en trainen van enorme, complexe systemen voor kunstmatige intelligentie, zorgvuldig moeten overwegen of een eenvoudigere, meer transparante benadering niet net zo effectief kan zijn. De bevindingen wijzen erop dat de kracht om klinische uitkomsten te voorspellen minder ligt in het ingewikkelde ontwerp van het computerprogramma en meer in de rijkdom en breedte van de medische dossiers die het mag lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →