← Nieuwste papers
💬 NLP

Decomposing Error and Style in Automated Clinical Coding

Dit artikel betoogt dat een groot deel van de prestatiekloof in automatische klinische codering die aan modelfouten wordt toegeschreven, feitelijk voortkomt uit niet-gemodelleerde, systematische codatiestijlen, waarbij wordt aangetoond dat het expliciet conditioneren van modellen op een coder-specifieke stijlrubriek de nauwkeurigheid aanzienlijk verbetert en discrepanties tussen verschillende evaluatiemethoden oplost.

Oorspronkelijke auteurs: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

Gepubliceerd 2026-09-22✓ Author reviewed ⓘ
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Elke keer dat een patiënt een dokterspraktijk of een ziekenhuis verlaat, begint een cruciaal stuk administratief werk. Een medisch codeerder moet de klinische aantekeningen die door de arts zijn geschreven lezen en deze vertalen naar een gestandaardiseerde set alfanumerieke codes. Deze codes vertellen verzekeringsmaatschappijen en overheidsinstanties precies wat er mis was met de patiënt en wat er is gedaan om de patiënt te behandelen, wat bepaalt hoeveel de zorgverlener wordt betaald. Decennialang heeft het vakgebied van geautomatiseerde codering deze taak behandeld als een simpel spel van overeenkomsten: een computerprogramma leest de aantekening, en als de lijst met codes niet perfect overeenkomt met één enkele "gouden standaard"-lijst die door een menselijke expert is gemaakt, wordt de computer als foutief gemarkeerd. Deze benadering gaat ervan uit dat als twee experts dezelfde aantekening lezen en dezelfde regels volgen, ze exact dezelfde lijst met codes zullen produceren.

Echter, in de echte wereld van de geneeskunde houdt deze aanname geen stand. Zelfs hoogopgeleide menselijke experts, die naar exact dezelfde patiëntendossiers kijken en dezelfde officiële richtlijnen gebruiken, produceren vaak verschillende lijsten met codes. Ze kunnen het oneens zijn over het wel of niet opnemen van een minder belangrijke aandoening, hoe specifiek men moet zijn over een diagnose, of of er administratieve codes moeten worden toegevoegd voor diensten die wel besproken maar niet uitgevoerd zijn. Lange tijd geloofden onderzoekers dat deze onenigheid simpelweg menselijke fouten waren—een rommelige, onvermijdelijke kostenpost van een enorm systeem met tienduizenden mogelijke codes. Maar een nieuwe studie suggereert dat wat op fouten lijkt, eigenlijk iets heel anders is: een systematisch verschil in stijl. Net zoals twee schrijvers dezelfde gebeurtenis met verschillende niveaus van detail of focus kunnen beschrijven, passen twee codeurs verschillende interne beleidsregels toe over wat het waard is om vastgelegd te worden en hoeveel bewijs nodig is om een code te rechtvaardigen.

Een team van onderzoekers bij Amazon zette zich in om dit gat te onderzoeken, met de vraag of de onenigheid tussen codeerders willekeurige ruis was of een voorspelbaar patroon dat zij konden meten en gebruiken. Ze begonnen door te kijken naar een publieke dataset van 110 patiëntenbezoeken die door twee onafhankelijke teams waren gecodeerd. Ondanks het werken vanuit identieke aantekeningen, kwamen deze twee teams slechts op 73 procent van de codes overeen. Wanneer de onderzoekers een derde, onafhankelijke groep klinische auditors vroegen om de aantekeningen te beoordelen en alle codes die duidelijk onterecht waren te verwijderen, steeg de overeenstemming slechts licht naar 77 procent. Dit betekende dat zelfs na het verwijderen van de overduidelijke fouten, een kwart van de codes nog steeds verschilde tussen de experts. De onderzoekers stelden de hypothese op dat deze resterende kloof niet een gebrek aan kennis was, maar een verschil in "codestijl"—een specifieke set voorkeuren die elke codeerder of medische instelling hanteert met betrekking tot hoe agressief er gecodeerd wordt, hoe specifiek men is, en hoeveel documentatie vereist is om een code te rechtvaardigen.

Om dit idee te testen, bouwden de onderzoekers een systeem dat deze stijl kon meten. Ze creëerden een eenvoudige rubric, of checklist, met tien verschillende dimensies. Sommige dimensies stelden vragen zoals: "Lijst de codeerder alleen de hoofdklacht op, of worden alle genoemde problemen vermeld?" Anderen vroegen: "Concludeert de codeerder een aandoening op basis van een genoemd medicijn, of wacht hij tot de arts de diagnose expliciet vermeldt?" Met behulp van een groot taalmodel analyseerden ze honderden patiëntendossiers en de bijbehorende codelijsten om elke dataset op deze tien dimensies te scoren. Dit proces creëerde een "stijlprofiel" voor elke groep codeerders, wat in feite hun collectieve gewoonten samenvatte in een reeks getallen die hun aanpak beschreven.

De doorbraak kwam toen de onderzoekers deze stijlprofielen gebruikten om de computermodellen te sturen. In plaats van de computer alleen te vragen om "deze aantekening te coderen", voegden ze een specifieke instructieblok toe dat de stijl beschreef van de codeerder die ze probeerden na te bootsen. Als de doelstijl bijvoorbeeld "agressief" was, kreeg de computer de instructie om elke mogelijke aandoening die in de tekst wordt genoemd op te sommen. Als de stijl "conservatief" was, kreeg de computer de instructie om alleen te vermelden wat expliciet bevestigd is. De resultaten waren opmerkelijk. Wanneer de computer een stijlprofiel kreeg dat overeenkwam met de data die het probeerde te coderen, steeg de nauwkeurigheid spectaculair. Op verschillende datasets verbeterde de prestatie van de computer met wel 26 punten op een standaard scoreschaal. Omgekeerd, wanneer de computer een stijlprofiel kreeg dat botste met de data—het de opdracht gaf om een conservatieve codeerder agressief te laten zijn, of vice versa—daalde de prestatie met wel 21 punten.

Dit bevinding suggereert dat veel van wat voorheen werd toegeschreven aan het onvermogen van de computer om de geneeskunde te begrijpen, eigenlijk het onvermogen van de computer was om de gewoonten van de codeerder te begrijpen. De onderzoekers testten dit over vijf verschillende datasets, inclusief poliklinische bezoeken en klinische ziekenhuisgegevens, en ontdekten dat het effect standhield voor bijna elke methode die ze probeerden. Of ze nu een basisprompt gebruikten of een complexe, meerstaps pijplijn, het toevoegen van het juiste stijlprofiel verbeterde de resultaten consistent. Sterker nog, een eenvoudig, ongetraind computermodel dat werd gestuurd door de juiste stijlinstructies, presteerde net zo goed als een hoogwaardig, vooraf getraind model zonder dergelijke begeleiding. Dit impliceert dat de computer de medische regels al kent; hij moet alleen weten welke versie van de regels hij in een specifieke context moet toepassen.

De studie onthulde ook dat deze "stijl" een eigenschap is van de gegevensbron, en niet slechts willekeurige ruis. Wanneer de onderzoekers de stijlprofielen van verschillende ziekenhuizen en coderingsteams visualiseerden, zagen ze dat de profielen samen klonterden op basis van de bron. Een ziekenhuis dat de neiging had om zeer specifiek te zijn over diagnoses, had een duidelijk profiel dat verschilde van een ziekenhuis dat de voorkeur gaf aan bredere, minder specifieke codes. Deze clustering bevestigde dat stijl een reëel, meetbaar kenmerk is van hoe een medische instelling opereert. De onderzoekers merkten echter ook op dat hun tienpuntenlijst geen perfecte kaart van het volledige landschap was. In één specifiek geval waarbij twee teams het oneens waren over 27 procent van hun codes, kon de checklist het verschil niet volledig verklaren, wat suggereert dat er nog verborgen dimensies van stijl zijn die hun huidige instrumenten niet kunnen waarnemen. Bovendien werkte de aanpak minder goed voor klinische ziekenhuisgegevens, waar het enorme volume aan codes per patiënt de eenvoudige schaal die zij hadden ontworpen, overbelastte.

Uiteindelijk herkadert dit werk hoe we moeten denken over geautomatiseerde medische codering. Het suggereert dat het doel niet moet zijn om elke computer te dwingen om overeen te komen met één enkele, rigide "gouden standaard"-lijst, maar om te erkennen dat verschillende medische omgevingen legitieme, systematische verschillen hebben in hoe zij de zorg documenteren. Door deze stijlen te meten en aan te passen, kunnen computers veel nauwkeuriger worden. De onderzoekers concluderen dat de kloof tussen menselijke en machinale prestaties niet alleen een kwestie is van intelligentie of training, maar van afstemming. Als we de machine kunnen leren dezelfde "taal" van documentatie te spreken als de menselijke codeerder, kunnen we een aanzienlijk deel van de nauwkeurigheid terugwinnen die voorheen als verloren werd beschouwd als een fout. Dit betekent niet dat de computer gokt; het betekent dat de computer eindelijk naar de juiste instructies luistert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →