← Nieuwste papers
💻 computer science

A Multi-Criteria Decision Framework for Aggregating Ranked ICD-10 Code Suggestions from Large Language Models

Deze studie toont aan dat het toepassen van methoden voor rangaggregatie uit de Multi-Criteria Decision Analysis, in het bijzonder Borda Count en Reciprocal Rank Fusion, om de outputs van meerdere Large Language Models te combineren, de nauwkeurigheid en stabiliteit van geautomatiseerde ICD-10 klinische codering significant verbetert in vergelijking met het gebruik van individuele modellen of eenvoudige stemprocedures.

Oorspronkelijke auteurs: Ricardo da Silva Santos, Murilo Gleysson Gazzola, Paulo Marcelino Figueira, Adriana Gomes Luz, Rodolfo de Carvalho Pacagnella, Cristiano Torezzan

Gepubliceerd 2026-08-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ricardo da Silva Santos, Murilo Gleysson Gazzola, Paulo Marcelino Figueira, Adriana Gomes Luz, Rodolfo de Carvalho Pacagnella, Cristiano Torezzan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme, rommelige puzzel op te lossen waarbij de puzzelstukjes medische diagnoses zijn. In de wereld van de gezondheidszorg moet elk patiëntenverhaal worden vertaald naar een specifieke code, zoals een geheime taal genaamd ICD-10, zodat ziekenhuizen ziekten kunnen volgen en betaald krijgen. Maar deze taal is enorm, ingewikkeld en vol met lastige regels. Onlangs hebben superintelligente computerprogramma's, Large Language Models (LLM's) genoemd, geleerd om deze codes te raden door doktersnotities te lezen. Beschouw deze modellen als een team van briljante maar licht verschillende detectives. Elke detective bekijkt hetzelfde dossier en komt met zijn eigen lijst met verdachten (de codes), gerangschikt van "meest waarschijnlijk" naar "minst waarschijnlijk". Het probleem is dat Detective A soms denkt dat Verdachte X de dader is, terwijl Detective B ervan overtuigd is dat het Verdachte Y is. Als je naar slechts één detective luistert, zit je er misschien naast. Hier komt een vakgebied genaamd Multi-Criteria Decision Analysis kijken. Het is in feite de kunst van het samenvoegen van veel verschillende meningen en het mengen ervan om het enkelvoudige beste antwoord te vinden, een beetje zoals hoe een jury getuigenissen combineert om tot een vonnis te komen. De grote vraag is: hoe meng je deze lijsten met verdachten zodat de uiteindelijke groep slimmer is dan elke individuele detective op zich?

Dit artikel pakt die exacte vraag aan door elk AI-model te behandelen als een aparte "stemmer" in een grootschalige verkiezing voor de juiste medische codes. De onderzoekers namen 1.117 echte obstetrische (zwangerschapsgerelateerde) medische notities geschreven in het Braziliaans-Portugees en vroegen vijf verschillende krachtige AI-modellen om een gerangschikte lijst van mogelijke codes voor elke notitie te genereren. In plaats van de winnaar van slechts één model te kiezen, testten ze drie verschillende manieren om alle lijsten te combineren tot één "consensus"-lijst. Ze probeerden een eenvoudige methode genaamd "Plurality Voting" (waarbij de code die het vaakst bovenaan de lijsten staat wint), een meer gedetailleerde methode genaamd "Borda Count" (waarbij een code punten krijgt op basis van hoe hoog deze op elke lijst verschijnt, niet alleen op de bovenste plek), en een methode genaamd "Reciprocal Rank Fusion" (die een flinke boost geeft aan codes die dicht bij de top staan, maar ook die lager op de lijst staan meetelt).

De resultaten waren behoorlijk duidelijk en verrassend eenvoudig in hun eenvoud. Het team kwam tot de conclusie dat het combineren van de modellen bijna altijd beter werkte dan het vertrouwen op het enkel beste model alleen. Specifiek was de "Borda Count"-methode de ster van de show. Wanneer de onderzoekers keken naar de top 3 suggesties (een aantal dat zij vonden als het ideale evenwicht tussen nauwkeurigheid en dekking), verbeterde de Borda Count-methode de algehele nauwkeurigheid met ongeveer 20% op het niveau van de brede categorie en bijna 19% op het niveau van de specifieke code in vergelijking met de beste individuele AI. Dit suggereert dat luisteren naar de "menigte" van AI-modellen, vooral door aandacht te besteden aan waar een code op ieders lijst verschijnt, een veel betrouwbaardere beslissing creëert dan het vertrouwen op een enkele expert.

De paper sluit echter ook een aantal zaken uit. Het stelde vast dat de eenvoudigste methode, Plurality Voting (alleen tellen wie er op nummer 1 staat), niet zo goed werkte als de meer genuanceerde methoden die naar de volledige rangschikking keken. Het toonde ook aan dat je niet oneindig veel suggesties aan de lijst kunt blijven toevoegen. Hoewel het toevoegen van meer codes helpt om meer ware diagnoses te vangen (recall), trekt het uiteindelijk de nauwkeurigheid omlaag omdat je te veel foutieve gokken (precision) meeneemt. De studie suggereert dat het "gouden getal" 3 is; als je daar voorbij gaat, begint de kwaliteit van de beslissing te dalen. Verder merken de auteurs op dat het simpelweg geven van meer gewicht aan de "sterkste" modellen niet veel hielp; de ongewogen, eenvoudige combinatie van alle modellen was net zo goed als de complexe gewogen varianten.

Kortom, het artikel suggereert dat de beste strategie voor klinische codering niet het vinden van het ene perfecte AI-model is, maar het laten stemmen door een aantal verschillende modellen, gebruikmakend van een systeem dat hun volledige rangschikkingen respecteert. Deze aanpak biedt een praktische, robuuste manier om medische besluitvorming te verbeteren zonder de modellen opnieuw te hoeven trainen of in hun "black boxes" te hoeven kijken. De bevindingen zijn gebaseerd op echte data en statistische testen met betrouwbaarheidsintervallen, wat aantoont dat deze methode een stabiele en effectieve manier is om de rommelige realiteit van medische codering aan te pakken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →