Automated ICD Classification of Psychiatric Diagnoses: From Classical NLP to Large Language Models
Deze studie toont aan dat fijn afgestemde Large Language Models, met name e5_large, klassieke NLP-methoden aanzienlijk overtreffen bij het automatiseren van het toewijzen van vrije tekstbeschrijvingen uit de Spaanse psychiatrie aan ICD-codes, met een micro-gemiddelde F1-score van 0,866 op een dataset van meer dan 145.000 records.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een drukke ziekenhuis voor waar artsen dagelijks duizenden notities schrijven over de mentale gezondheid van patiënten. Deze notities zijn geschreven in vrij vloeiende taal—zoals "leeg voelen", "kan niet slapen" of "bezorgd over alles". Om de dossiers en statistieken van het ziekenhuis te beheren, moeten deze notities worden vertaald naar een strikte, gestandaardiseerde code (zoals een streepjescode) die een ICD-code wordt genoemd.
Op dit moment doen mensen deze vertaling. Het is traag, vermoeiend en vatbaar voor fouten. Dit artikel gaat over het bouwen van een slimme robot die die rommelige notities kan lezen en automatisch de juiste streepjescode kan toewijzen.
Hier is hoe de onderzoekers probeerden deze robot te bouwen, uitgelegd via eenvoudige analogieën:
1. De Uitdaging: Het "Long Tail"-Probleem
De onderzoekers hadden een enorme bibliotheek met 145.000 Spaanse psychiatrische notities. Ze wilden een computer leren deze te sorteren in 85 verschillende categorieën (zoals "Angst", "Depressie", enzovoort).
Echter, de data was onbalans. Stel je een snoepjespot voor waarin 80% van de snoepjes rood is (veelvoorkomende diagnoses), maar er slechts een paar blauwe, groene en paarse zijn (zeldzame diagnoses). Dit wordt een "long-tail"-verdeling genoemd. De meeste sorteerrubots worden erg goed in het vinden van de rode snoepjes, maar missen de zeldzame, kleurrijke er helemaal.
2. De Wedstrijd: Oude School versus Nieuwe Techniek
De onderzoekers organiseerden een wedstrijd tussen verschillende soorten "hersenen" om te zien welke de notities het beste kon sorteren.
Het Oude School Team (BoW & TF-IDF):
Denk aan deze robots als sleutelwoordmatchers. Ze scannen een notitie en zeggen: "Ik zie het woord 'verdrietig', dus ik geef het de code 'Depressie'." Ze zijn snel maar letterlijk. Als een arts schrijft "het gevoel van een zwaar gewicht op mijn borst" in plaats van "verdrietig", raken deze robots misschien in de war.- Resultaat: Ze waren oké, maar misten de nuance.
Het Midden (LSA, LDA, Doc2Vec):
Deze zijn als onderwerpgeraden. Ze proberen woorden die vaak samen voorkomen te groeperen om het algemene thema te achterhalen.- Resultaat: Ze hadden moeite. Ze konden de specifieke medische jargon die in Spaanse psychiatrische notities wordt gebruikt, niet helemaal bevatten.
De Supersterren (Grote Taalmodellen - LLM's):
Dit zijn de contextbegrijpers. Stel je een robot voor die miljoenen boeken heeft gelezen en begrijpt dat "leeg voelen" en "verlies van motivatie" eigenlijk synoniemen zijn voor depressie, zelfs als het woord "depressie" niet voorkomt. Ze begrijpen de sfeer en het verhaal, niet alleen de sleutelwoorden.- Resultaat: Deze modellen, specifiek één genaamd e5 large, wonnen de wedstrijd met gemak.
3. De Winnende Strategie: Fine-Tuning
De onderzoekers kochten niet zomaar een kant-en-klare "Superster"-robot en hoopten dat het zou werken. Ze realiseerden zich dat een algemene robot de specifieke regels van een Spaans ziekenhuis niet kent.
Dus gebruikten ze een techniek genaamd Fine-Tuning.
- De Analogie: Stel je voor dat je een briljante universiteitsafgestudeerde (het vooraf getrainde AI-model) een specifieke stage geeft in het ziekenhuis. Je laat ze duizenden voorbeelden zien van hoe dit specifieke ziekenhuis zijn notities schrijft.
- Het Resultaat: De robot leerde de specifieke "dialect" van de artsen. Het ging van het begrijpen van taal naar het begrijpen van medische taal. Deze aanpak behaalde de hoogste score: 0,866 (een zeer hoge nauwkeurigheidsgraad).
4. Het Samenwerken: Het Brein en de Spier
Het artikel vond ook dat het "Brein" (de AI die de tekst leest) en de "Spier" (het systeem dat de uiteindelijke beslissing neemt) op verschillende manieren moeten samenwerken, afhankelijk van de data:
- Voor de Slimme, Contextuele AI (LLM's): De beste "spier" was XGBoost. Denk aan XGBoost als een gedisciplineerde, regels-gevolgende manager die uitstekend is in het organiseren van complexe informatie zonder overweldigd te raken.
- Voor de Oude School Sleutelwoord-AI: De beste "spier" was een MLP (een type neurale netwerk). Denk hierbij aan een flexibele, creatieve kunstenaar die goed is in het spotten van patronen in rommelige, verspreide data.
5. De Realiteitscheck: De Zeldzame Gevallen
Zelfs met de beste robot was er een addertje onder het gras.
- Het Probleem: Voor de zeer zeldzame diagnoses (de "blauwe en groene snoepjes") had de robot nog steeds moeite. Sommige zeldzame aandoeningen hadden zo weinig voorbeelden in de trainingsdata dat de robot ze helemaal niet kon leren.
- De Les: Het artikel geeft toe dat semantische rijkdom alleen niet genoeg is. Als de robot een specifieke zeldzame ziekte nog nooit heeft gezien, helpt geen enkele hoeveelheid "taalbegrip" om het correct te raden. Het heeft meer data nodig.
Samenvatting
Het artikel bewijst dat je voor het automatiseren van psychiatrische codering niet zomaar een eenvoudige sleutelwoordzoektocht kunt gebruiken. Je hebt moderne AI nodig die context begrijpt, en je moet deze specifiek trainen op ziekenhuisnotities (fine-tuning).
Hoewel dit nieuwe systeem veel beter is dan de oude methoden en de veelvoorkomende gevallen briljant aankan, staat het nog steeds voor een hindernis bij de zeldzaamste aandoeningen, simpelweg omdat er niet genoeg data is om de robot te leren hoe die zeldzame aandoeningen eruitzien.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.