Bridging the Version Gap: Multi-version Training Improves ICD Code Prediction, Especially for Rare Codes
Dieser Artikel zeigt, dass das Training eines modifizierten, labelweisen Aufmerksamkeitsmodells auf einer Kombination aus ICD-9- und ICD-10-Daten die Leistung bei der Vorhersage von ICD-10-Codes, insbesondere für seltene Codes, signifikant verbessert, indem es Versionslücken effektiv überbrückt und das Long-Tail-Problem mit weniger Parametern adressiert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Problem: Ein sich bewegendes Ziel und ein langer Schweif
Stellen Sie sich vor, Sie versuchen, eine riesige Bibliothek medizinischer Aufzeichnungen zu organisieren. Um dies zu tun, müssen Sie jedem Patienten ein spezifisches „Tag" (einen ICD-Code) zuweisen, das seine Krankheit beschreibt. Bei dieser Aufgabe gibt es zwei enorme Kopfschmerzen:
- Das Wörterbuch ändert sich ständig: Das offizielle Wörterbuch medizinischer Tags (genannt ICD) wird ständig aktualisiert. Manchmal passt ein Tag aus dem alten Wörterbuch (ICD-9) nicht perfekt zu einem Tag im neuen Wörterbuch (ICD-10). Es ist, als würde man versuchen, eine neue Sprache zu lernen, während Ihre alten Schulbücher noch im Regal stehen. Die meisten Computerprogramme sind darauf trainiert, nur eine „Version" der Sprache zu sprechen, daher geraten sie in Verwirrung, wenn sich die Regeln ändern.
- Das Problem des „langen Schweifs": Die meisten Patienten haben häufige Erkrankungen (wie die Grippe oder Bluthochdruck), die leicht zu taggen sind. Aber es gibt Tausende seltener Krankheiten, von denen nur eine Handvoll Menschen betroffen ist. In der Welt der Daten sind dies der „lange Schweif". Da es so wenige Beispiele für diese seltenen Krankheiten gibt, haben Computermodelle Schwierigkeiten, sie zu lernen, und ignorieren sie oft vollständig.
Die Lösung: Alte und neue Bücher mischen
Die Forscher stellten eine einfache Frage: Was wäre, wenn wir den Computer gleichzeitig mit sowohl den alten medizinischen Aufzeichnungen (ICD-9) als auch den neuen (ICD-10) unterrichten würden?
Normalerweise denken die Leute, dass das Mischen dieser beiden eine Katastrophe wäre, da die Tags nicht perfekt übereinstimmen (nur etwa 24 % der alten Tags haben eine direkte Entsprechung im neuen System). Es ist, als würde man versuchen, einem Schüler Englisch beizubringen, indem man einige französische Wörter einmischt; man würde erwarten, dass er verwirrt wird.
Doch die Forscher bauten ein spezielles Modell namens DUALLAAT und versuchten genau das. Sie fütterten es mit einem „Smoothie" aus:
- Alten Aufzeichnungen aus MIMIC-III (ICD-9)
- Neueren Aufzeichnungen aus MIMIC-IV (ICD-9)
- Neuesten Aufzeichnungen aus MIMIC-IV (ICD-10)
Was ist passiert? (Die Ergebnisse)
Die Ergebnisse waren überraschend gut und wirkten wie eine „geheime Zutat" für das Computermodell:
- Der Schub für seltene Krankheiten: Der größte Gewinn war für die seltenen Krankheiten (den „langen Schweif"). Durch das Hinzufügen alter Daten stieg die Fähigkeit des Modells, seltene ICD-10-Codes zu erkennen, um 27 %. Es ist, als enthielten die alten Aufzeichnungen versteckte Hinweise auf die Konzepte der Krankheiten, selbst wenn die spezifischen Tag-Namen unterschiedlich waren. Das Modell lernte die Bedeutung der Krankheit, nicht nur das Etikett.
- Der Schub für häufige Krankheiten: Das Modell wurde auch besser im Umgang mit häufigen Krankheiten und verbesserte seine Gesamtgenauigkeit, ohne komplexer gemacht werden zu müssen.
- Effizienz: Anstatt drei verschiedene Modelle zu benötigen (eines für jede Datensatzversion), benötigten sie nur ein Modell, um alle zu bewältigen. Dies sparte eine enorme Menge an Computerspeicher und Trainingszeit. Es ist, als hätte man einen universellen Übersetzer, anstatt für jedes Land, das man besucht, ein anderes Wörterbuch zu benötigen.
Das „Warum" (Die geheime Zutat)
Das Papier legt nahe, dass der Erfolg nicht daraus resultierte, dass die Tags perfekt übereinstimmten. Stattdessen rührte er von gemeinsamer klinischer Bedeutung her.
Stellen Sie es sich so vor: Selbst wenn das Wort für „Herzinfarkt" sich im alten Buch von „Myokardinfarkt" zu „Akuter Myokardinfarkt" im neuen Buch änderte, blieb die Beschreibung der Patientensymptome in den Notizen ähnlich. Indem es sowohl alte als auch neue Notizen las, lernte das Modell, die Geschichte der Krankheit zu erkennen, was es viel schlauer machte als ein Modell, das nur die neuen Notizen las.
Zusammenfassung
Das Papier beweist, dass man alte medizinische Daten nicht wegwerfen muss, wenn sich Systeme aktualisieren. Durch das Mischen alter und neuer Aufzeichnungen kann man ein einzelnes, schlaueres Computermodell trainieren, das besser darin ist, seltene Krankheiten zu erkennen und nicht zusammenbricht, wenn sich das Codierungssystem ändert. Es verwandelt „veraltete" Daten in ein wertvolles Trainingswerkzeug.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.