Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models
Diese Studie zeigt, dass leistungsstarke Open-Source-Large-Language-Models, insbesondere Llama 3.3 70B, komplexe perkutane koronarinterventionelle Prozeduren präzise und automatisch identifizieren sowie Schlüsselvariablen aus Freitext-Berichten der Herzkatheteruntersuchung extrahieren können, was eine skalierbare Alternative zur arbeitsintensiven manuellen Abstraktion für die kardiovaskuläre Forschung bietet.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Krankenhäuser generieren jeden Tag eine riesige Menge an unstrukturiertem Text. Zu den kritischsten dieser Dokumente gehören die narrativen Berichte, die nach einer Herzkatheteruntersuchung verfasst werden – einem Verfahren, bei dem Ärzte einen dünnen Schlauch durch die Arterien führen, um die Blutgefäße des Herzens zu untersuchen. Diese Berichte sind reich an Details über die Anatomie des Herzens eines Patienten und die spezifischen Techniken, die verwendet wurden, um Blockaden zu beheben, aber sie sind in freifließenden Absätzen geschrieben statt in ordentlichen Kontrollkästchen. Für Forscher und Teams zur Qualitätsverbesserung schafft dies einen erheblichen Engpass. Um zu untersuchen, wie gut diese Eingriffe funktionieren oder um die Komplexität der Fälle über ein ganzes Gesundheitssystem hinweg zu verfolgen, müssen menschliche Experten tausende dieser Berichte manuell lesen und spezifische Datenpunkte extrahieren. Dieser Prozess ist langsam, teuer und schwer skalierbar, was oft die Größe und Geschwindigkeit wichtiger medizinischer Studien einschränkt.
Der Aufstieg von Large Language Models (großen Sprachmodellen), einer Art künstlicher Intelligenz, die in der Lage ist, menschenähnlichen Text zu verstehen und zu generieren, bietet eine potenzielle Lösung für dieses Problem. Diese Systeme können darauf trainiert werden, komplexe Dokumente zu lesen und spezifische Fakten herauszuziehen, ganz ähnlich wie ein sehr schneller, unermüdlicher Forschungsassistent. Es blieb jedoch unklar, ob diese Werkzeuge die nuancierte, spezialisierte Sprache der Herzprozedurberichte bewältigen können, insbesondere wenn sie darum gebeten werden, „komplexe“ Fälle zu identifizieren, die mehrere Blockaden oder schwierige Techniken beinhalten. Ein Forscherteam setzte sich zum Ziel, diese Frage unter Verwendung einer großen Sammlung realer Herzkatheterberichte zu testen.
Die Forscher sammelten 1.412 anonymisierte Prozedurbereichte aus drei verschiedenen Krankenhäusern des Yale New Haven Health Systems. Diese Dokumente deckten Eingriffe ab, die zwischen 2011 und 2017 durchgeführt wurden, und beinhalteten eine Mischung aus diagnostischen Untersuchungen und tatsächlichen Interventionen, bei denen Ärzte Stents platzierten oder Ballons verwendeten, um blockierte Arterien zu öffnen. Um einen zuverlässigen Standard für den Vergleich zu schaffen, las eine Gruppe von Experten für Kardiologie jedes einzelne Dokument manuell. Sie stellten zunächst fest, ob ein Bericht ein Verfahren beschrieb, bei dem tatsächlich ein Stent oder ein Ballon zur Behandlung einer Koronararterie eingesetzt wurde. Für jene Fälle, in denen dies zutraf, extrahierten sie sechs spezifische Details, die eine „komplexe“ Prozedur definieren: die Anzahl der behandelten Blutgefäße, die Anzahl der verschiedenen behobenen Blockaden, die Gesamtzahl der platzierten Stents, ob eine spezifische Zwei-Stent-Technik für ein verzweigendes Gefäß verwendet wurde, die Gesamtlänge aller kombinierten Stents und ob eine chronische totale Okklusion – eine vollständige, langjährige Blockade – behandelt wurde.
Mit diesem durch Experten verifizierten „Goldstandard“ ausgestattet, testete das Team drei verschiedene Modelle der künstlichen Intelligenz, um zu sehen, ob sie die Arbeit der Experten replizieren konnten. Sie wählten Modelle aus, die Open-Source sind, was bedeutet, dass ihr Code und ihre Gewichte öffentlich verfügbar sind, was es den Forschern ermöglichte, sie auf sicheren, lokalen Computern laufen zu lassen, um die Privatsphäre der Patienten zu schützen. Ein Modell war ein massives, allgemeines System mit 70 Milliarden Parametern – ein Maß für seine Größe und seine Kapazität für logisches Denken. Die anderen beiden waren kleinere Modelle, die speziell auf medizinischer Literatur vortrainiert wurden und jeweils 7 Milliarden Parameter besaßen, konzipiert, um medizinische Terminologie zu verstehen. Die Forscher fütterten alle drei Modelle mit denselben Text-Prompts und Berichten und baten sie, zu identifizieren, ob ein Eingriff stattfand und die sechs spezifischen Variablen zu extrahieren.
Die Ergebnisse zeigten einen klaren Unterschied in der Leistungsfähigkeit. Das große, allgemeine Modell übertraf die beiden kleineren, medizin-spezialisierten Modelle signifikant. Wenn es lediglich darum ging, zu identifizieren, ob ein Bericht eine Herzprozedur beschrieb, erreichte das große Modell eine perfekte Sensitivität, was bedeutete, dass es null tatsächliche Eingriffe übersah und Nicht-Eingriffe mit hoher Genauigkeit korrekt identifizierte. Im Gegensatz dazu hatten die kleineren Modelle Schwierigkeiten; eines verwechselte häufig Notizen über Nicht-Eingriffe mit tatsächlichen Eingriffen, während das andere tatsächliche Eingriffe fast vollständig nicht erkannte.
Die Lücke vergrößerte sich, wenn die Aufgabe die Extraktion der sechs komplexen Details erforderte. Das große Modell identifizierte die Anzahl der Stents und die Gesamtlänge der Stents mit sehr hoher Genauigkeit, oft über 90 Prozent. Es war auch gut darin, die Anzahl der behandelten Gefäße zu identifizieren. Seine Leistung sank jedoch bei Variablen, die mehr Interpretation erforderten, wie etwa beim Zählen der exakten Anzahl der verschiedenen Blockaden oder der Bestimmung, ob eine spezifische Zwei-Stent-Technik für ein verzweigendes Gefäß verwendet wurde. In diesen Fällen übersah das Modell manchmal Details oder interpretierte den Kontext falsch, obwohl es dennoch weitaus genauer als die kleineren Modelle blieb. Die kleineren medizinischen Modelle konnten trotz ihres spezialisierten Trainings diese Details nicht konsistent extrahieren und lieferten oft Ergebnisse, die für die Forschung zu unzuverlässig waren.
Die Studie untersuchte auch, ob die Modelle an den drei Krankenhausstandorten unterschiedlich performten. Während das große Modell an allen drei Standorten eine hohe Genauigkeit beibehielt, gab es merkliche Variationen in der Leistung an jedem Standort, was wahrscheinlich auf die unterschiedliche Art und Weise zurückzuführen ist, wie die Ärzte an jedem Krankenhaus ihre Notizen verfassten. Die kleineren Modelle zeigten eine noch größere Inkonsistenz, wobei ihre Leistung je nach Standort stark schwankte. Dies deutet darauf hin, dass das große Modell zwar robust ist, die Art und Weise der Dokumentation die Ergebnisse jedoch dennoch beeinflussen kann.
Die Forscher analysierten die Fehler des leistungsstärksten Modells, um zu verstehen, wo es Schwierigkeiten hatte. Sie fanden heraus, dass Fehler oft auftraten, wenn die Dokumentation mehrdeutig oder fragmentiert war. Beispielsweise verwechselte das Modell manchmal einen diagnostischen Test mit einer Behandlung oder hatte Schwierigkeiten zu unterscheiden, ob ein Stent erfolgreich platziert wurde oder ob ein Versuch zur Platzierung unvollständig blieb. Es hatte auch Schwierigkeiten, wenn ein Bericht eine Blockade erwähnte, die nicht tatsächlich behandelt wurde, oder wenn die Beschreibung einer chronischen totalen Okklusion eher impliziert als explizit genannt wurde. Diese Fehler verdeutlichen, dass die Technologie zwar leistungsstark ist, aber noch nicht perfekt darin, die chaotische, inkonsistente Realität der menschlichen medizinischen Schreibweise zu navigieren.
Letztlich zeigt die Studie, dass ein großes Open-Source-Modell der künstlichen Intelligenz in der Lage ist, komplexe Daten aus unstrukturierten Herzprozedurberichten präzise zu extrahieren – eine Aufgabe, die traditionell Stunden manueller Arbeit erfordert. Die Ergebnisse legen nahe, dass diese Werkzeuge für viele Variablen, insbesondere für solche, die explizit angegeben sind wie die Anzahl der Stents, ein Genauigkeitsniveau erreichen können, das für die Forschung geeignet ist. Für Variablen, die eine tiefe kontextuelle Interpretation erfordern, steht die Technologie jedoch weiterhin vor Herausforderungen. Die Arbeit deutet darauf hin, dass die Zukunft der skalierbaren kardiovaskulären Forschung darin liegen könnte, diese leistungsstarken Modelle für die Hauptarbeit der Datenextraktion einzusetzen, potenziell kombiniert mit menschlicher Aufsicht für die schwierigsten Fälle, anstatt sich ausschließlich auf kleinere, spezialisierte Modelle oder die manuelle Überprüfung zu verlassen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.