← Neueste Arbeiten
💻 computer science

Evaluating Clinical Symptom Extraction and Reasoning in Local Large Language Models: A Proof-of-Concept Study of Symptom-Specific Performance in Cardiology

Diese Proof-of-Concept-Studie evaluiert lokal bereitgestellte große Sprachmodelle (Gemma3 und Qwen3.5) bei japanischen kardiologischen Entlassungsberichten und zeigt auf, dass die Genauigkeit der allgemeinen Symptomextraktion zwar hoch ist, die Leistung jedoch je nach spezifischem Symptom variiert und die Modelle häufig Zustände wie Palpitationen oder Erschöpfbarkeit aus objektiven klinischen Befunden anstatt aus expliziten Patientenbeschwerden ableiten.

Ursprüngliche Autoren: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

Veröffentlicht 2026-09-17
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Krankenhäuser generieren jeden Tag riesige Mengen an schriftlichen Aufzeichnungen, von der ersten Beschreibung der Schmerzen eines Patienten bis hin zu den abschließenden Notizen über seine Genesung. Viel dieser Informationen ist in fließenden Textabsätzen eingeschlossen, was es schwierig macht, sie schnell zu sortieren, zu durchsuchen oder zu analysieren. Jahrzehntelang haben sich Ärzte und Forscher darauf verlassen, diese Notizen manuell zu lesen und spezifische Details herauszuziehen – ein langsamer und mühsamer Prozess, der anfällig für menschliche Fehler ist. Kürzlich ist ein neuer Typ von Computerprogrammen bekannt geworden, das sogenannte Large Language Model, das eine potenzielle Lösung darstellt. Diese Systeme werden mit enormen Textbibliotheken trainiert und können die menschliche Sprache gut genug verstehen, um eine medizinische Notiz zu lesen und spezifische Fakten zu identifizieren, wie etwa, ob ein Patient angegeben hat, unter Kurzatmigkeit zu leiden oder Brustschmerzen zu verspüren. Da diese Werkzeuge vollständig innerhalb der eigenen sicheren Computer eines Krankenhauses arbeiten können, ohne private Daten an die Außenwelt zu senden, bieten sie einen vielversprechenden Weg, um unordentliche handschriftliche oder getippte Notizen in saubere, organisierte Daten zu verwandeln, die zur Verbesserung der Patientenversorgung genutzt werden können.

Ein Forscherteam der Universität Tokio machte sich daran zu testen, wie gut zwei dieser lokalen Computerprogramme diese Aufgabe im spezifischen und hochsensiblen Bereich der Herzinsuffizienz bewältigen können. Sie konzentrierten sich auf Patienten mit fortgeschrittener Herzinsuffizienz, die für eine Herztransplantation evaluiert wurden – eine Gruppe, deren Symptome komplex und vielfältig sind. Die Forscher wählten zehn reale Patientenakten aus ihrem eigenen Krankenhaus aus, die den Zeitraum zwischen 2017 und 2023 abdecken. Diese Akten waren in japanischer Sprache verfasst und enthielten die vollständige Geschichte jedes Patientenaufenthalts, einschließlich dessen, worüber die Patienten klagten, was die Ärzte bei Untersuchungen feststellten und wie sich ihr Zustand im Laufe der Zeit veränderte. Das Team bat die Computerprogramme, diese zehn Geschichten zu analysieren und das Vorhandensein oder Fehlen von acht spezifischen Symptomen zu identifizieren, die für die Aufnahme in die Transplantationsliste erforderlich sind, wie etwa Herzklopfen, extreme Müdigkeit und Ohnmacht. Um sicherzustellen, dass die Antworten des Computers korrekt waren, überprüften fünf Herzspezialisten unabhängig dieselben zehn Geschichten und vereinbarten eine „Ground Truth“ (einen Grundwahrheitswert) für jedes Symptom, wodurch einen zuverlässigen Standard zur Messung der Maschinen schufen.

Die Forscher testeten die Computerprogramme unter verschiedenen Sätzen von Anweisungen, um zu sehen, wie die Formulierung der Anfrage die Ergebnisse veränderte. In einem Szenario wurden die Programme angewiesen, die gesamte Krankengeschichte nach jeglicher Erwähnung der Symptome zu scannen. In einem anderen wurden sie explizit angewiesen, alle Symptome zu ignorieren, die möglicherweise in der Vorgeschichte des Patienten erwähnt wurden, und sich stattdessen nur auf das zu konzentrieren, was während dieses spezifischen Krankenhausaufenthalts geschah. Sie testeten auch, ob das Anweisen der Programme, „laut zu denken“ und ihre Argumentation zu erklären, bevor sie eine Antwort geben, ihre Genauigkeit verbessern würde. Die Studie ergab, dass beide Computerprogramme im Allgemeinen recht gut bei dieser Aufgabe waren und das Vorhandensein oder Fehlen von Symptomen in den meisten Fällen korrekt identifizierten. Die Leistung war jedoch nicht perfekt, und die Fehler traten nicht zufällig auf. Die Programme hatten am meisten mit zwei spezifischen Symptomen zu kämpfen: Herzklopfen (Palpitationen), also das Gefühl eines rasenden oder pochenden Herzens, und Erschöpfbarkeit (Fatigabilität), oder ein überwältigendes Gefühl der Müdigkeit.

Als die Forscher die Fehler untersuchten, die die Computer machten, entdeckten sie ein klares Muster in der Art und Weise, wie die Maschinen dachten. Beim Symptom Herzklopfen entschieden die Programme oft, dass ein Patient dieses erlebe, einfach weil die Krankenakte einen abnormalen Herzrhythmus oder eine schnelle Herzfrequenz zeigte, selbst wenn der Patient nie tatsächlich geschrieben oder gesagt hatte, dass er ein Rasen oder Pochen im Herzen spüre. Der Computer schlussfolgerte das Symptom aus den objektiven medizinischen Daten statt aus einer direkten Patientenbeschwerde. Ähnlich verhielt es sich bei der Erschöpfbarkeit: Die Programme kamen häufig zu dem Schluss, dass ein Patient müde sei, weil der Patient an Herzinsuffizienz litt – einer Erkrankung, die bekanntermaßen zu Müdigkeit führt – selbst wenn die spezifische Notiz die Erschöpfung überhaupt nicht erwähnte. Der Computer füllte die Lücken mit medizinischer Logik statt sich strikt an den Text zu halten. Diese Tendenz war so stark, dass die Computer in einigen Fällen korrekt identifizierten, dass ein Patient einen unregelmäßigen Herzschlag hatte, aber dennoch fälschlicherweise behaupteten, der Patient verspüre Herzklopfen, während sie in anderen Fällen mit denselben medizinischen Befunden korrekt angaben, dass der Patient dies nicht verspüre, was eine Inkonsistenz in ihrer Argumentation zeigte.

Die Studie zeigte auch, dass die Art und Weise, wie die Anweisungen formuliert waren, eine signifikante Rolle spielte. Als die Forscher einem der Programme sagten, die medizinische Vorgeschichte zu ignorieren und sich nur auf den aktuellen Krankenhausaufenthalt zu konzentrieren, wurde das Programm viel vorsichtiger beim Auffinden von Symptomen, übersah aber auch viele, die tatsächlich vorhanden waren. Es wurde so streng dabei, alles zu ignorieren, was nicht explizit im aktuellen Kontext geschrieben stand, dass es Symptome nicht erfasste, die eindeutig Teil des aktuellen Zustands des Patienten waren. Dies deutet darauf darauf hin, dass diese Computerprogramme zwar mächtige Werkzeuge sind, aber nicht einfach Wörter wie ein Mensch lesen; sie interpretieren den Text basierend auf medizinischen Assoziationen und Mustern, die sie gelernt haben. Sie können schlussfolgern, dass ein Symptom existiert, basierend auf anderen Fakten, was hilfreich sein kann, aber auch zu Fehlern führt, wenn diese Schlussfolgerung falsch ist. Die Forscher merkten an, dass diese Ergebnisse auf einer geringen Anzahl von Fällen basieren und dass die Programme je nach spezifischen Anweisungen unterschiedlich reagierten, was darauf hindeutet, dass sich die Technologie noch in der Entwicklung befindet.

Letztendlich zeigt diese Arbeit, dass lokale Computerprogramme zwar die Extraktion medizinischer Informationen automatisieren können, aber noch nicht das sorgfältige Urteilsvermögen eines menschlichen Lesers ersetzen. Die Maschinen sind in der Lage, den Kontext einer medizinischen Notiz zu verstehen, aber manchmal lässt ihr Wissen darüber, wie Krankheiten funktionieren, die tatsächliche Beschreibung auf der Seite außer Kraft setzen. Damit diese Werkzeuge in einem Krankenhausumfeld wirklich nützlich sein können, müssen Entwickler genau verstehen, wie die Programme durch eine Diagnose argumentieren und wie sie angewiesen werden können, sich auf explizite Patientenbeschwerden zu verlassen, anstatt auf medizinische Annahmen. Die Studie dient als Proof of Concept (Nachweis der Machbarkeit) und zeigt, dass diese Systeme innerhalb des sicheren Netzwerks eines Krankenhauses arbeiten und komplexe medizinische Texte verarbeiten können, hebt aber auch die Notwendigkeit einer sorgfältigen Aufsicht hervor, um sicherzustellen, dass die automatisierte Extraktion von Symptomen genau und zuverlässig bleibt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →