← Neueste Arbeiten
📄 otolaryngology

Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals

Diese Studie zeigt, dass aktuelle große Sprachmodelle keine Interrater-Reliabilität erreichen, die mit der von medizinischem Fachpersonal vergleichbar ist, wenn sie strukturierte klinische Informationen aus HNO-elektronischen Patientenakten extrahieren, was darauf hindeutet, dass sie am besten für die initiale Datenextraktion geeignet sind, die eine menschliche Verifizierung erfordert, anstatt für den autonomen klinischen Einsatz.

Ursprüngliche Autoren: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.
Veröffentlicht 2026-08-24
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Krankenhäuser generieren heute einen riesigen Ozean an schriftlichen Aufzeichnungen. Jeder Patientenbesuch, jedes Testergebnis und jede Behandlungsentscheidung wird in digitalen Notizen festgehalten, die als elektronische Gesundheitsakten bekannt sind. Diese Dokumente sind reich an Details und enthalten die spezifische Sprache, die Ärzte verwenden, um Symptome zu beschreiben, Diagnosen zu stellen und die Versorgung zu planen. Jahrzehntelang war es eine schwierige Aufgabe, diese unstrukturierten Erzählungen in organisierte, durchsuchbare Daten umzuwandeln, was oft erforderte, dass Menschen die Informationen lasen und von Hand neu schrieben. Vor kurzem ist ein neuer Typ von Computerprogramm namens Large Language Model (großes Sprachmodell) entstanden. Diese Systeme wurden mit massiven Mengen an Text trainiert und können die menschliche Sprache mit überraschender Flüssigkeit lesen, verstehen und zusammenfassen. Sie haben gezeigt, dass sie medizinische Fragen beantworten und Zulassungsprüfungen bestehen können, was viele zu der Frage führt, ob sie auch Patientendaten lesen und die darin enthaltenen lebenswichtigen Fakten automatisch extrahieren können.

Bei dieser Frage geht es nicht nur um Zeitersparnis; es geht um Sicherheit und Genauigkeit. Wenn ein Computer Ärzten dabei helfen soll, die Patientenversorgung zu steuern, muss er die richtigen Informationen finden, ohne Dinge zu erfinden oder kritische Details zu übersehen. Eine neue Studie setzte sich zum Ziel, diese Fähigkeit direkt zu testen. Forscher sammelten fast hundert echte Patientenakten aus Hals-Nasen-Ohren-Kliniken und baten sowohl menschliche Ärzte als auch sieben verschiedene Large Language Models, diese zu lesen. Die Aufgabe bestand darin, spezifische Fakten zu extrahieren, wie etwa das Alter des Patienten, seine Symptome, seine Diagnose und die Behandlungen, die er erhalten hat. Um sicherzustellen, dass alle dieselbe Sprache sprachen, verlangten die Forscher, dass jede Information in einen weltweit in Krankenhäusern verwendeten Standardcode übersetzt wurde. Dies ermöglichte einen präzisen Vergleich dessen, wie gut die Maschinen im Vergleich zu den Menschen abschnitten.

Die Ergebnisse zeigten eine deutliche Lücke zwischen menschlicher Expertise und aktueller künstlicher Intelligenz. Als die vierzehn Ärzte der Studie dieselben Akten lasen, stimmten sie in Bezug auf die extrahierten Informationen in 81 Prozent der Fälle überein. Diese hohe Übereinstimmung zeigte, dass die Ärzte die Notizen konsistent interpretierten. Wenn die Computermodelle jedoch mit den Ärzten verglichen wurden, sank die Übereinstimmung signifikant auf etwa 66 Prozent. Mit anderen Worten: Die Maschinen waren noch nicht so zuverlässig wie die Menschen darin, dieselben Fakten aus demselben Text zu identifizieren. Die Studie testete Modelle unterschiedlicher Größe, von massiven Systemen mit Hunderten von Milliarden Verbindungen bis hin zu kleineren Modellen, die auf lokalen Computern laufen können. Keines von ihnen erreichte das Niveau der Konsistenz, das die medizinischen Fachkräfte zeigten.

Die Leistung variierte je nach der Art der extrahierten Informationen. Die Modelle waren recht gut darin, Behandlungen und Testergebnisse zu finden, die oft auf klare, standardisierte Weise dokumentiert sind. Weniger erfolgreich waren sie bei Anzeichen und Diagnosen, die oft ein tieferes Verständnis des klinischen Kontextes erfordern. Interessanterweise fanden die Computer mehr Informationen als die Ärzte, insbesondere im Hinbereich der Risikofaktoren. Während Ärzte sich oft auf das unmittelbare Problem konzentrieren, schienen die Modelle jeden im Text erwähnten möglichen Risikofaktor zu markieren. Dies deutet darauf hin, dass die Maschinen nicht nur menschliches Verhalten kopieren, sondern den Text anders verarbeiten – sie erfassen manchmal Details, die ein Mensch übersehen könnte, markieren aber auch potenziell Dinge, die klinisch nicht relevant sind.

Trotz dieser Unterschiede zeigten die Maschinen, dass sie nützliche Werkzeuge sein könnten, wenn sie korrekt eingesetzt werden. Die Studie ergab, dass die Modelle, wenn sie eine Information identifizierten, meist richtig lagen, mit einer Präzisionsrate von 97 Prozent. Das bedeutet, dass sie selten Fakten erfanden, die nicht vorhanden waren. Sie übersahen jedoch etwa 15 Prozent der Informationen. Dieses Muster deutet auf eine spezifische Rolle für diese Werkzeuge in der Zukunft hin: Sie eignen sich am besten als erste Instanz, um Akten schnell zu scannen und wahrscheinliche Kandidaten für die Überprüfung durch den Arzt herauszufiltern. Die endgültige Entscheidung und Verifizierung müsste weiterhin durch einen Menschen erfolgen. Die Forscher kamen zu dem Schluss, dass diese Modelle zwar leistungsstark sind, aber noch nicht bereit sind, allein in einem klinischen Umfeld zu arbeiten. Sie sollten am besten als Assistenten betrachtet werden, die helfen können, die Flut an medizinischen Daten zu organisieren, vorausgesetzt, ein menschlicher Experte ist immer da, um ihre Arbeit zu überprüfen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →