← Neueste Arbeiten
💻 computer science

Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports

Diese Studie bewertet Vision-Language-Modelle für die Extraktion strukturierter Daten aus heterogenen, mehrseitigen Laborberichten und stellt fest, dass die Verarbeitung des gesamten Dokuments zwar eine überlegene Geschwindigkeit bietet, ein seitenweise angewandter Workflow unter Verwendung von Qwen2.5-VL jedoch die höchste Genauigkeit und Stabilität über variierende Dokumentenlängen hinweg erreicht.

Ursprüngliche Autoren: Ashish Katyal, Ashwani Bhatnagar

Veröffentlicht 2026-09-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ashish Katyal, Ashwani Bhatnagar

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Krankenhäuser generieren jeden Tag eine riesige Menge an Papier- und digitalen Aufzeichnungen, von den narrativen Notizen, die Ärzte schreiben, bis hin zu den dichten, tabellarischen Ergebnissen von Laboruntersuchungen. Damit Computer Ärzten helfen können, bessere Entscheidungen zu treffen, oder um Forschern dabei zu helfen, Muster bei Krankheiten zu finden, müssen diese Informationen von Bildern und Texten in saubere, organisierte Daten umgewandelt werden, die Maschinen lesen können. Dieser Prozess, bekannt als Informationsextraktion, war lange Zeit ein Hindernis, da medizinische Dokumente unordentlich sind. Sie kommen in unterschiedlichen Formen, Größen und Formaten vor; einige sind gestochen scharfe digitale Dateien, andere sind körnige Scans von altem Papier. Darüber hinaus sind die Informationen oft über mehrere Seiten verstreut, wobei Testnamen, Zahlen und Einheiten in komplexen Tabellen angeordnet sind, die von Krankenhaus zu Krankenhaus unterschiedlich aussehen können.

In den letzten Jahren ist ein neuer Typ künstlicher Intelligenz namens Vision-Language-Modell entstanden, um diese Herausforderung anzugehen. Im Gegensatz zu älteren Systemen, die nur Text lesen oder nur Bilder sehen konnten, können diese Modelle ein Bild eines Dokuments betrachten und gleichzeitig sowohl das visuelle Layout als auch die darin enthaltenen Wörter verstehen. Sie können sehen, dass eine Zahl zu einem bestimmten Test gehört, weil sie aufgrund ihrer Position auf der Seite dort steht, und nicht nur, weil sie einem bestimmten Wort folgt. Obwohl diese Modelle jedoch leistungsstark sind, verstanden Wissenschaftler nicht vollständig, wie man sie am besten mit diesen komplexen, mehrseitigen Dokumenten füttert. Soll der Computer ein gesamtes zehnseitiges Dokument auf einmal betrachten oder sollte er die Seiten einzeln untersuchen? Die Antwort auf diese Frage entscheidet darüber, ob der Computer wichtige Details übersieht oder Zeit verschwendet – ein Unterschied, der eine tiefe Bedeutung hat, wenn die Daten zur Unterstützung der Patientenversorgung verwendet werden.

Ein Team von Forschern setzte sich zum Ziel, die Antwort zu finden, indem es ein kontrolliertes Experiment mit realen Laborberichten durchführte. Sie sammelten anonymisierte Testergebnisse von zwei großen Anbietern, Lal PathLabs und Thyrocare, und erstellten Versionen dieser Berichte sowohl in digitalen als auch in gescannten Formaten. Um einen fairen Test zu gewährleisten, bereiteten sie drei verschiedene Dokumentenlängen vor: einen kurzen einseitigen Bericht, einen mittleren Bericht von fünf bis sechs Seiten und einen langen Bericht, der sich über zehn Seiten erstreckt. Sie testeten dann drei verschiedene Arten der Verarbeitung dieser Dokumente unter Verwendung zweier führender KI-Modelle, Qwen2.5-VL und Llama 3.2 Vision. Der erste Ansatz forderte das Modell auf, den gesamten Bericht als ein einziges Bild zu betrachten. Der zweite Ansatz forderte das Modell auf, jede Seite einzeln zu betrachten und die Ergebnisse anschließend zu kombinieren. Der dritte Ansatz nutzte ein anderes Modell, um die Seiten einzeln zu betrachten.

Die Ergebnisse zeigten, dass die Strategie, mit der das Dokument präsentiert wurde, genauso wichtig war wie das Modell selbst. Als die Forscher das Qwen2.5-VL-Modell baten, die Berichte Seite für Seite zu verarbeiten, erreichte es das höchste Maß an Genauigkeit und identifizierte sowie protokollierte korrekt fast 99 Prozent der erwarteten Testergebnisse. Diese Methode erwies sich als besonders robust für die längsten Dokumente; selbst bei zehn Seiten an Daten behielt der seitenweise Ansatz eine Genauigkeit von über 98 Prozent bei. Im Gegensatz dazu sank die Genauigkeit desselben Modells signifikant auf etwa 91 Prozent, als es gebeten wurde, den gesamten zehnseitigen Bericht auf einmal zu betrachten. Das Modell neigte dazu, Tests zu übersehen, die auf späteren Seiten erschienen, wenn das Dokument zu lang war, um alles auf einmal zu erfassen.

Der Kompromiss für diese höhere Genauigkeit war die Zeit. Die seitenweise Methode dauerte etwa doppelt so lange, um einen Bericht zu verarbeiten, wie die Methode, die das gesamte Dokument auf einmal betrachtete. Während der Ansatz des vollständigen Dokuments schneller war und extrem präzise war, wenn er einen Test fand, versäumte er es schlichtweg, viele der Tests zu sehen, die in längeren Berichten verborgen waren. Der dritte Workflow, der das Llama 3.2 Vision-Modell verwendete, um die Seiten einzeln zu betrachten, schnitt am schlechtesten ab. Er dauerte im Durchschnitt über 108 Sekunden pro Bericht und erzeugte häufig fehlerhafte Datensätze oder übersah Daten, wobei er eine Gesamtgenauigkeit von weniger als 88 Prozent erreichte. Dies deutet darauf hin, dass es nicht ausreicht, ein Dokument einfach in Stücke zu zerlegen; die spezifische Intelligenz des Modells spielt ebenso eine Rolle wie die Art der Präsentation.

Die Studie untersuchte auch, wie die Qualität des Dokuments die Ergebnisse beeinflusste. Ob es sich bei dem Bericht um eine saubere digitale Datei oder ein gescanntes Bild eines Papierdokuments handelte, machte für die Leistung des am besten abschneidenden Workflows kaum einen Unterschied. Der seitenweise Ansatz mit dem Qwen2.5-VL-Modell behielt eine perfekte Genauigkeit unter den evaluierten Scan-Bedingungen bei, welche kurze und mittellange Berichte einschlossen. Dieser Befund legt nahe, dass die physische Qualität des Scans weniger kritisch ist als die Strategie, mit der die Informationen an den Computer übermittelt werden. Die Forscher stellten fest, dass auch das spezifische Layout des Krankenhausberichts eine Rolle spielte, wobei die Berichte eines Anbieters etwas leichter zu verarbeiten waren als die des anderen, aber der Gesamttrend über beide Quellen hinweg Bestand hatte.

Letztendlich zeigt die Forschung, dass es keine einzelne „beste“ Art gibt, Daten aus medizinischen Berichten zu extrahieren. Die Wahl hängt ganz davon ab, was der Nutzer benötigt. Wenn ein Krankenhaus ein System benötigt, das Tausende von Berichten schnell verarbeitet und bereit ist, ein paar Details zu tolerieren, die später nacherfasst werden können, könnte der schnellere Ansatz des gesamten Dokuments geeignet sein. Wenn es jedoch das Ziel ist, eine vollständige und zuverlässige Aufzeichnung jedes einzelnen Testergebnisses zu erstellen, insbesondere bei langen und komplexen Dokumenten, ist die langsamere, seitenweise Methode die überlegene Wahl. Die Studie kommt zu dem Schluss, dass die Art und Weise, wie ein Dokument einem System der künstlichen Intelligenz präsentiert wird, eine kritische Designentscheidung ist, die direkt die Zuverlässigkeit der produzierten medizinischen Daten beeinflusst.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →