Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports
Este estudio evalúa los modelos de visión y lenguaje para la extracción de datos estructurados a partir de informes de laboratorio heterogéneos de múltiples páginas, encontrando que, si bien el procesamiento de documentos completos ofrece una velocidad superior, un flujo de trabajo página por página utilizando Qwen2.5-VL logra la mayor precisión y estabilidad a través de diversas longitudes de documento.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los hospitales generan un vasto océano de registros en papel y digitales cada día, desde las notas narrativas que escriben los médicos hasta los densos resultados tabulares de los laboratorios. Para que las computadoras ayuden a los médicos a tomar mejores decisiones o para que los investigadores encuentren patrones en las enfermedades, esta información debe convertirse de imágenes y texto en datos limpios y organizados que las máquinas puedan leer. Este proceso, conocido como extracción de información, ha sido durante mucho tiempo un obstáculo porque los documentos médicos son desordenados. Vienen en diferentes formas, tamaños y formatos; algunos son archivos digitales nítidos, mientras que otros son escaneos granulados de papel antiguo. Además, la información suele estar dispersa a través de múltiples páginas, con nombres de pruebas, números y unidades dispuestos en tablas complejas que se ven diferentes de un hospital a otro.
En años recientes, un nuevo tipo de inteligencia artificial llamado modelo de visión y lenguaje ha surgido para abordar este desafío. A diferencia de los sistemas más antiguos que solo podían leer texto o solo ver imágenes, estos modelos pueden mirar una imagen de un documento y entender tanto el diseño visual como las palabras dentro de él simultáneamente. Pueden ver que un número pertenece a una prueba específica debido a su ubicación en la página, no solo porque sigue a una palabra específica. Sin embargo, aunque estos modelos son potentes, los científicos no comprendían completamente la mejor manera de alimentarlos con estos complejos documentos de varias páginas. ¿Debería la computadora mirar un informe completo de diez páginas a la vez, o debería examinar las páginas una por una? La respuesta a esta pregunta determina si la computadora pierde detalles importantes o pierde el tiempo, una distinción que importa profundamente cuando los datos se utilizan para guiar la atención al paciente.
Un equipo de investigadores se propuso encontrar la respuesta realizando un experimento controlado con informes de laboratorio del mundo real. Reunieron resultados de pruebas desidentificados de dos proveedores importantes, Lal PathLabs y Thyrocare, y crearon versiones de estos informes tanto en formatos digitales como escaneados. Para asegurar una prueba justa, prepararon tres tipos de documentos de diferentes longitudes: un informe corto de una sola página, un informe mediano de cinco a seis páginas y un informe largo que se extiende hasta las diez páginas. Luego probaron tres formas diferentes de procesar estos documentos utilizando dos modelos de inteligencia artificial líderes, Qwen2.5-VL y Llama 3.2 Vision. El primer enfoque pidió al modelo que mirara el informe completo como una sola imagen. El segundo enfoque pidió al modelo que mirara cada página individualmente y luego combinara los resultados. El tercer enfoque utilizó un modelo diferente para mirar las páginas individualmente.
Los resultados revelaron que la estrategia utilizada para presentar el documento era tan importante como el modelo mismo. Cuando los investigadores pidieron al modelo Qwen2.5-VL procesar los informes página por página, este logró el nivel más alto de precisión, identificando y registrando correctamente casi el 99 por ciento de los resultados de las pruebas esperados. Este método demostró ser particularmente robusto para los documentos más largos; incluso con diez páginas de datos, el enfoque página por página mantuvo una precisión de más del 98 por ciento. En contraste, cuando se le pidió al mismo modelo que viera el informe de diez páginas completo a la vez, su precisión cayó significamente a aproximadamente el 91 por ciento. El modelo tendía a perder pruebas que aparecían en páginas posteriores cuando el documento era demasiado largo para ser visto todo a la vez.
La compensación por esta mayor precisión fue el tiempo. El método página por página tardó aproximadamente el doble en procesar un informe que el método que veía el documento completo a la vez. Aunque el enfoque de documento completo era más rápido y extremadamente preciso cuando sí encontraba una prueba, simplemente fallaba al ver muchas de las pruebas ocultas en informes más largos. El tercer flujo de trabajo, que utilizó el modelo Llama 3.2 Vision para mirar las páginas una por una, fue el que peor funcionó. Tardó lo más largo en terminar, promediando más de 108 segundos por informe, y frecuentemente generaba registros incorrectos o perdía datos, logrando una precisión general de menos del 88 por ciento. Esto sugirió que simplemente dividir un documento en piezas no era suficiente; la inteligencia específica del modelo importaba tanto como el método de presentación.
El estudio también examinó cómo la calidad del documento afectaba los resultados. Si el informe era un archivo digital limpio o una imagen escaneada de un documento de papel, esto influyó poco en el desempeño del flujo de trabajo con mejor rendimiento. El enfoque página por página con el modelo Qwen2.5-VL mantuvo una precisión perfecta bajo las condiciones de escaneo evaluadas, las cuales incluían informes de corta y mediana longitud. Este hallazgo sugiere que la calidad física del escaneo es menos crítica que la estrategia utilizada para alimentar la información a la computadora. Los investigadores señalaron que el diseño específico del informe del hospital también desempeñó un papel, siendo los informes de un proveedor ligeramente más fáciles de procesar que los del otro, pero la tendencia general se mantuvo constante en ambas fuentes.
En última instancia, la investigación demuestra que no existe una única "mejor" forma de extraer datos de los informes médicos. La elección depende enteramente de lo que el usuario necesite. Si un sistema hospitalario necesita procesar miles de informes rápidamente y puede tolerar la pérdida de algunos detalles que pueden captarse más tarde, el enfoque más rápido de documento completo podría ser adecuado. Sin embargo, si el objetivo es construir un registro completo y confiable de cada uno de los resultados de las pruebas, especialmente de documentos largos y complejos, el método más lento, página por página, es la opción superior. El estudio concluye que la forma en que se presenta un documento a un sistema de inteligencia artificial es una decisión de diseño crítica que impacta directamente en la confiabilidad de los datos médicos que produce.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.