Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports
Este estudo avalia modelos de visão-linguagem para a extração de dados estruturados de relatórios laboratoriais heterogêneos de múltiplas páginas, constatando que, embora o processamento do documento completo ofereça uma velocidade superior, um fluxo de trabalho página a página utilizando o Qwen2.5-VL alcança a maior precisão e estabilidade através de diferentes extensões de documentos.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os hospitais geram um vasto oceano de registros em papel e digitais todos os dias, desde as notas narrativas que os médicos escrevem até os densos resultados tabulares de testes laboratoriais. Para que os computadores possam ajudar os médicos a tomar melhores decisões ou para que pesquisadores encontrem padrões em doenças, essas informações devem ser convertidas de imagens e textos em dados limpos e organizados que as máquinas possam ler. Esse processo, conhecido como extração de informações, tem sido há muito tempo um obstáculo porque os documentos médicos são desordenados. Eles vêm em diferentes formas, tamanhos e formatos; alguns são arquivos digitais nítidos, enquanto outros são digitalizações granuladas de papéis antigos. Além disso, a informação é frequentemente espalhada por múltiplas páginas, com nomes de testes, números e unidades organizados em tabelas complexas que parecem diferentes de um hospital para outro.
Nos últimos anos, um novo tipo de inteligência artificial chamado modelo de visão-linguagem surgiu para enfrentar esse desafio. Diferente dos sistemas mais antigos que podiam apenas ler texto ou apenas ver imagens, esses modelos podem olhar para a imagem de um documento e entender simultaneamente tanto o layout visual quanto as palavras contidas nele. Eles podem ver que um número pertence a um teste específico devido à sua posição na página, não apenas porque segue uma palavra específica. No entanto, embora esses modelos sejam poderosos, os cientistas não entendiam totalmente a melhor maneira de alimentá-los com esses documentos complexos de múltiplas páginas. O computador deveria olhar para um relatório inteiro de dez páginas de uma só vez ou deveria examinar as páginas uma por uma? A resposta a essa pergunta determina se o computador perderá detalhes importantes ou desperdiçará tempo, uma distinção que importa profundamente quando os dados são usados para guiar o cuidado ao paciente.
Uma equipe de pesquisadores partiu para encontrar a resposta realizando um experimento controlado com relatórios laboratoriais do mundo real. Eles reuniram resultados de testes desidentificados de dois grandes provedores, Lal PathLabs e Thyrocare, e criaram versões desses relatórios tanto em formatos digitais quanto digitalizados. Para garantir um teste justo, eles prepararam três comprimentos diferentes de documentos: um relatório curto de uma única página, um relatório médio de cinco a seis páginas e um relatório longo que se estende por dez páginas. Eles então testaram três maneiras diferentes de processar esses documentos usando dois modelos de inteligência artificial líderes, Qwen2.5-VL e Llama 3.2 Vision. A primeira abordagem pediu ao modelo para olhar para o relatório inteiro como uma única imagem. A segunda abordagem pediu ao modelo para olhar para cada página individualmente e depois combinar os resultados. A terceira abordagem utilizou um modelo diferente para olhar as páginas individualmente.
Os resultados revelaram que a estratégia usada para apresentar o documento era tão importante quanto o próprio modelo. Quando os pesquisadores pediram ao modelo Qwen2.5-VL para processar os relatórios página por página, ele alcançou o nível mais alto de precisão, identificando e registrando corretamente quase 99 por cento dos resultados de testes esperados. Este método provou ser particularmente robusto para os documentos mais longos; mesmo com dez páginas de dados, a abordagem página a página manteve uma precisão de mais de 98 por cento. Em contraste, quando o mesmo modelo foi solicitado a visualizar o relatório de dez páginas inteiro de uma só vez, sua precisão caiu significativamente para cerca de 91 por cento. O modelo tendia a perder testes que apareciam em páginas posteriores quando o documento era longo demais para ser visualizado de uma só vez.
A compensação por essa maior precisão foi o tempo. O método página a página levou aproximadamente o dobro do tempo para processar um relatório em comparação ao método que visualizava o documento inteiro de uma vez. A abordagem de documento completo foi mais rápida e extremamente precisa quando encontrava um teste, mas simplesmente falhou em ver muitos dos testes escondidos em relatórios mais longos. O terceiro fluxo de trabalho, que usou o modelo Llama 3.2 Vision para olhar as páginas uma por uma, teve o pior desempenho de todos. Levou o maior tempo para terminar, com uma média de mais de 108 segundos por relatório, e frequentemente gerava registros incorretos ou perdia dados, alcançando uma precisão geral de menos de 88 por cento. Isso sugeriu que simplesmente dividir um documento em partes não era suficiente; a inteligência específica do modelo importava tanto quanto o método de apresentação.
O estudo também examinou como a qualidade do documento afetava os resultados. Se o relatório era um arquivo digital limpo ou uma imagem digitalizada de um documento de papel, pouco mudava no desempenho do fluxo de trabalho de melhor desempenho. A abordagem página a página com o modelo Qwen2.5-VL manteve a precisão perfeita sob as condições de digitalização avaliadas, que incluíam relatórios de curta e média duração. Essa descoberta sugere que a qualidade física da digitalização é menos crítica do que a estratégia usada para alimentar a informação ao computador. Os pesquisadores observaram que o layout específico do relatório do hospital também desempenhou um papel, com os relatórios de um provedor sendo ligeiramente mais fáceis de processar do que os do outro, mas a tendência geral se manteve em ambas as fontes.
Em última análise, a pesquisa demonstra que não existe uma única "melhor" maneira de extrair dados de relatórios médicos. A escolha depende inteiramente do que o usuário precisa. Se um sistema hospitalar precisa processar milhares de relatórios rapidamente e pode tolerar a perda de alguns detalhes que podem ser capturados posteriormente, a abordagem mais rápida de documento inteiro pode ser adequada. No entanto, se o objetivo é construir um registro completo e confiável de cada um dos resultados de testes, especialmente de documentos longos e complexos, o método mais lento, página a página, é a escolha superior. O estudo conclui que a maneira como um documento é apresentado a um sistema de inteligência artificial é uma decisão de design crítica que impacta diretamente a confiabilidade dos dados médicos que ela produz.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.