← Últimos artigos
🤖 AI

Automatic Extraction of Structured Information from Brain MRI Reports Using an Open-Weight Large Language Model

Este estudo demonstra que o LLM de pesos abertos LLaMA 3.1 extrai informações estruturadas de relatórios de RM cerebral em holandês de forma eficaz, com alta precisão para variáveis categóricas e menções de lesões, enquanto o prompting de poucos disparos (few-shot prompting) melhora significativamente seu desempenho na extração de dados numéricos.

Autores originais: Kaouther Mouheb, Amos Pomp, Antoine Manenti, Romy de Haan, Farog Faghir, Joy Martens, Harro Seelaar, Francesco Mattace-Raso, Meike W. Vernooij, Frank J. Wolters, Stefan Klein, Esther E. Bron

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Kaouther Mouheb, Amos Pomp, Antoine Manenti, Romy de Haan, Farog Faghir, Joy Martens, Harro Seelaar, Francesco Mattace-Raso, Meike W. Vernooij, Frank J. Wolters, Stefan Klein, Esther E. Bron

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Transformando um Caderno Bagunçado em uma Planilha

Imagine que um hospital possui uma biblioteca massiva com milhares de laudos de ressonâncias magnéticas cerebrais. Por anos, esses laudos foram escritos como entradas de diário de texto livre por médicos. Eles estão cheios de informações valiosas, mas, como são escritos em frases não estruturadas, é incrivelmente difícil pesquisá-los rapidamente ou transformá-los em uma planilha organizada para pesquisa.

Os pesquisadores queriam ver se um programa de computador inteligente (um "Modelo de Linguagem de Pesos Abertos" chamado LLaMA 3.1) poderia agir como um bibliotecário super-rápido. O objetivo deles era ler esses laudos em holandês, que parecem textos manuscritos desestruturados, e extrair automaticamente 30 fatos específicos — como "Existe um tumor?" ou "Quantas manchas há no cérebro?" — e organizá-los em um formato limpo e estruturado.

O Desafio: Falando uma Língua Diferente

Os laudos foram escritos em holandês, mas o modelo de computador foi treinado principalmente em inglês. É como pedir a um tradutor que conhece o inglês perfeitamente para ler um documento jurídico complexo em um dialeto específico de holandês.

A equipe testou duas abordagens:

  1. Leitura Direta: Deixar o computador ler os laudos em holandês como eles são.
  2. Tradução Primeiro: Traduzir os laudos de holandês para inglês, deixar o computador lê-los e depois traduzir os resultados de volta.

O Resultado: O computador teve um desempenho muito melhor lendo os laudos originais em holandês. Quando tentaram traduzir os laudos primeiro, o computador se confundiu com termos médicos específicos. Por exemplo, existe uma palavra em holandês para um tipo muito específico de pequena lesão cerebral em forma de estria ("splinterinfarcten"). Quando traduzida para o inglês, tornou-se um termo genérico, "small infarct" (pequeno infarto), e o computador perdeu o detalhe específico necessário para contá-los corretamente.

A Estratégia da "Folha de Cola" (Few-Shot Prompting)

No início, o computador foi solicitado a realizar essa tarefa "do zero" (Zero-Shot), o que significa que ele teria que descobrir as regras por conta própria. Ele foi razoável, mas cometeu erros, especialmente na contagem de coisas (como "quantas manchas existem?").

Então, os pesquisadores testaram um novo truque chamado Few-Shot Prompting. Imagine que você está ensinando um aluno a corrigir uma prova. Em vez de apenas dar as regras a ele, você mostra três exemplos de uma prova que já foi corrigida corretamente, junto com as respostas. Você diz: "Veja como fizemos este aqui; agora faça o próximo da mesma maneira".

Os pesquisadores testaram diferentes formas de escolher esses três exemplos:

  • Aleatório: Escolher quaisquer três exemplos.
  • Fixo: Escolher os mesmos três exemplos todas as vezes.
  • Similaridade Estrutural: Escolher três exemplos que pareçam e soem mais semelhantes ao laudo que está sendo lido no momento.

O Vencedor: O método de Similaridade Estrutural foi o melhor. Ao mostrar ao computador exemplos que eram muito semelhantes ao laudo que ele estava lendo no momento, sua precisão saltou significamente. Foi como mostrar ao aluno um teste prático que era exatamente igual ao teste real que ele estava prestes a fazer.

O Quão Bem Ele se Saiu?

Os pesquisadores compararam o trabalho do computador com o de especialistas humanos (estudantes de medicina e radiologistas).

  • A Boa Notícia: Para classificações claras e padrão (como "O cérebro está encolhendo?"), o computador foi quase tão bom quanto os humanos. Ele acertou cerca de 90–96% desses casos.
  • A Parte Difícil: Contar números específicos (como "exatamente quantas pequenas hemorragias existem?") foi mais difícil. O computador acertou cerca de 66% por conta própria, mas com a "folha de cola" (few-shot prompting), melhorou para 81–92%.
  • A Confusão do "Omissão": O computador às vezes se confundia entre "O médico disse que NÃO há manchas" e "O médico não mencionou manchas". Ele teve dificuldade em distinguir entre um achado negativo e uma nota ausente.

O Ponto Principal

Este estudo prova que um modelo de IA aberto e gratuito pode ler com sucesso laudos médicos complexos em holandês e transformá-los em dados organizados sem a necessidade de enviar informações de pacientes para o servidor de uma empresa estrangeira.

  • Funciona melhor quando você deixa o computador ler o idioma original (holandês) em vez de traduzi-lo.
  • Torna-se mais inteligente quando você fornece alguns exemplos semelhantes para ele observar antes de começar a trabalhar.
  • Ainda não é perfeito, especialmente com contagens complicadas ou condições muito raras, mas é uma ferramenta poderosa que pode ajudar pesquisadores a transformar milhares de laudos bagunçados em dados úteis muito mais rápido do que os humanos conseguiriam sozinhos.

O artigo conclui que esta tecnologia está pronta para ajudar a organizar dados para pesquisa, desde que os humanos revisem as partes complicadas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →