← Últimos artigos
📄 cardiovascular medicine

Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models

Este estudo demonstra que modelos de linguagem de grande escala de código aberto e alta capacidade, particularmente o Llama 3.3 70B, podem identificar de forma precisa e automática procedimentos complexos de intervenção coronária percutânea e extrair variáveis fundamentais de relatórios de cateterismo cardíaco em texto livre, oferecendo uma alternativa escalável à abstração manual laboriosa para a pesquisa cardiovascular.

Autores originais: Bhatt, N., Warner, F., Miao, J., Thakker, R., Joodi, G., Cantero-Schaffer, P., Huang, C., Krumholz, H., Murugiah, K.

Publicado 2026-09-16
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Bhatt, N., Warner, F., Miao, J., Thakker, R., Joodi, G., Cantero-Schaffer, P., Huang, C., Krumholz, H., Murugiah, K.

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

Os hospitais geram um vasto oceano de texto não estruturado todos os dias. Entre os mais críticos desses documentos estão os relatórios narrativos escritos após um cateterismo cardíaco, um procedimento no qual os médicos inserem um tubo fino através das artérias para examinar os vasos sanguíneos do coração. Esses relatórios são ricos em detalhes sobre a anatomia do coração de um paciente e as técnicas específicas usadas para corrigir obstruções, mas são escritos em parágrafos de fluxo livre, em vez de campos de seleção organizados. Para pesquisadores e equipes de melhoria de qualidade, isso cria um gargalo significativo. Para estudar o quão bem esses procedimentos funcionam ou para rastrear a complexidade dos casos em um sistema de saúde, especialistas humanos devem ler manualmente milhares desses relatórios e extrair pontos de dados específicos. Esse processo é lento, caro e difícil de escalar, muitas vezes limitando o tamanho e a velocidade de importantes estudos médicos.

A ascensão dos grandes modelos de linguagem, um tipo de inteligência artificial capaz de compreender e gerar texto semelhante ao humano, oferece uma solução potencial para este problema. Esses sistemas podem ser treinados para ler documentos complexos e extrair fatos específicos, de forma muito semelhante a um assistente de pesquisa muito rápido e incansável. No entanto, permanecia incerto se essas ferramentas conseguiriam lidar com a linguagem matizada e especializada encontrada nas notas de procedimentos cardíacos, particularmente quando solicitadas a identificar casos "complexos" que envolvem múltiplas obstruções ou técnicas difíceis. Uma equipe de pesquisadores decidiu testar essa questão usando uma grande coleção de relatórios de cateterismo cardíaco do mundo real.

Os pesquisadores reuniram 1.412 notas de procedimentos desidentificadas de três hospitais diferentes dentro do sistema Yale New Haven Health. Esses documentos cobriam procedimentos realizados entre 2011 e 2017 e incluíam uma mistura de exames diagnósticos e intervenções reais onde os médicos colocaram stents ou usaram balões para abrir artérias bloqueadas. Para criar um padrão confiável de comparação, um grupo de especialistas cardíacos leu manualmente cada nota. Eles primeiro determinaram se um relatório descrevia um procedimento onde um stent ou balão foi realmente usado para tratar uma artéria coronária. Para aqueles que o fizeram, eles então extraíram seis detalhes específicos que definem um procedimento "complexo": o número de vasos sanguíneos tratados, o número de obstruções distintas corrigidas, o número total de stents colocados, se uma técnica específica de dois stents foi usada para um vaso ramificado, o comprimento total de todos os stents combinados e se uma oclusão total crônica — um bloqueio completo e de longa duração — foi tratada.

Com esse "padrão ouro" verificado por humanos em mãos, a equipe testou três modelos diferentes de inteligência artificial para ver se eles conseguiam replicar o trabalho dos especialistas. Eles escolheram modelos de código aberto, o que significa que seu código e pesos estavam disponíveis publicamente, o que permitiu aos pesquisadores executá-los em computadores locais seguros para proteger a privacidade do paciente. Um modelo era um sistema de propósito geral massivo com 70 bilhões de parâmetros, uma medida de seu tamanho e capacidade de raciocínio. Os outros dois eram modelos menores, pré-treinados especificamente em literatura médica, com 7 bilhões de parâmetros cada, projetados para compreender a terminologia clínica. Os pesquisadores forneceram os mesmos comandos de texto e relatórios para todos os três modelos, pedindo que identificassem se um procedimento ocorreu e que extraíssem as seis variáveis específicas.

Os resultados mostraram uma distinção clara na capacidade. O modelo grande de propósito geral superou significativamente os dois modelos menores e específicos para medicina. Quando questionado simplesmente para identificar se um relatório descrevia um procedimento cardíaco, o modelo grande alcançou sensibilidade perfeita, o que significa que não perdeu nenhum procedimento real, e identificou corretamente os não-procedimentos com alta precisão. Em contraste, os modelos menores tiveram dificuldades, com um confundindo frequentemente notas de não-procedimentos como procedimentos e o outro falhando quase totalmente em reconhecer procedimentos reais.

A lacuna aumentou quando a tarefa exigiu a extração dos seis detalhes complexos. O modelo grande identificou com sucesso o número de stents e o comprimento total dos stents com uma precisão muito alta, frequentemente excedendo 90 por cento. Também teve um bom desempenho na identificação do número de vasos tratados. No entanto, seu desempenho caiu em variáveis que exigiam mais interpretação, como contar o número exato de obstruções distintas ou determinar se uma técnica específica de dois stents foi usada para um vaso ramificado. Nesses casos, o modelo às vezes perdeu detalhes ou interpretou incorretamente o contexto, embora ainda tenha permanecido muito mais preciso do que os modelos menores. Os modelos médicos menores, apesar de seu treinamento especializado, falharam em extrair esses detalhes de forma consistente, produzindo frequentemente resultados que eram pouco confiáveis para uso em pesquisa.

O estudo também examinou se os modelos performavam de forma diferente entre os três locais hospitalares. Embora o modelo grande tenha mantido alta precisão em todos os três locais, houve variações perceptíveis no desempenho em cada um deles, provavelmente devido a diferenças na forma como os médicos de cada hospital escreviam suas notas. Os modelos menores mostraram uma inconsistência ainda maior, com seu desempenho flutuando drasticamente dependendo da localização. Isso sugere que, embora o modelo grande seja robusto, a maneira como a informação é documentada ainda pode influenciar os resultados.

Os pesquisadores analisaram os erros cometidos pelo modelo de melhor desempenho para entender onde ele encontrava dificuldades. Eles descobriram que os erros ocorriam frequentemente quando a documentação era ambígua ou fragmentada. Por exemplo, o modelo às vezes confundia um teste diagnóstico com um tratamento, ou teve dificuldade em distinguir entre um stent que foi colocado com sucesso e um que foi tentado, mas não implantado. Também teve dificuldade quando um relatório mencionava uma obstrução que não foi realmente tratada, ou quando a descrição de uma oclusão total crônica era implícita em vez de explicitamente declarada. Esses erros destacam que, embora a tecnologia seja poderosa, ela ainda não é perfeita ao navegar na realidade confusa e inconsistente da escrita médica humana.

Em última análise, o estudo demonstra que um grande modelo de inteligência artificial de código aberto pode extrair com precisão dados complexos de relatórios de procedimentos cardíacos não estruturados, uma tarefa que tradicionalmente exigia horas de trabalho manual. Os achados sugerem que, para muitas variáveis, particularmente aquelas que são explicitamente declaradas, como o número de stents, essas ferramentas podem alcançar um nível de precisão adequado para a pesquisa. No entanto, para variáveis que exigem interpretação contextual profunda, a tecnologia ainda enfrenta desafios. O trabalho indica que o futuro da pesquisa cardiovascular escalável pode residir no uso desses modelos poderosos para lidar com o grosso da extração de dados, potencialmente combinados com supervisão humana para os casos mais difíceis, em vez de depender apenas de modelos menores e especializados ou de revisão manual.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →