← Últimos artigos
💻 computer science

Beyond Accuracy: A Comprehensive Evaluation of ResNet50 and Vision Transformer for Trustworthy Pneumonia Detection from Chest X-Ray Images

Este estudo apresenta uma avaliação abrangente da ResNet50 e do Vision Transformer (ViT-B16) para a detecção de pneumonia em radiografias de tórax, revelando que, embora a ResNet50 ofereça precisão, calibração e eficiência superiores, o ViT-B16 demonstra maior robustez contra degradações de imagem, destacando, assim, a necessidade de uma avaliação multidimensional para sistemas de diagnóstico confiáveis.

Autores originais: VISHAL MANTA

Publicado 2026-07-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: VISHAL MANTA

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um mistério, mas em vez de procurar por impressões digitais, você está procurando por pistas invisíveis dentro do peito de uma pessoa. Este é o mundo da imagem médica, onde os médicos usam câmeras especiais para tirar fotos dos pulmões para ver se eles estão doentes. Por muito tempo, os melhores detetives foram os médicos humanos, mas eles ficam cansados, e às vezes as pistas são tão minúsculas ou borradas que até os olhos mais aguçados as deixam passar. Para ajudar, cientistas construíram "detetives digitais" usando um ramo da ciência da computação chamado Aprendizado Profundo (Deep Learning). Pense nesses detetives digitais como robôs superinteligentes que aprendem olhando milhares de fotos até conseguirem identificar um problema por conta própria.

Existem dois tipos principais de detetives robóticos. O primeiro tipo é como um artista cuidadoso que observa uma imagem uma pequena pincelada de cada vez, percebendo como as bordas e as texturas se conectam. Isso é chamado de Rede Neural Convolucional (CNN). O segundo tipo é como um pássaro voando alto acima de uma floresta; ele não olha para cada folha individualmente, mas sim vê como a floresta inteira se conecta e interage à distância. Isso é chamado de Vision Transformer (ViT). Ambos são incrivelmente poderosos, mas os médicos precisam saber qual deles é realmente melhor em salvar vidas antes de confiarem neles em um hospital. Não basta apenas ser rápido ou acertar a resposta na maioria das vezes; o robô também precisa ser honesto sobre o quão certo de si está, resistente o suficiente para lidar com fotos ruins e fácil de ser explicado para um médico humano.


Neste estudo, um pesquisador chamado Vishal Manta, do Instituto Indiano de Tecnologia de Guwahati, decidiu colocar dois desses detetives digitais em uma luta justa para ver qual deles é o mais confiável para detectar a pneumonia, uma infecção pulmonar séria. Os dois contendores eram o ResNet50, o artista cuidadoso (CNN), e o ViT-B16, o pássaro que voa alto (Vision Transformer). Eles não perguntaram apenas: "Quem acertou mais respostas?". Em vez disso, montaram um enorme circuito de obstáculos para testar tudo: o quão precisos eles eram, o quão honestos eram sobre sua confiança, o quão rápidos eram e o quão bem conseguiam lidar com uma foto borrada ou com ruído.

Os resultados desta corrida foram bastante claros. Quando se tratava do trabalho principal de detectar pneumonia, o ResNet50 foi o campeão. Ele identificou corretamente os casos de pneumonia 84,56% das vezes, enquanto o Vision Transformer conseguiu 81,14%. O pesquisador usou um teste estatístico especial chamado teste de McNemar para garantir que isso não fosse apenas um golpe de sorte, e a matemática confirmou que o ResNet50 era, de fato, significativamente melhor. Mas a história não terminou aí. O estudo descobriu que o ResNet50 também era o detetive mais honesto. Quando dizia estar "90% seguro", ele geralmente estava certo. O Vision Transformer, no entanto, tendia a ser excessivamente confiante, muitas vezes dizendo que estava seguro quando, na verdade, não estava. No mundo da medicina, ser excessivamente confiante é perigoso porque um médico pode confiar demais em uma resposta errada.

No entanto, o Vision Transformer não foi um perdedor total; ele tinha um superpoder. Quando os pesquisadores deliberadamente estragaram as fotos de teste adicionando estática (ruído), tornando-as borradas ou alterando o brilho, o Vision Transformer manteve sua posição melhor do que o ResNet50. Embora ambos os modelos tenham piorado com fotos ruins, a precisão do Vision Transformer caiu menos. Parece que, como o "pássaro" olha para a imagem inteira de uma vez, ele ainda consegue entender as coisas mesmo que partes da imagem estejam nebulosas. Mas esse superpoder veio com um preço alto. O Vision Transformer era um gigante, exigindo 85,80 milhões de configurações ajustáveis (parâmetros) para funcionar, comparado aos 23,51 milhões do ResNet50. Ele também levava muito mais tempo para pensar, precisando de 55,60 segundos para processar um lote de imagens contra os 38,57 segundos do ResNet50, e demandava muito mais poder computacional para rodar.

Para garantir que os robôs estavam realmente olhando para os pulmões e não apenas adivinhando, o pesquisador usou uma ferramenta chamada Grad-CAM, que atua como um mapa de calor para mostrar para onde o robô está olhando. O artista cuidadoso (ResNet50) focou sua atenção firmemente nas partes doentes do pulmão, que é exatamente o que um médico quer ver. O pássaro que voa alto (ViT) teve uma atenção um pouco mais dispersa. Quando os robôs cometiam erros, eles principalmente perdiam os casos de pneumonia, dizendo confiantemente "Normal" quando os pulmões estavam, na verdade, doentes. Isso sugere que, embora esses robôs estejam melhorando, eles ainda lutam com os casos mais sutis e traiçoeiros da doença.

Em última análise, este estudo sugere que, se você precisar de um assistente confiável, rápido e honesto para um hospital que pode não ter um supercomputador, o artista cuidadoso ResNet50 é atualmente a melhor escolha. Ele é mais preciso, mais honesto sobre sua confiança e mais barato de operar. O Vision Transformer é um competidor forte que lida bem com fotos ruins, mas é muito pesado e caro para muitas clínicas do mundo real no momento. A principal lição é que construir uma IA médica confiável não é apenas sobre quem obtém a pontuação mais alta em um teste; é sobre encontrar o equilíbrio certo entre ser inteligente, ser honesto, ser rápido e ser resistente o suficiente para o mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →