← Últimos artigos
💻 computer science

CNN and ViT Efficiency Study on Tiny ImageNet and DermaMNIST Datasets

Este estudo demonstra que, ao serem devidamente ajustados, os Vision Transformers podem superar ou igualar o desempenho do ResNet-18 nas bases TinyImageNet e DermatologyMNIST, oferecendo inferência mais rápida e menor complexidade de modelo para ambientes com recursos limitados.

Autores originais: Aidar Amangeldi, Angsar Taigonyrov, Muhammad Huzaifa Jawad, Chinedu Emmanuel Mbonu

Publicado 2026-02-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Aidar Amangeldi, Angsar Taigonyrov, Muhammad Huzaifa Jawad, Chinedu Emmanuel Mbonu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem dois tipos de "olhos" artificiais para olhar fotos e dizer o que está nelas. O primeiro tipo é como um detetive experiente que olha para cada detalhe minúsculo da foto (as rugas, as cores, as bordas) e sabe exatamente o que é. O segundo tipo é como um pintor abstrato que tenta entender a "vibe" geral da imagem, olhando para o todo de uma vez só.

Este estudo é uma corrida entre esses dois tipos de "olhos" (chamados de CNN e ViT) para ver qual deles é melhor para dois trabalhos muito diferentes:

  1. Diagnóstico de pele: Identificar doenças em fotos de manchas na pele (como se fosse um médico usando um celular).
  2. Reconhecimento geral: Identificar objetos em fotos (como um drone de vigilância vendo carros, árvores ou pessoas).

O grande problema? O "pintor abstrato" (ViT) é muito inteligente e preciso, mas é gordo e lento. Ele precisa de muita energia e memória para funcionar. O "detetive" (CNN) é mais rápido e leve, mas às vezes perde o contexto geral.

A equipe queria encontrar o "Santo Graal": um modelo que fosse tão inteligente quanto o pintor, mas tão rápido e leve quanto o detetive, para que pudesse rodar em celulares ou drones sem travar.

A Grande Prova de Fogo

Eles testaram vários tamanhos desses modelos em dois "campos de batalha":

  • Tiny ImageNet: Um conjunto de fotos de objetos comuns (como um teste de QI geral).
  • DermaMNIST: Um conjunto de fotos de pele, muito pequenas e detalhadas (como um exame médico delicado).

O Que Eles Descobriram? (A Analogia do Carro)

Imagine que os modelos são carros:

  • O ViT-Base (o grande): É um caminhão de luxo. Ele é super potente e carrega muita carga (alta precisão), mas gasta muito combustível, é lento para acelerar e não cabe na garagem de ninguém (não cabe no celular).
  • O ViT-Tiny (o pequeno): É um carrinho de brinquedo. É super rápido e leve, mas às vezes não consegue ver detalhes importantes e erra a direção.
  • O ResNet18 (o padrão): É um carro popular. É confiável e razoável, mas não é o mais rápido nem o mais inteligente.

O Grande Achado:
Eles descobriram um carro intermediário perfeito: o ViT-Small com "lentes" de tamanho 16.

Pense nas "lentes" (patch size) como a resolução de uma câmera:

  • Se você usa lentes grandes (32), você vê a foto em blocos grandes. É rápido, mas você perde os detalhes finos (como as linhas de uma mancha na pele). É como tentar ler um livro com óculos de grau errado.
  • Se você usa lentes pequenas (16), você vê os detalhes. É mais trabalhoso, mas você não perde nada.

O ViT-Small (lente 16) foi o vencedor porque:

  1. Na pele (DermaMNIST): Ele conseguiu ver os detalhes finos das manchas (usando lentes pequenas) quase tão bem quanto o caminhão de luxo, mas era muito mais rápido e ocupava muito menos espaço na memória do celular.
  2. Nos objetos (Tiny ImageNet): Ele foi quase tão inteligente quanto o caminhão, mas rodou 3 a 4 vezes mais rápido.

A Lição Principal

A mensagem do estudo é simples: Você não precisa do caminhão de luxo para entregar uma pizza.

Para usar inteligência artificial em lugares onde os recursos são limitados (como um drone de guerra, um celular em uma área rural sem internet ou um dispositivo médico portátil), não adianta ter o modelo mais inteligente se ele é muito pesado para rodar.

O estudo mostrou que, ajustando o tamanho das "lentes" e escolhendo o tamanho certo do modelo (nem muito grande, nem muito pequeno), conseguimos criar sistemas que são:

  • Rápidos: Tomam decisões em tempo real.
  • Leves: Cabem em qualquer celular.
  • Precisos: Não erram o diagnóstico ou a identificação.

Conclusão Criativa

Imagine que você quer ensinar um pássaro a voar. Você não pode usar um elefante (o modelo gigante), porque ele não consegue levantar voo. Você também não pode usar uma mosca (o modelo muito pequeno), porque ela não tem força para carregar a carga.

A equipe encontrou o falcão: um pássaro que tem a força para caçar (precisão) e a agilidade para voar rápido (eficiência). Esse "falcão" (ViT-Small com lentes de 16) é a chave para levar a inteligência artificial de diagnósticos médicos e vigilância para o mundo real, para onde ela realmente precisa estar: nas mãos das pessoas e no céu dos drones.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →