← Últimos artigos
💻 computer science

Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?

Este artigo apresenta a primeira aplicação de Vision Transformers (ViT) à identificação automatizada de elementos semânticos em moedas romanas antigas utilizando dados multimodais, demonstrando que os modelos ViT superam as CNNs tradicionais em precisão.

Autores originais: David Reid, Ognjen Arandjelovic

Publicado 2026-01-15
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: David Reid, Ognjen Arandjelovic

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca enorme e empoeirada de moedas romanas antigas. Algumas são brilhantes, outras estão desgastadas e muitas estão cobertas de sujeira. Durante séculos, apenas alguns especialistas com décadas de treinamento podiam olhar para uma moeda, espremer os olhos para as pequenas imagens nela contidas e dizer: "Ah, esta tem um cavalo" ou "Esta apresenta um escudo".

Este artigo trata de ensinar computadores a fazer esse mesmo trabalho, mas com um toque especial: os pesquisadores queriam ver se um novo tipo de cérebro de computador chamado Vision Transformer (ViT) é melhor nisso do que o padrão antigo, a Rede Neural Convolucional (CNN).

Aqui está a história do experimento deles, dividida em termos simples.

O Problema: Uma Biblioteca de 100.000 Moedas

Os pesquisadores começaram com uma enorme coleção de 100.000 imagens de moedas e suas descrições, retiradas de um site de leilões online. Pense nisso como um grande monte de peças de quebra-cabeça.

  • O Desafio: Moedas antigas são complicadas. Elas costem estar riscadas, as imagens são estilizadas (não realistas) e o mesmo tipo de moeda pode parecer ligeiramente diferente dependendo de qual molde (matriz) foi usado para fabricá-la.
  • O Objetivo: Em vez de apenas combinar uma moeda com outra (como um jogo de "encontre o gêmeo"), eles queriam que o computador entendesse o significado das imagens. O computador consegue identificar uma "cornucópia" (um chifre da abundância)? Ele consegue dizer se uma figura está "em pé" ou "sentada"?

Os Contendentes: A Velha Guarda vs. O Novato

Para resolver isso, eles colocaram duas arquiteturas de computador diferentes para competir entre si:

  1. A CNN (O "Detetive Local"):
    Imagine um detetive que olha para uma imagem examinando pequenos fragmentos um por um. Eles olham para o canto superior esquerdo, depois para o canto superior direito, depois para o meio. Eles são muito bons em detectar padrões locais, como uma curva ou linha específica. No entanto, eles podem sofrer de visão de túnel, focando demais em um pequeno ponto e perdendo a visão do todo.

  2. O ViT (O "Observador Global"):
    O Vision Transformer é o novato na área. Em vez de olhar para os fragmentos um por um, imagine um detetive que olha para a imagem inteira de uma só vez, entendendo instantaneamente como o canto superior esquerdo se relaciona com o canto inferior direito. Ele trata a imagem como uma frase, onde cada parte está conectada a todas as outras partes. Isso permite que ele veja conexões de "longo alcance" que o detetive local pode perder.

O Experimento: Treinando os Cérebros

Os pesquisadores tiveram que limpar seus dados primeiro. As fotos originais frequentemente mostravam ambos os lados da moeda (frente e verso) ou várias moedas em um monte. Eles escreveram um programa para recortar apenas o lado de trás (o "reverso") da moeda, que geralmente possui as imagens mais interessantes.

Eles então alimentaram essas imagens limpas em ambos os tipos de computadores.

  • A CNN foi treinada em um conceito específico por vez (ex: "Encontre todas as águias").
  • O ViT era um multitarefa; ele aprendeu a encontrar todos os conceitos (águias, escudos, cavalos, etc.) ao mesmo tempo em um único modelo.

Os Resultados: Quem Venceu?

Após o treinamento ser concluído, eles testaram os computadores em moedas que eles nunca tinham visto antes.

  • O Vencedor: O Vision Transformer (ViT) geralmente venceu. Ele foi mais preciso ao identificar os elementos semânticos (as imagens) do que a CNN.
  • A Velocidade: A CNN foi muito mais rápida para treinar (como um velocista), enquanto o ViT levou muito mais tempo (como um maratonista), mas acabou com um tempo de chegada melhor em termos de precisão.
  • O "Porquê": Os pesquisadores descobriram que o ViT era melhor em lidar com a natureza bagunçada e desgastada das moedas. Ele não se confundia tão facilmente quando a imagem era ligeiramente diferente do esperado.

A "Visão de Raio-X" (Mapas de Saliência)

Para entender como os computadores estavam pensando, os pesquisadores usaram uma ferramenta chamada "mapeamento de saliência". Isso é como lançar um raio-X na imagem para ver em quais partes o computador estava olhando para tomar sua decisão.

  • O Raio-X da CNN: A CNN tendia a focar em um ponto específico e minúsculo. Por exemplo, ao procurar por uma águia, ela quase sempre encarava o canto inferior direito da moeda, onde as asas da águia costumam aparecer. Era como um aluno que memorizou que "as águias estão sempre no canto inferior direito", em vez de realmente reconhecer o pássaro.
  • O Raio-X do ViT: O foco do ViT era muito mais disperso e variado. Às vezes ele olhava para as penas da águia, às vezes para o fundo, às vezes para o texto próximo. Era mais difícil prever exatamente para onde ele estava olhando, mas isso sugeria que ele estava realmente "entendendo" toda a cena, em vez de apenas memorizar uma localização.

A Armadilha: Rótulos Ruidosos

O artigo admite uma falha importante no experimento: as "respostas" que eles deram aos computadores eram bagunçadas.
Os computadores foram treinados usando descrições de texto do site de leilões. Mas essas descrições frequentemente falavam sobre ambos os lados da moeda.

  • Exemplo: Uma descrição poderia dizer: "Frente: Cabeça do Imperador. Verso: Um cavalo em pé".
  • O Erro: O computador foi mostrado apenas o verso (o cavalo), mas o rótulo dizia "Em pé". No entanto, às vezes a descrição dizia "Em pé" devido à frente da moeda, embora o verso não tivesse uma figura em pé.
  • O Resultado: Os computadores estavam, às vezes, aprendendo com as pistas erradas. Os pesquisadores observaram que esse "ruído" provavelmente limitou o desempenho de ambos os modelos, especialmente para conceitos como "em pé" ou "sentado".

A Conclusão

O artigo conclui que os Vision Transformers são uma nova ferramenta promissora para o estudo de moedas antigas. Eles superaram os modelos CNN mais antigos em precisão, sugerindo que a abordagem do "Observador Global" é mais adequada para o mundo complexo e desordenado da história antiga.

No entanto, os pesquisadores alertam que, para obter resultados ainda melhores, precisamos de dados mais limpos. Se pudermos ensinar o computador a ignorar o "texto da frente da moeda" ao olhar para a "imagem do verso da moeda", esses historiadores digitais podem se tornar ainda mais poderosos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →