← Últimos artigos
💻 computer science

Vision Transformers Need Better Token Interaction

Este artigo identifica a "difusão semântica" como a causa da degradação das representações de patch em Vision Transformers durante o treinamento prolongado e propõe substituir a atenção softmax por entmax-1.5 para permitir interações seletivas entre tokens, o que melhora significativamente o desempenho de predição densa enquanto preserva o contexto global.

Autores originais: Linxiang Su

Publicado 2026-05-25
📖 4 min de leitura☕ Leitura rápida

Autores originais: Linxiang Su

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema: O Aluno "Que Compartilha Demais"

Imagine um Vision Transformer (ViT) como uma sala de aula cheia de alunos (chamados de tokens). Cada aluno olha para um pequeno pedaço de uma foto (um patch).

  • O Objetivo: O professor quer que a turma faça duas coisas:
    1. Identificar a imagem inteira (por exemplo, "Isso é um cachorro").
    2. Desenhar um contorno perfeito ao redor de cada parte do cachorro (por exemplo, "Este pixel é a orelha, este é o rabo"). Isso é chamado de predição densa.

O Problema:
À medida que a turma estuda por períodos cada vez mais longos, eles ficam muito bons em identificar o cachorro. No entanto, a capacidade de desenhar o contorno fica confusa. Os alunos começam a "compartilhar demais".

O artigo chama isso de Difusão Semântica. É como um aluno na última fileira que sabe que a resposta é "Cachorro" e começa a gritar esse fato para todos, até mesmo para os alunos que estão olhando para a grama ou para o céu.

  • O Resultado: Os alunos que estão olhando para a grama começam a pensar: "Ah, eu também devo fazer parte do cachorro!" porque ouviram a informação global.
  • A Consequência: O "contorno" fica borrado. O modelo acha que o fundo faz parte do objeto, tornando-o ruim em tarefas como segmentação (desenhar limites).

As Soluções Antigas vs. A Nova Ideia

Pesquisadores anteriores tentaram corrigir isso:

  • Adicionando "Anotadores": Dando à turma alunos especiais (Tokens de Registro) apenas para segurar o ruído extra para que os outros não fiquem confusos.
  • Regras Rígidas: Dizendo aos alunos: "Fale apenas com a pessoa sentada ao seu lado" (Janelas Locais).

A Perspectiva do Autor:
O autor argumenta que não devemos proibir a conversa global ou adicionar alunos extras. O fundo tem contexto útil. O problema não é que eles falam com todos; é que falam com todos igualmente, mesmo quando não faz sentido.

A Solução: "Conversa Seletiva" (Atenção Esparsa)
Em vez de forçar os alunos a sussurrar apenas para seus vizinhos, o autor sugere mudar o sistema de votação.

  • Sistema Antigo (Softmax): Imagine uma votação onde cada aluno recebe uma pequena quantidade, não nula, de atenção. Mesmo que um aluno esteja olhando para uma nuvem, ele ainda recebe 0,1% da atenção da turma. Isso mantém o "ruído" vivo.
  • Novo Sistema (Entmax-1.5): Este é um sistema de votação mais inteligente. Se um aluno está olhando para uma nuvem, o sistema diz: "Você recebe 0% de atenção. Você é ignorado."
    • Não impede que os alunos vejam a sala inteira (a conectividade global é mantida).
    • Apenas garante que, se uma conexão não for útil, ela seja cortada completamente (peso zero).

Pense nisso como um filtro. Em vez de deixar um pouco de informação de "cachorro" vazar para a área de "grama", o filtro bloqueia completamente. A grama permanece grama, e o cachorro permanece cachorro.

O Que Aconteceu Quando Eles Testaram?

Os pesquisadores testaram isso em um modelo padrão (DINOv1) treinado no ImageNet. Eles simplesmente trocaram o "sistema de votação" (Softmax) pelo "filtro seletivo" (Entmax-1.5) e não adicionaram nenhuma nova parte ou dados de treinamento extras.

Os Resultados:

  1. Reconhecimento Global (O "O Quê"): O modelo ficou ligeiramente melhor apenas em dizer "Isso é um cachorro". (A precisão subiu de 69,50% para 70,06%).
  2. Predição Densa (O "Onde"): O modelo ficou muito melhor em desenhar os contornos.
    • No conjunto de dados VOC (um teste padrão para limites de objetos), a pontuação saltou significativamente (de 42,80 para 48,78).
    • Também houve melhoria em outros mapas complexos como ADE20K e Cityscapes.
  3. Visuais: Quando olharam para o "mapa mental" do computador da imagem, o novo modelo tinha limites muito mais limpos e nítidos. O fundo não vazava mais para o objeto.

A Conclusão

O artigo afirma que os Vision Transformers ficam confusos ao desenhar limites porque permitem que a informação global se espalhe com muita liberdade, como um boato que se distorce à medida que passa de pessoa para pessoa.

Ao mudar para um mecanismo de atenção esparsa (Entmax-1.5), o modelo aprende a ser seletivo. Ele mantém a imagem geral em mente, mas impede que o "ruído" se espalhe para áreas onde não pertence. Isso torna o modelo melhor tanto em identificar objetos quanto em localizá-los com precisão, tudo sem precisar de uma arquitetura mais complexa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →