← Últimos artigos
🤖 machine learning

Accelerating Vision Transformers with Adaptive Patch Sizes

O artigo apresenta os Adaptive Patch Transformers (APT), um método que acelera significativamente o treinamento e a inferência de Vision Transformers ao utilizar tamanhos de patch adaptativos conforme a complexidade da imagem, reduzindo o número de tokens sem comprometer o desempenho em tarefas visuais de alta resolução.

Autores originais: Rohan Choudhury, JungEun Kim, Jinhyung Park, Eunho Yang, László A. Jeni, Kris M. Kitani

Publicado 2026-04-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Rohan Choudhury, JungEun Kim, Jinhyung Park, Eunho Yang, László A. Jeni, Kris M. Kitani

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando descrever uma paisagem complexa para um amigo, mas em vez de usar palavras, você precisa dividir a imagem em pequenos quadrados (como um mosaico) e contar quantos quadrados existem.

O Vision Transformer (ViT), a tecnologia de inteligência artificial que "vê" imagens, funciona assim: ele corta a foto em quadradinhos do mesmo tamanho (como um tabuleiro de xadrez perfeito) e analisa cada um. O problema é que, para fotos de alta resolução, isso gera milhares de quadradinhos, mesmo que 80% da foto seja apenas um céu azul vazio ou uma parede branca. A IA gasta a mesma energia analisando o céu vazio que analisa o rosto detalhado de uma pessoa, o que é um desperdício enorme de tempo e bateria.

Os autores deste paper (publicado no ICLR 2026) criaram uma solução inteligente chamada APT (Adaptive Patch Transformer). Vamos entender como funciona com algumas analogias do dia a dia:

1. O Problema: O "Corte de Pizza" Igualitário

Imagine que você tem uma pizza gigante.

  • O jeito antigo (ViT tradicional): Você corta a pizza em 100 fatias do mesmo tamanho, não importa se uma fatia tem apenas queijo e outra tem pepperoni, cogumelos e azeitonas. Você precisa mastigar e processar todas as 100 fatias com o mesmo esforço.
  • O resultado: Se a pizza tem muita borda de massa (áreas vazias), você está gastando tempo mastigando coisas que não têm sabor.

2. A Solução da APT: O "Corte Inteligente"

A APT olha para a foto e decide: "Onde é chato e repetitivo, vou fazer fatias grandes. Onde é cheio de detalhes, vou fazer fatias minúsculas."

  • Áreas Simples (Céu, paredes, água calma): A IA usa fatias gigantes. Em vez de 100 quadradinhos para o céu, ela usa apenas 2 ou 3 fatias grandes. É como dizer: "Ah, isso é só céu azul, não preciso de mil detalhes".
  • Áreas Complexas (Rostos, árvores, carros): A IA usa fatias minúsculas. Ela corta a parte do rosto em pedacinhos super pequenos para garantir que não perca nenhum detalhe importante.

A mágica: Ao fazer isso, a IA precisa processar muito menos "pedaços" no total. É como se você tivesse que ler um livro, mas em vez de ler cada palavra, você pulasse as páginas que só tinham espaços em branco e focasse apenas nos parágrafos cheios de história.

3. Como eles fazem isso sem perder a qualidade?

Você pode pensar: "Mas se eu cortar o céu em fatias grandes, não vou perder a cor ou a textura?"

Os autores usaram um truque de "mágica matemática":

  1. Eles olham para a "confusão" (entropia) da imagem. Se a área é calma, usam fatias grandes.
  2. Para garantir que a IA não fique "cega" nos detalhes, eles usam uma camada especial (um "tradutor") que pega a informação das fatias grandes e a combina com a informação das fatias pequenas de forma inteligente.
  3. O segredo da velocidade: Eles conseguem aplicar isso em modelos que já foram treinados. É como se você pegasse um carro de corrida pronto e trocasse apenas o sistema de direção para torná-lo mais ágil, sem precisar reconstruir o motor inteiro. O modelo se adapta em apenas 1 dia de treino (ou até menos).

4. Os Resultados: Mais Rápido, Mesmo Poderoso

Os testes mostraram que essa técnica é incrível:

  • Velocidade: O modelo fica 40% a 50% mais rápido para treinar e para fazer previsões.
  • Qualidade: A precisão não cai. O modelo continua vendo tão bem quanto antes, só que mais rápido.
  • Versatilidade: Funciona não só para classificar fotos (ex: "isso é um gato"), mas também para tarefas difíceis como:
    • Detecção de objetos: Encontrar carros e pedestres em fotos de trânsito.
    • Segmentação: Pintar cada pixel de uma foto (ex: separar o chão da parede).
    • Perguntas e Respostas: Um robô que vê uma foto e responde perguntas sobre ela.

Resumo em uma frase

A APT é como um editor de vídeo inteligente que corta os momentos chatos e lentos de um filme, deixando apenas as cenas de ação em alta definição, fazendo com que o filme inteiro seja assistido em metade do tempo, sem que você perca a história.

Isso significa que, no futuro, poderemos ter IAs mais inteligentes e rápidas rodando até em celulares, gastando menos bateria e processando imagens em alta resolução sem travar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →