← Últimos artigos
🤖 AI

Accelerating Vision Transformers on Brain Processing Unit

Este artigo propõe um novo método para acelerar Vision Transformers em Unidades de Processamento Cerebral (BPUs) otimizadas para CNN, ao reestruturar o modelo para substituir camadas lineares por operadores convolucionais, permitindo a herança de pesos sem retreinamento enquanto alcança acelerações significativas de inferência com perda mínima de precisão.

Autores originais: Jinchi Tang, Yan Guo

Publicado 2026-02-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jinchi Tang, Yan Guo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um trabalhador de fábrica especializado e super eficiente chamado BPU (Unidade de Processamento Cerebral). Este trabalhador é um mestre na montagem de blocos de Lego 4D (que representam dados de imagem padrão como altura, largura, canais de cor e lotes/batches). No mundo da inteligência artificial, ele é o especialista de referência para construir CNNs (Redes Neurais Convolucionais), que são os tradicionais "pedreiros" de visão computacional.

No entanto, um novo e revolucionário tipo de arquiteto chamado Vision Transformer (ViT) chegou. Em vez de construir com blocos de Lego 4D, o ViT trabalha com pilhas de papel 3D (sequências de dados). Ele é incrivelmente inteligente e muitas vezes produz resultados melhores, mas fala uma língua diferente. Quando você tenta contratar o trabalhador da fábrica BPU para construir um ViT, ele fica confuso. Ele foi projetado para empilhar tijolos, não para organizar pilhas de papel. Como resultado, o ViT tem que ser construído por um trabalhador muito mais lento e de propósito geral (a CPU), deixando o super-rápido BPU ocioso.

A Solução do Papel: O Truque da "Mudança de Forma"

Os autores deste artigo, Jinichi Tang e Yan Guo, criaram um contorno inteligente. Eles não tentaram ensinar o BPU a ler pilhas de papel (o que seria difícil e exigiria o retreinamento de todo o sistema). Em vez disso, eles reorganizaram as pilhas de papel para que parecessem blocos de Lego.

Eles fizeram isso usando analogias simples:

  1. O Problema da Camada Linear: Em um ViT padrão, o cérebro usa "Camadas Lineares" para processar informações. Pense nestas como um tradutor que lê uma lista de palavras e gera uma nova lista. O BPU não consegue ler listas; ele só entende grades 4D.

    • A Correção: Os autores pegaram o "tradutor" e remodelaram suas instruções para que pareçam um bloco de Lego 1x1. Matematicamente, faz exatamente o mesmo trabalho, mas agora se encaixa perfeitamente na fábrica do BPU. É como pegar um mapa plano e enrolá-lo em um cilindro apenas para que caiba em um tubo específico, sem alterar o conteúdo do mapa.
  2. O Problema da Normalização de Camada: O ViT também usa uma etapa chamada "Normalização de Camada" para manter seus dados equilibrados (como um termostato mantendo um quarto na temperatura certa). O BPU não possui um termostato integrado.

    • A Correção: Os autores construíram um "termostato" usando os blocos de Lego existentes do BPU. Eles criaram uma cadeia especial de pequenos blocos (convoluções 1x1) que calcula a média e a variância, efetivamente mimetizando o termostato usando apenas as ferramentas que o BPU já possui.

A Magia do "Sem Retreinamento"

Normalmente, se você altera a planta de um edifício, precisa derrubá-lo e reconstruí-lo do zero. Mas como os autores foram tão cuidadosos para fazer com que seus "blocos de Lego" fossem matematicamente idênticos às "pilhas de papel" originais, as plantas originais (pesos) ainda funcionam perfeitamente.

Eles não precisaram retreinar o modelo ou ensinar coisas novas. Eles simplesmente pegaram o modelo "DeiT" pré-treinado (uma versão popular e eficiente do ViT), aplicaram seu truque de mudança de forma e o entregaram ao BPU. O BPU reconheceu imediatamente o novo formato e começou a trabalhar em velocidade total.

Os Resultados: Velocidade vs. Precisão

A equipe testou isso em duas tarefas diferentes: reconhecer milhares de objetos (ImageNet) e classificar flores.

  • A Troca: Quando você converte um modelo para rodar neste hardware especializado, geralmente perde um pouco de precisão (como mudar de uma foto de alta definição para um JPEG levemente comprimido).
    • No grande teste ImageNet, o modelo DeiT-Base caiu apenas 1,4% em precisão (de 81,8% para 80,4%).
    • No teste de flores, a queda foi ainda menor, apenas 0,5%.
  • A Recompensa: Em troca dessa pequena queda na precisão, o modelo tornou-se muito mais rápido.
    • O maior modelo (DeiT-Base) rodou 3,8 vezes mais rápido no BPU do que rodava na CPU padrão.
    • Os modelos menores também viram acelerações, variando de 1,3x a 2,1x.

Uma Descoberta Engraçada

Durante os testes, os autores notaram algo interessante. Às vezes, os rótulos oficiais nas imagens de teste estavam errados (por exemplo, uma foto de um "leão" estava rotulada como "macaco"). O modelo DeiT original identificou corretamente o leão, mas o sistema marcou como um erro devido ao rótulo incorreto. O novo modelo rápido dos autores também identificou corretamente o leão. Isso sugere que o modelo é, na verdade, ainda mais inteligente do que as pontuações oficiais sugerem, pois ele consegue enxergar através dos "erros de digitação" nos dados de teste.

Em Resumo

Este artigo é a primeira vez que alguém consegue pegar um Vision Transformer (o arquiteto de "pilhas de papel") e fazê-lo rodar em uma Unidade de Processamento Cerebral especializada (a fábrica de "Lego") sem precisar reconstruir o arquiteto do zero. Ao remodelar habilmente a matemática para caber no hardware, eles alcançaram um aumento de velocidade de 3,8x com quase nenhuma perda de inteligência, provando que esses modelos de IA avançados podem finalmente rodar eficientemente em chips especializados e embarcados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →