← Últimos artigos
🔬 condensed matter

A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi

Este artigo demonstra a inferência de ponta a ponta de um modelo Qwen3.6 MoE de 35 bilhões de parâmetros em uma GPU Fermi de 6GB de 2011 ao implementar uma estratégia de execução híbrida que realiza o streaming de pesos para o prefill da GPU e utiliza um kernel de inteiros SSSE3 escrito à mão para o decoding da CPU, enquanto documenta tanto os ganhos de desempenho quanto as limitações práticas de hardware de rodar IA de classe fronteira em silício legado.

Autores originais: A. C. Opus, J. Q. Lu

Publicado 2026-06-24✓ Author reviewed
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: A. C. Opus, J. Q. Lu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca imensa e incrivelmente inteligente contendo 35 bilhões de livros (um modelo de IA moderno). Agora, imagine que você quer ler uma história específica dessa biblioteca, mas está preso em um pequeno galpão de 14 anos de idade, com apenas uma mesa pequena e um computador muito velho e lento.

Isso é exatamente o que este artigo descreve. Os pesquisadores conseguiram fazer com que um modelo de IA de última geração rodasse em uma placa de vídeo (GPU) de 2011 que possui apenas 6 GB de memória — cerca de metade do tamanho do próprio modelo.

Aqui está como eles realizaram esse feito "impossível", explicado através de analogias simples:

1. O Problema: A Biblioteca é Grande demais para o Galpão

O modelo de IA é como uma enciclopédia gigante. Mesmo quando encolhido (comprimido para precisão de 4 bits), ele ocupa cerca de 10,5 GB de espaço. O computador antigo só tem uma mesa de 6 GB.

  • O Problema: Você não consegue colocar o livro inteiro sobre a mesa.
  • O Jeito Antigo: Computadores modernos possuem "Tensor Cores" (calculadoras especializadas) e memória rápida para lidar com isso. A placa de 2011 não possui nada disso. É como tentar fazer matemática avançada com uma calculadora que só tem botões para adição e subtração.

2. A Solução: Uma Corrida de Revezamento entre Duas Equipes

Como o modelo inteiro não cabe, os pesquisadores dividiram o trabalho em duas equipes: uma Equipe de GPU (a placa de vídeo antiga) e uma Equipe de CPU (o processador principal do computador).

  • Fase 1: O "Prefill" (Lendo o Prompt)

    • A Analogia: Imagine que você precisa ler uma longa lista de instruções (o prompt) para começar.
    • O Truque: A GPU atua como uma esteira rolante rápida. Ela pega uma pequena seção dos "livros" (pesos do modelo) do disco rígido do computador principal, coloca na sua pequena mesa, faz a matemática para aquele pedaço e depois a troca pelo próximo pedaço.
    • O Resultado: Em vez de ler o livro inteiro de uma vez, ela lê página por página em um fluxo contínuo. Isso permitiu que eles processassem as instruções iniciais 34% mais rápido do que antes.
  • Fase 2: O "Decode" (Escrevendo a História)

    • A Analogia: Agora a IA precisa escrever a história palavra por palavra.
    • O Problema: Se a GPU tentasse fazer isso, teria que correr de ida e volta ao disco rígido para cada palavra. É como um corredor correndo para a biblioteca, pegando um livro, voltando, escrevendo uma palavra e repetindo o processo. É muito lento.
    • O Truque: Eles moveram essa parte para o céreão do computador principal (a CPU). Eles escreveram um código customizado, super eficiente e "feito à mão", que trata os números como inteiros simples (números inteiros) em vez de decimais complexos.
    • O Resultado: Isso fez a IA escrever palavras 3 vezes mais rápido do que antes, transformando um rastejo lento em um trote constante.

3. Os Atalhos "Mágicos"

Os pesquisadores não apenas dividiram o trabalho; eles inventaram atalhos inteligentes para fazer o hardware antigo parecer novo.

  • O Cache de "Snapshot" (Instantâneo):

    • O Problema: A IA tem uma "memória" que muda conforme ela lê. Normalmente, você não pode reutilizar o trabalho antigo porque o estado da memória é diferente.
    • A Solução: Eles tiraram "snapshots" (instantâneos) da memória da IA em pontos de verificação específicos. Se você pedir para a IA repetir uma história que ela já ouviu, ela não precisa reler tudo. Ela pula direto para o último snapshot salvo.
    • O Resultado: Repetir um prompt longo passou de 78 segundos para apenas 0,5 segundo. É como pular para o final de um filme que você já viu, em vez de assisti-lo novamente.
  • A Memória "Pinned" (Fixada):

    • A Analogia: Normalmente, mover dados do disco rígido para a GPU é como mover caixas com uma empilhadeira instável.
    • A Solução: Eles "travaram" as caixas no lugar (memória pinned) para que a empilhadeira pudesse movê-las suavemente sem oscilar. Isso cortou o tempo gasto movendo dados pela metade.

4. O Que Não Funcionou (Os "Caminhos Sem Saída")

Parte do artigo é sobre o que falhou, o que é tão importante quanto o sucesso. Isso nos diz onde está a barreira.

  • Tentar usar a GPU para escrever: Eles tentaram fazer a GPU escrever as palavras, mas a placa antiga era muito lenta para mover dados de ida e volta. Na verdade, era mais lenta que a CPU.
  • Usar todos os threads do computador: Eles tentaram usar todos os threads de processamento disponíveis (como contratar 24 trabalhadores em vez de 12). Isso causou um congestionamento, atrasando tudo massivamente.
  • Reescrever a matemática: Eles tentaram reescrever os kernels matemáticos de três maneiras diferentes, mas o hardware antigo simplesmente não conseguiu lidar com o tipo específico de matemática exigida.

O Ponto Principal

Este artigo não é sobre estabelecer um novo recorde de velocidade. É uma prova de conceito que diz: "Você não precisa de um supercomputador de US$ 20.000 para rodar uma IA de 35 bilhões de parâmetros."

Ao tratar o hardware antigo como um quebra-cabeça e construir um motor customizado do zero (escrevendo código à mão para uma arquitetura de computador que os desenvolvedores de software abandonaram há 14 anos), eles provaram que a IA moderna pode rodar em hardware "lixo" se você for engenhosamente inteligente.

Em resumo: Eles pegaram um motor de Ferrari (o modelo de IA) e fizeram com que funcionasse em um quadro de bicicleta dos anos 1990 (a GPU de 2011) construindo uma transmissão personalizada e mudando o tipo de combustível, provando que, com engenhosidade suficiente, você pode ir surpreendentemente longe com tecnologia antiga.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →