← Últimos artigos
🤖 machine learning

Normalized Architectures are Natively 4-Bit

Este artigo demonstra que o nGPT, uma arquitetura que restringe pesos e estados ocultos a uma hipersfera unitária, permite treinamento estável e eficiente de ponta a ponta em 4 bits ao aprimorar naturalmente as razões sinal-ruído por meio da acumulação construtiva de sinais, eliminando assim a necessidade de intervenções complexas para preservação de precisão.

Autores originais: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: Decifrando o Código com Baixa Precisão

Imagine que você está tentando construir um castelo de Lego massivo e incrivelmente complexo (um Modelo de Linguagem de Grande Escala). Normalmente, você usa blocos gigantes e robustos (matemática de alta precisão) para garantir que o castelo permaneça em pé e não desmorone.

No entanto, para tornar o castelo mais rápido de construir e mais barato de armazenar, os engenheiros querem usar blocos de Lego minúsculos e frágeis de 4 bits. O problema é que, ao usar esses blocos minúsculos com designs padrão, o castelo frequentemente desaba ou fica instável. Para corrigir isso, os construtores geralmente precisam adicionar andaimes caros, cola extra e ferramentas de medição complexas (como "Transformadas de Hadamard Randomizadas" e "escalamento por tensor") apenas para manter a estrutura de cair. Esses reparos deixam tudo mais lento.

A Solução: Um Novo Projeto (nGPT)

Este artigo apresenta um novo projeto chamado nGPT. Em vez de tentar consertar os blocos frágeis de 4 bits com cola extra, os autores mudaram a forma dos próprios blocos.

No nGPT, cada peça do modelo é forçada a permanecer em uma "hiperesfera unitária".

  • A Analogia: Imagine que um bloco de Lego padrão pode ter qualquer tamanho, desde um seixo minúsculo até um bloco gigante. Isso torna difícil empilhá-los de forma organizada se todos forem minúsculos.
  • O Toque do nGPT: No nGPT, cada bloco é forçado a ter exatamente o mesmo tamanho e forma, como uma esfera perfeita. Todos estão restritos a ficar na superfície de uma esfera invisível.

O artigo afirma que, devido a essa restrição de forma, o modelo é nativamente robusto. Ele pode ser construído inteiramente com os blocos minúsculos de 4 bits sem precisar de nenhum andaime ou cola extra. Simplesmente funciona.

Por Que Funciona? O Efeito "Coral"

Os pesquisadores perguntaram: Por que essa forma esférica torna o modelo tão forte?

Eles analisaram como o modelo faz matemática. Ele faz isso pegando milhares de números, multiplicando-os e somando-os todos (um "produto escalar").

  1. O Jeito Padrão (GPT): Imagine um coral de 4.000 cantores. Em um modelo padrão, os cantores estão todos cantando notas diferentes em volumes diferentes. Quando você os soma, o ruído (erros feitos pelos blocos minúsculos de 4 bits) se cancela, mas a música real (o sinal) se perde no caos. O sinal é fraco.
  2. O Jeito nGPT: Como todos os cantores (números) são forçados a ter o mesmo tamanho (na esfera), eles naturalmente começam a cantar de uma maneira levemente coordenada. Eles não estão perfeitamente sincronizados, mas têm uma correlação positiva fraca.
    • A Analogia: É como uma multidão fazendo "A Onda" em um estádio. Mesmo que a onda seja pequena, como todos estão se movendo na mesma direção geral, a onda se acumula em um movimento enorme e poderoso.
    • O Resultado: No nGPT, o "sinal" (a matemática pretendida) se acumula de forma construtiva, como uma onda coordenada. O "ruído" (os erros dos blocos minúsculos) ainda se cancela como conversas aleatórias.

Isso cria um sinal muito mais claro. O artigo chama isso de maior Relação Sinal-Ruído (SNR).

O Benefício da "Paisagem Plana"

Como o sinal é tão forte e claro, o modelo torna-se muito estável.

  • A Analogia: Imagine caminhar em uma montanha.
    • Modelo Padrão: É como caminhar em um penhasco irregular e rochoso. Se você der um passo ligeiramente errado (uma taxa de aprendizado ruim ou um pequeno erro matemático), pode cair de uma borda. Você precisa ter muito cuidado.
    • Modelo nGPT: É como caminhar em um planalto largo e plano. Você pode dar passos grandes ou pequenos, e não vai cair. Você pode caminhar em qualquer direção sem se preocupar em colidir.

Isso significa que os engenheiros não precisam passar horas ajustando a "taxa de aprendizado" (a velocidade com que o modelo aprende). As configurações que funcionam para os blocos grandes e pesados também funcionam perfeitamente para os blocos minúsculos de 4 bits.

O Que Eles Testaram

Os autores não apenas falaram sobre teoria; eles construíram e testaram esses modelos:

  • Escala Pequena: Eles testaram um modelo de 1,2 bilhão de parâmetros.
  • Escala Grande: Eles testaram modelos massivos "Mistura de Especialistas" com até 30 bilhões de parâmetros.
  • O Resultado: Em todos os casos, os modelos nGPT foram treinados com sucesso usando apenas matemática de 4 bits. Eles não precisaram da "cola" extra (RHT ou escalamento) que os modelos padrão exigem. Na verdade, os modelos nGPT foram frequentemente mais precisos e rápidos porque não precisavam fazer o trabalho extra para corrigir os erros matemáticos.

A Conclusão

O artigo argumenta que não devemos apenas tentar consertar a matemática de baixa precisão com correções complicadas. Em vez disso, devemos projetar a própria arquitetura para estar "pronta para quantização". Ao forçar o modelo a uma forma esférica, a matemática naturalmente se torna robusta o suficiente para lidar com os blocos minúsculos de 4 bits, tornando a IA mais rápida, mais barata e mais fácil de treinar sem perder qualidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →