← Últimos artigos
🤖 AI

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

Este artigo identifica um "Viés de Contração" fundamental em formatos FP4 E2M1 não uniformes que causa instabilidade no treinamento e propõe o UFP4, uma receita de treinamento de 4 bits uniforme (E1M2/INT4) que utiliza a Transformada de Hadamard Aleatória para alcançar um desempenho de pré-treinamento superior em várias escalas de modelos em comparação com as abordagens existentes baseadas em E2M1.

Autores originais: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

Publicado 2026-06-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando construir um castelo de LEGO gigante e incrivelmente complexo (um Large Language Model). Para tornar a construção mais rápida e barata, você decide parar de usar os tijolos padrão, pesados e precisos, e mudar para um novo conjunto de tijolos ultra-leves e minúsculos de 4 bits.

O problema é que os "tijolos padrão" atuais (chamados E2M1) têm um formato estranho e desproporcional. Os autores deste artigo descobriram que esses tijolos possuem uma falha oculta: eles naturalmente encolhem as coisas ligeiramente toda vez que você os utiliza.

Aqui está o detalhamento da descoberta e da solução deles, explicados de forma simples:

1. O Problema: Os Tijolos "Encolhedores"

Pense nos tijolos E2M1 padrão como tendo um espaçamento irregular. Alguns vãos entre os tijolos são minúsculos, enquanto outros são enormes.

  • A Falha: Devido a esse espaçamento irregular, quando você tenta encaixar uma peça de dados em um desses tijolos, a matemática força o arredondamento para baixo com mais frequência do que para cima.
  • O Resultado: Isso cria um "Viés de Encolhimento" (Shrinkage Bias). É como um balde furado; toda vez que você passa uma mensagem através de uma camada do modelo, a mensagem fica um pouco menor e mais fraca.
  • O Efeito Composto: Em um modelo profundo com centenas de camadas, esse encolhimento minúsculo acontece repetidamente. Quando a mensagem chega ao final, ela encolheu tanto que o modelo começa a perder o controle (o treinamento torna-se instável).

2. A "Rotação Mágica" Que Piorou Tudo

Para resolver o problema de dados que são grandes demais ou estranhos demais (outliers), os engenheiros usam um truque chamado Transformada de Hadamard Aleatória (RHT).

  • A Analogia: Imagine que você tem uma pilha de areia onde a maior parte está em um único monte gigante (outliers). A RHT é como um misturador que gira a areia para que ela se espalhe uniformemente por toda a bandeja.
  • O Conflito: Quando você mistura a areia (RHT) e depois tenta colocá-la nos tijolos E2M1 desproporcionais, a areia cai nos piores espaços possíveis. O espaçamento irregular dos tijolos agarra a areia misturada e a encolhe ainda mais do que antes. O artigo descobriu que a receita padrão na verdade piora o problema do "balde furado" ao usar este misturador.

3. A Solução: Os "Tijolos Uniformes" (UFP4)

Os autores propõem uma nova receita chamada UFP4. Em vez de usar os tijolos E2M1 desproporcionais, eles usam um novo conjunto de tijolos chamados E1M2/INT4.

  • A Diferença: Esses novos tijolos são perfeitamente uniformes. Os vãos entre eles têm exatamente o mesmo tamanho.
  • Por que Funciona: Como os vãos são uniformes, não há "viés de encolhimento". Quando a "areia misturada" (os dados da RHT) cai nesses tijolos uniformes, ela se encaixa perfeitamente sem perder tamanho.
  • A Estratégia: Com esses novos tijolos uniformes, os autores perceberam que poderiam usar o "misturador" (RHT) em cada uma das partes do processo de construção (passagem direta, passagem reversa e atualizações de peso). Anteriormente, era preciso ter cuidado e usar o misturador em apenas um lugar para evitar quebrar o modelo. Agora, eles podem usá-lo em todo lugar.

4. A Prova

A equipe testou essa nova receita em três tamanhos diferentes de modelos de IA (pequenos, médios e enormes).

  • O Resultado: Os modelos construídos com a nova UFP4 (tijolos uniformes) ficaram muito mais próximos do desempenho dos tijolos pesados e padrão (BF16) do que os modelos construídos com os antigos E2M1 (tijolos desproporcionais).
  • A Conclusão: A grade "uniforme" permite que o modelo treine por mais tempo e de forma mais estável, sem perder seu sinal.

Resumo

O artigo argumenta que a indústria tem tentado consertar um balde furado remendando os buracos, mas o balde em si tem o formato errado. Ao mudar para um balde com espaçamento perfeitamente uniforme (Grades Uniformes), eles podem finalmente usar as poderosas ferramentas de mistura (RHT) que eram perigosas anteriormente, levando a um treinamento de IA mais rápido, barato e estável.

O Ponto Principal: Não tente apenas remendar o antigo formato de 4 bits desproporcional; mude para um novo formato de 4 bits uniforme para impedir que o sinal encolha e desapareça.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →