← Últimos artigos
🤖 machine learning

Pretraining large language models with MXFP4

Este artigo identifica que a quantização dos gradientes de peso (Wgrad) é a principal causa de instabilidade no treinamento de modelos de linguagem grandes em FP4 de pipeline completo e demonstra que rotações Hadamard determinísticas, e não arredondamento estocástico, são essenciais para restaurar a estabilidade da convergência.

Autores originais: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um estudante gigante e brilhante (um Modelo de Linguagem de Grande Escala) a escrever histórias. Normalmente, para manter esse estudante aprendendo de forma eficaz, você lhe dá anotações escritas com tinta de alta qualidade e detalhada (chamada precisão FP8). Isso funciona bem, mas as anotações são pesadas, ocupando muito espaço na mochila do estudante e diminuindo a velocidade com que ele pode lê-las.

Os pesquisadores quiseram ver se poderiam mudar para anotações ultra-leves escritas com apenas 4 bits de informação (MXFP4). Essas anotações são minúsculas e rápidas, prometendo fazer o estudante aprender muito mais rápido. No entanto, há uma pegadinha: quando tentaram usar essas anotações minúsculas para todo o processo de aprendizado, o estudante frequentemente ficava confuso, começava a fazer palpites selvagens e falhava em aprender qualquer coisa (o treinamento "divergia").

O artigo pergunta: Por que isso acontece e como corrigimos isso?

O Experimento: Um Teste de Três Etapas

Os pesquisadores montaram um experimento controlado para descobrir exatamente onde está o problema. Eles dividiram o processo de aprendizado em três etapas e trocaram gradualmente as anotações pesadas pelas leves, uma etapa de cada vez:

  1. Passagem Forward (Fprop): O estudante lê a pergunta.
  2. Gradientes de Ativação (Dgrad): O estudante descobre o quanto mal-entendeu a pergunta.
  3. Gradientes de Peso (Wgrad): O estudante atualiza seu cérebro (os "pesos") para lembrar da lição para a próxima vez.

As Descobertas:

  • Etapa 1 e 2: Quando usaram anotações leves apenas para ler e descobrir mal-entendidos, o estudante se saiu bem. Aprendeu quase tão bem quanto com as anotações pesadas, precisando apenas de algumas perguntas extras de prática.
  • Etapa 3 (O Problema): No momento em que trocaram para anotações leves para atualizar o cérebro (Wgrad), o estudante começou a sair do controle. Os pesquisadores descobriram que essa etapa específica é o "elo fraco". É como tentar escrever uma correção matemática complexa em um pedaço de papel minúsculo e amassado; os detalhes se perdem e o estudante aprende a lição errada.

As Corrigas Falhas: Adicionando Aleatoriedade

Quando o estudante começou a falhar, os pesquisadores tentaram um truque comum: Estocasticidade (adicionar aleatoriedade).

  • A Analogia: Imagine que o estudante está confuso, então você diz a ele: "Apenas chute aleatoriamente!" ou "Gire uma roda para decidir sua resposta."
  • O Resultado: Isso não funcionou. Na verdade, adicionar aleatoriedade às anotações minúsculas piorou os erros. O "ruído" dos palpites aleatórios amplificou os pequenos erros já presentes nas anotações leves, fazendo com que o treinamento colapsasse completamente.

A Correção Vencedora: A Embaralhamento Determinístico

Os pesquisadores então tentaram uma abordagem diferente: Rotações Hadamard Determinísticas.

  • A Analogia: Em vez de chutar aleatoriamente, imagine que o estudante tem uma régua especial e rígida que reorganiza perfeitamente as anotações minúsculas antes que elas sejam escritas. Essa régua não adiciona aleatoriedade; ela simplesmente organiza a informação de uma maneira específica e previsível, para que as anotações minúsculas não fiquem amassadas ou perdidas.
  • O Resultado: Isso funcionou perfeitamente. Ao usar esse método específico e previsível de "reorganização", o estudante pôde usar as anotações minúsculas e rápidas para todo o processo (ler, analisar e atualizar) sem ficar confuso.

A Conclusão

O artigo conclui com duas principais conclusões:

  1. O Gargalo: A principal razão pela qual o treinamento de 4 bits falha não é porque as anotações são geralmente pequenas demais; é especificamente porque a etapa de atualização do cérebro (Wgrad) é muito sensível aos pequenos erros nessas anotações.
  2. A Solução: Para fazer o treinamento de 4 bits funcionar, você não precisa adicionar mais aleatoriedade. Você precisa de estrutura. Ao usar um embaralhamento matemático específico e previsível (rotação Hadamard), você pode estabilizar o processo.

O Retorno:
Quando corrigiram o problema com essa "régua de reorganização", o sistema ficou 20% mais rápido em cada etapa de aprendizado. Como o estudante aprendeu de forma estável sem precisar de perguntas extras de prática, todo o processo foi concluído cerca de 10% mais rápido do início ao fim, comparado ao antigo método de tinta pesada.

Em resumo: você pode usar as anotações super-rápidas e minúsculas, mas apenas se as organizar perfeitamente antes de escrevê-las. Se você apenas adicionar algo de aleatoriedade, isso quebra tudo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →