Pretraining large language models with MXFP4
Este artigo identifica que a quantização dos gradientes de peso (Wgrad) é a principal causa de instabilidade no treinamento de modelos de linguagem grandes em FP4 de pipeline completo e demonstra que rotações Hadamard determinísticas, e não arredondamento estocástico, são essenciais para restaurar a estabilidade da convergência.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um estudante gigante e brilhante (um Modelo de Linguagem de Grande Escala) a escrever histórias. Normalmente, para manter esse estudante aprendendo de forma eficaz, você lhe dá anotações escritas com tinta de alta qualidade e detalhada (chamada precisão FP8). Isso funciona bem, mas as anotações são pesadas, ocupando muito espaço na mochila do estudante e diminuindo a velocidade com que ele pode lê-las.
Os pesquisadores quiseram ver se poderiam mudar para anotações ultra-leves escritas com apenas 4 bits de informação (MXFP4). Essas anotações são minúsculas e rápidas, prometendo fazer o estudante aprender muito mais rápido. No entanto, há uma pegadinha: quando tentaram usar essas anotações minúsculas para todo o processo de aprendizado, o estudante frequentemente ficava confuso, começava a fazer palpites selvagens e falhava em aprender qualquer coisa (o treinamento "divergia").
O artigo pergunta: Por que isso acontece e como corrigimos isso?
O Experimento: Um Teste de Três Etapas
Os pesquisadores montaram um experimento controlado para descobrir exatamente onde está o problema. Eles dividiram o processo de aprendizado em três etapas e trocaram gradualmente as anotações pesadas pelas leves, uma etapa de cada vez:
- Passagem Forward (Fprop): O estudante lê a pergunta.
- Gradientes de Ativação (Dgrad): O estudante descobre o quanto mal-entendeu a pergunta.
- Gradientes de Peso (Wgrad): O estudante atualiza seu cérebro (os "pesos") para lembrar da lição para a próxima vez.
As Descobertas:
- Etapa 1 e 2: Quando usaram anotações leves apenas para ler e descobrir mal-entendidos, o estudante se saiu bem. Aprendeu quase tão bem quanto com as anotações pesadas, precisando apenas de algumas perguntas extras de prática.
- Etapa 3 (O Problema): No momento em que trocaram para anotações leves para atualizar o cérebro (Wgrad), o estudante começou a sair do controle. Os pesquisadores descobriram que essa etapa específica é o "elo fraco". É como tentar escrever uma correção matemática complexa em um pedaço de papel minúsculo e amassado; os detalhes se perdem e o estudante aprende a lição errada.
As Corrigas Falhas: Adicionando Aleatoriedade
Quando o estudante começou a falhar, os pesquisadores tentaram um truque comum: Estocasticidade (adicionar aleatoriedade).
- A Analogia: Imagine que o estudante está confuso, então você diz a ele: "Apenas chute aleatoriamente!" ou "Gire uma roda para decidir sua resposta."
- O Resultado: Isso não funcionou. Na verdade, adicionar aleatoriedade às anotações minúsculas piorou os erros. O "ruído" dos palpites aleatórios amplificou os pequenos erros já presentes nas anotações leves, fazendo com que o treinamento colapsasse completamente.
A Correção Vencedora: A Embaralhamento Determinístico
Os pesquisadores então tentaram uma abordagem diferente: Rotações Hadamard Determinísticas.
- A Analogia: Em vez de chutar aleatoriamente, imagine que o estudante tem uma régua especial e rígida que reorganiza perfeitamente as anotações minúsculas antes que elas sejam escritas. Essa régua não adiciona aleatoriedade; ela simplesmente organiza a informação de uma maneira específica e previsível, para que as anotações minúsculas não fiquem amassadas ou perdidas.
- O Resultado: Isso funcionou perfeitamente. Ao usar esse método específico e previsível de "reorganização", o estudante pôde usar as anotações minúsculas e rápidas para todo o processo (ler, analisar e atualizar) sem ficar confuso.
A Conclusão
O artigo conclui com duas principais conclusões:
- O Gargalo: A principal razão pela qual o treinamento de 4 bits falha não é porque as anotações são geralmente pequenas demais; é especificamente porque a etapa de atualização do cérebro (Wgrad) é muito sensível aos pequenos erros nessas anotações.
- A Solução: Para fazer o treinamento de 4 bits funcionar, você não precisa adicionar mais aleatoriedade. Você precisa de estrutura. Ao usar um embaralhamento matemático específico e previsível (rotação Hadamard), você pode estabilizar o processo.
O Retorno:
Quando corrigiram o problema com essa "régua de reorganização", o sistema ficou 20% mais rápido em cada etapa de aprendizado. Como o estudante aprendeu de forma estável sem precisar de perguntas extras de prática, todo o processo foi concluído cerca de 10% mais rápido do início ao fim, comparado ao antigo método de tinta pesada.
Em resumo: você pode usar as anotações super-rápidas e minúsculas, mas apenas se as organizar perfeitamente antes de escrevê-las. Se você apenas adicionar algo de aleatoriedade, isso quebra tudo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.