On the Principles Behind Neural Network Optimizers
Este artigo fornece uma fundamentação teórica fundamentada para o otimizador Adam ao resolver seu debate de convergência, explicar sua superioridade sobre o SGD em Transformers por meio de estruturas de Hessiana em evolução e aproveitar esses insights para introduzir o Adam-mini, um novo otimizador que reduz o uso de memória pela metade enquanto mantém o desempenho.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A inteligência artificial moderna depende de um delicado ato de equilíbrio. Para ensinar um computador a reconhecer um gato em uma foto ou a escrever uma história coerente, os pesquisadores devem guiar um sistema matemático massivo através de uma paisagem de erros, ajustando constantemente suas configurações internas para encontrar o ponto mais baixo. Esse processo é chamado de treinamento, e a ferramenta usada para navegar nesse terreno é um otimizador. Durante anos, o padrão da indústria tem sido um algoritmo chamado Adam. Ele é o motor padrão para os modelos de linguagem mais poderosos, aqueles que podem escrever código, traduzir idiomas e manter conversas. No entanto, apesar de sua ubiquidade, o fundamento matemático do Adam era instável. Por quase uma década, um famoso resultado teórico sugeriu que o Adam poderia falhar catastroficamente, saindo de controle mesmo em problemas simples. Isso criou um paradoxo: a ferramenta que impulsiona a IA mais avançada era teoricamente quebrada, mas funcionava perfeitamente na prática. Os pesquisadores ficaram se perguntando por que a teoria não correspondia à realidade e se a ferramenta na qual confiavam era verdadeiramente segura.
Uma nova tese de doutorado de Yushun Zhang, da Universidade de Hong Kong para Ciência e Tecnologia, Shenzhen, resolve esse paradoxo ao olhar para o problema sob um novo ângulo. O trabalho não apenas corrige a teoria; ele reexamina a própria natureza dos problemas que esses modelos resolvem. O pesquisador descobriu que o medo de que o Adam falhasse baseava-se em uma configuração específica e artificial que não reflete como o treinamento no mundo real realmente acontece. Ao mudar a perspectiva para focar no tamanho dos blocos de dados usados durante o treinamento, o estudo prova que o Adam é, de fato, seguro, desde que suas configurações sejam ajustadas corretamente para a tarefa específica. Mais importante ainda, a tese revela uma estrutura geométrica oculta nos dados das redes neurais modernas. Essa estrutura explica por que o Adam supera seus rivais em tarefas complexas, como o treinamento de grandes modelos de linguagem, enquanto falha em tarefas mais simples. Acontece que o cenário interno desses modelos não é uma bagunça caótica, mas sim uma coleção de blocos distintos e organizados. Reconhecer esse padrão permitiu ao pesquisador projetar um novo otimizador mais eficiente, chamado Adam-mini, que reduz pela metade a memória necessária para treinar esses modelos massivos sem sacrificar o desempenho.
A história começa com o debate de longa data sobre se o Adam é confiável. Durante anos, um artigo amplamente citado afirmou que o Adam poderia divergir, o que significa que o processo de treinamento fugiria para o infinito em vez de se estabilizar. Essa afirmação baseou-se em um exemplo matemático específico onde o algoritmo foi testado em um problema que mudava suas regras dependendo das configurações do algoritmo. No mundo real, no entanto, os pesquisadores não mudam o problema para se ajustar à ferramenta; eles fixam o problema e ajustam a ferramenta para se ajustar a ele. O trabalho de Zhang mostra que, quando o problema é fixo, como ocorre no treinamento real, o Adam não diverge. Em vez disso, ele exibe uma clara transição de fase: se as configurações forem mal escolhidas, ele pode falhar, mas se forem escolhidas corretamente, ele converge com segurança. A chave para essa segurança reside em uma configuração específica que controla quanto peso o algoritmo dá às informações passadas. O estudo prova que, para conjuntos de dados maiores, essa configuração deve ser mais alta para garantir a estabilidade. Essa descoberta alinha-se com o que os engenheiros observaram na prática: ao treinar grandes modelos de linguagem com pequenos lotes de dados, aumentar essa configuração evita que o treinamento colapse. A tese fornece a primeira prova matemática rigorosa de que a versão padrão do Adam, sem quaisquer modificações, é segura para uso quando devidamente ajustada.
Tendo estabelecido que o Adam é seguro, a pesquisa volta-se para uma questão mais intrigante: por que ele funciona muito melhor do que seu principal concorrente, o SGD, em modelos complexos como os Transformers, enquanto apresenta um desempenho inferior em modelos mais simples? Para responder a isso, o pesquisador examinou a forma da paisagem de erro, especificamente um objeto matemático chamado Hessiana, que descreve como o erro muda em cada direção. Em problemas simples, essa paisidade é densa e emaranhada, como uma floresta espessa onde cada caminho está conectado a todos os outros. Em tais ambientes, a estratégia do Adam de ajustar cada configuração individualmente é ineficiente. No entanto, quando o pesquisador examinou a Hessiana de redes neurais profundas e Transformers, um padrão surpreendente emergiu. À medida que o treinamento progredia, a paisagem complexa e emaranhada simplificava-se em uma estrutura de blocos distintos e separados. Imagine uma planilha vasta onde, em vez de cada célula influenciar todas as outras, a influência é confinada a linhas e colas específicas. Nessas redes, os parâmetros que controlam um neurônio de saída específico ou uma cabeça de atenção específica formam seu próprio grupo isolado.
Essa estrutura em blocos é o segredo do sucesso do Adam. Como a paisagem é dividida em blocos independentes, o método do Adam de atribuir uma taxa de aprendizado única para cada parâmetro torna-se altamente eficaz. Ele pode ajustar as configurações de um bloco sem estragar acidentalmente as configurações de outro. Em contraste, otimizadores mais simples como o SGD aplicam uma única taxa de aprendizado a todo o sistema, o que dificulta lidar com as diferentes velocidades e escalas desses diferentes blocos. O estudo revelou ainda que essa estrutura em blocos não é uma coincidência; ela surge naturalmente da maneira como essas redes são construídas, especificamente da multiplicação consecutiva de grandes matrizes durante o processo de cálculo. À medida que a rede treina, as conexões entre partes distantes do sistema desaparecem, deixando para trás esses blocos limpos e separados. Esse insight explica por que o Adam é o motor de escolha para a IA moderna: os problemas que ele resolve possuem uma geometria oculta que combina perfeitamente com o design do otimizador.
Armado com esse entendimento da estrutura oculta em blocos, o pesquisador desenvolveu um novo otimizador chamado Adam-mini. O algoritmo Adam padrão consome muita memória porque mantém o controle de uma taxa de aprendizado única para cada um dos parâmetros do modelo. Para um modelo de linguagem massivo, isso exige o armazenamento de o dobro de dados do que o próprio modelo, criando um gargalo que retarda o treinamento e limita o tamanho dos modelos que podem ser executados no hardware disponível. O novo insight foi que, como os parâmetros estão organizados em blocos, não precisamos de uma taxa de aprendizado única para cada um deles. Em vez disso, podemos atribuir uma taxa de aprendizado para cada bloco inteiro. Essa mudança simples reduz a pegada de memória em 50 por cento. O novo otimizador, Adam-mini, agrupa os parâmetros por sua estrutura natural de blocos — agrupando por linhas para a maioria das camadas e por cabeças de atenção para partes específicas da rede — e aplica uma única taxa de aprendizado a cada grupo.
Os resultados desse redesenho são imediatos e práticos. Em testes treinando modelos que variam de 39 milhões a um bilhão de parâmetros, o Adam-mini igualou o desempenho do otimizador Adam padrão utilizando metade da memória. Essa eficiência permite que pesquisadores treinem modelos maiores no mesmo hardware ou treinem modelos existentes de forma mais rápida. A abordagem já foi adotada por grandes laboratórios de IA, incluindo a DeepSeek e a equipe por trás do modelo Kimi K3, que utilizam uma variação deste método para treinar seus sistemas de próxima geração. A tese também mostrou que este princípio de taxas de aprendizado por blocos pode ser aplicado a outros otimizadores avançados, melhorando sua eficiência sem alterar sua lógica central. Ao revelar a geometria oculta do treinamento de redes neurais, este trabalho moveu o campo de um lugar de incerteza e tentativa e erro para um de design fundamentado. Ele demonstra que as ferramentas mais eficazes para a inteligência artificial não são apenas palpites de sorte, mas algoritmos que são perfeitamente ajustados à estrutura matemática específica dos problemas que resolvem.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.