← Últimos artigos
🤖 machine learning

Beyond a Single Explanation of the Adam--SGD Gap

Através de um estudo empírico controlado em diversos domínios, este artigo demonstra que a lacuna de desempenho entre Adam e SGD surge de interações complexas entre dados e arquitetura, em vez de um único fator, mas é consistentemente caracterizada por um "tamanho de lote de cruzamento" teórico onde a vantagem relativa muda de SGD para Adam conforme o tamanho do lote escala.

Autores originais: Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni, Jun Pang, Aurelien Lucchi, Antonio Orvieto

Publicado 2026-06-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chenxiang Zhang, Rustem Islamov, Enea Monzio Compagnoni, Jun Pang, Aurelien Lucchi, Antonio Orvieto

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ensinar um robô a aprender uma nova habilidade, como escrever uma história ou reconhecer um gato em uma foto. Para fazer isso, você precisa de um "professor" (um otimizador) para guiar o processo de aprendizado do robô. Por muito tempo, houve dois professores principais: SGD (um professor constante e tradicional) e Adam (um professor moderno e adaptativo).

Por anos, pesquisadores discutiram sobre qual professor é melhor. Alguns disseram que o Adam vence porque dos dados (como as palavras são usadas na linguagem). Outros disseram que o Adam vence por causa da arquitetura (o design específico do cérebro do robô). Alguns disseram que era sobre o tamanho do lote (quantos exemplos o robô vê de uma só vez).

Este artigo é como um experimento massivo e controlado onde os pesquisadores colocaram todas essas teorias à prova através de diferentes mundos: linguagem, visão, genômica (DNA) e grafos. Aqui está o que eles descobriram, explicado de forma simples:

1. Não existe uma "Bala Mágica" única

A principal conclusão é que nenhum fator único explica por que o Adam é geralmente melhor. Não é apenas o dado, e não é apenas o design do robô.

  • O Mito dos Dados: As pessoas pensavam que o Adam só vencia porque a linguagem é "cauda longa" (significando que algumas palavras são usadas constantemente, enquanto a maioria é rara, como em uma distribuição de Zipf). Os pesquisadores testaram isso em dados de DNA, onde o "vocabulário" é minúsculo (apenas 4 letras: A, C, G, T) e usado de forma muito uniforme. Surpreendentemente, o Adam ainda venceu. Dados estranhos não são o único motivo.
  • O Mito do Design: As pessoas pensavam que o Adam só vencia por causa dos designs complexos de "Transformers" (como o mecanismo de atenção no design de IA moderno). Os pesquisadores removeram essas partes complexas e usaram designs mais antigos e simples. O Adam ainda venceu.
  • O Mito do "Tamanho Único": Eles também descobriram que, às vezes, o professor tradicional (SGD) é na verdade melhor! Se você mudar o design do robô ligeiramente (como trocar um tipo de função de ativação por outra), a vantagem pode inverter, e o SGD se torna o vencedor.

2. O Ponto de "Cruzamento": É Tudo Sobre o Tamanho da Classe

Se nem o dado nem o design são a única resposta, o que é? O artigo sugere que a resposta reside em quantos exemplos o robô vê de uma só vez (o "tamanho do lote" ou batch size).

Imagine uma sala de aula:

  • Classe Pequena (Tamanho de Lote Pequeno): Quando o robô aprende com apenas alguns exemplos de cada vez, o ruído é alto. Nesse ambiente caótico, o professor tradicional (SGD) muitas vezes faz tão bem quanto, ou até melhor, que o professor adaptativo (Adam).
  • Classe Grande (Tamanho de Lote Grande): À medida que você aumenta o número de exemplos que o robô vê de uma só vez, o "ruído" suaviza. Em um certo ponto — chamado de tamanho de lote de cruzamento — o professor adaptativo (Adam) de repente assume a liderança e começa a vencer.

O artigo mostra que esse "ponto de cruzamento" muda dependendo dos dados e do design.

  • Para tarefas de linguagem, o cruzamento acontece relativamente cedo (o Adam vence mesmo com tamanhos de classe moderados).
  • Para tarefas de visão (como reconhecer imagens), o cruzamento acontece muito mais tarde. Você precisa de uma classe enorme antes que o Adam comece a vencer o SGD. Isso explica por que o SGD ainda é muito popular para tarefas de imagem.

3. A Teoria: Um Mapa do Terreno

Os pesquisadores construíram um modelo matemático para explicar por que esse cruzamento acontece. Eles compararam o "terreno" que o robô tem que escalar.

  • Às vezes o terreno é acidentado e irregular (ruído alto).
  • Às vezes é suave.

O modelo deles prevê que, se o terreno for "rugoso" o suficiente e você tiver uma classe grande o suficiente, o professor adaptativo (Adam) consegue navegar por ele muito mais rápido. Mas se o terreno for mais suave ou a classe for pequena, o professor constante (SGD) é perfeitamente adequado. O modelo confirma que o "vencedor" depende da interação entre a forma dos dados, o design do robô e o tamanho da classe.

4. A Realidade de "Uma Época" (One-Epoch)

O artigo também destaca uma diferença entre o treinamento antigo e o treinamento moderno:

  • Antigo (Sobreparametrizado): Se você deixar o robô treinar por muito tempo em um conjunto de dados pequeno, ele eventualmente aprenderá tudo perfeitamente. Neste caso, a lacuna entre os professores diminui porque ambos podem chegar ao fundo da colina.
  • Moderno (Subparametrizado): Nos modelos de linguagem modernos (LLMs), frequentemente treinamos em conjuntos de dados massivos por apenas uma passagem (uma época). Aqui, o robô não tem tempo para aprender tudo perfeitamente. Nesta corrida, o professor adaptativo (Adam) consistentemente termina com uma taxa de erro menor do que o professor tradicional.

Resumo

O artigo conclui que o debate sobre "Adam vs. SGD" não é sobre escolher um vencedor baseado em uma única regra. Em vez disso, é sobre encontrar o ponto de cruzamento.

Pense como dirigir um carro:

  • Em uma estrada de terra estreita e acidentada (lote pequeno, dados específicos), um caminhão robusto e simples (SGD) pode lidar melhor com ela.
  • Em uma rodovia larga e suave (lote grande, diferentes dados), um carro esportivo de alto desempenho (Adam) irá disparar à frente.

O "vencedor" depende inteiramente das condições da estrada (dados), do design do carro (arquitetura) e de quão rápido você está dirigindo (tamanho do lote). Não existe um único carro que vença todas as corridas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →