← Últimos artigos
📊 statistics

Why Adam Works Better with β1=β2\beta_1 = \beta_2: The Missing Gradient Scale Invariance Principle

Este artigo revela que definir β1=β2\beta_1 = \beta_2 no otimizador Adam é ótimo porque garante de forma única a invariância de escala do gradiente de primeira ordem, uma propriedade estrutural que explica as melhorias observadas empiricamente na estabilidade e no desempenho do treinamento em diversas tarefas.

Autores originais: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a andar. Você dá instruções com base em como ele tropeçou nos últimos passos. É assim que funciona o Adam, o "otimizador" (uma ferramenta que ajuda a IA a aprender) mais popular. Ele usa dois "botões de memória" para decidir quanto ouvir o passado versus o presente.

Por quase uma década, especialistas ajustaram esses botões para configurações específicas: 0,9 para a primeira memória e 0,999 para a segunda. Mas, recentemente, um padrão curioso surgiu: quando os pesquisadores ajustaram ambos os botões para o mesmo número (por exemplo, ambos para 0,99), o robô andou de forma mais suave e aprendeu mais rápido. Ninguém sabia por que essa mágica funcionava.

Este artigo resolve o mistério. Aqui está a explicação em português claro, usando algumas analogias.

O Problema: O "Botão de Volume" vs. a "Direção"

Imagine que você está dirigindo um carro em uma estrada sinuosa.

  • O Gradiente é a própria estrada. Às vezes a estrada é íngreme (gradiente grande), às vezes é plana (gradiente pequeno).
  • A Atualização é como você vira o volante.

Idealmente, você só se importa com para onde virar (a direção). Você não quer que a inclinação da colina faça você girar o volante freneticamente. Se a estrada ficar subitamente mais íngreme, você não deve dar uma virada brusca de 90 graus no volante; deve apenas continuar guiando na mesma direção.

Os autores descobriram que o Adam padrão (com botões diferentes) é muito sensível à "inclinação" da estrada. Se o gradiente aumenta, o Adam reage em excesso. Mas quando os dois botões são ajustados para o mesmo valor, o Adam para de se importar com o "volume" (o tamanho) do erro e foca puramente na "direção".

O Segredo: "Invariância de Escala do Gradiente"

O artigo chama essa propriedade de Invariância de Escala do Gradiente.

Pense nisso como ouvir música.

  • Adam Padrão (Botões Diferentes): Se você aumentar o volume da música (tornar o gradiente maior), o equalizador (o otimizador) entra em pânico e muda as configurações de graves e agudos freneticamente. A música soa distorcida.
  • Adam Equilibrado (Botões Iguais): Se você aumentar o volume, o equalizador permanece calmo. Ele percebe: "Ah, a música está apenas mais alta, mas a melodia é a mesma". Ele ajusta as configurações perfeitamente para manter a música soando suave, independentemente do volume.

O artigo prova matematicamente que apenas quando os dois botões de memória são iguais o Adam alcança essa estabilidade "à prova de volume". Quando são diferentes, a matemática cria um "atraso" que faz o robô tropeçar sempre que o tamanho do gradiente muda.

O Teste de "Suavidade"

Para provar isso, os pesquisadores não olharam apenas para a pontuação final (quão bem a IA se saiu). Eles observaram os movimentos do robô passo a passo.

Eles mediram a oscilação (o quanto os passos do robô oscilavam de um lado para o outro).

  • Quando os botões eram diferentes: Os passos do robô eram trêmulos. O tamanho do passo saltava para cima e para baixo freneticamente, como um carro com suspensão instável.
  • Quando os botões eram iguais: Os passos tornaram-se incrivelmente suaves. O robô se moveu com um ritmo constante e estável.

Eles testaram isso em muitos "robôs" (modelos de IA) diferentes realizando tarefas distintas:

  • Visão: Reconhecer imagens (como gatos versus cães).
  • Linguagem: Escrever texto ou responder perguntas.

Em todos os casos, a configuração "Equilibrada" (onde β1=β2\beta_1 = \beta_2) resultou no treinamento mais suave e estável.

A Grande Conclusão

Por anos, as pessoas pensaram que os dois botões no Adam precisavam ser diferentes para funcionar bem. Este artigo mostra que o "segredo" para a estabilidade estava, na verdade, escondido à vista de todos: torne-os iguais.

Quando você os ajusta iguais, você desbloqueia um superpoder oculto: o otimizador torna-se imune às flutuações caóticas do tamanho do gradiente. Ele para de reagir ao "ruído" de quão grande é o erro e começa a focar puramente no "sinal" de para onde ir.

Em resumo: Se você quer que seu treinamento de IA seja mais suave e estável, pare de adivinhar as configurações. Basta ajustar ambos os botões de momento para o mesmo número e deixe a matemática fazer o resto.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →