← Últimos artigos
📊 statistics

Scalable On-Policy Reinforcement Learning via Adaptive Batch Scaling

Este artigo desafia a crença convencional de que o treinamento em grandes lotes é incompatível com Aprendizado por Reforço, propondo a Escalonamento Adaptativo de Lotes (ABS), um método que ajusta dinamicamente os tamanhos dos lotes com base na estabilidade da política para combinar com sucesso redes grandes e lotes grandes, alcançando desempenho superior.

Autores originais: Jongchan Park

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jongchan Park

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Dilema "Cachinhos Dourados" do Treinamento de IA

Imagine que você está ensinando um novo truque a um cachorro.

  • Tamanho de Lote Pequeno: Você dá um petisco de cada vez, corrigindo-o imediatamente após cada movimento. Isso é ótimo quando o cachorro está confuso e aprendendo rápido. Você pode mudar seu estilo de ensino instantaneamente se o cachorro não estiver entendendo.
  • Tamanho de Lote Grande: Você espera até que o cachorro tenha praticado por uma hora, e então lhe dá uma pilha enorme de petiscos e correções de uma só vez. Isso é eficiente e oferece uma imagem muito clara do que o cachorro está fazendo em média, mas é lento para reagir se o cachorro de repente começar a fazer algo estranho.

No mundo da Inteligência Artificial (especificamente no Aprendizado por Reforço, ou AR), existe uma crença de longa data de que você deve aderir à abordagem de "Lote Pequeno" (ensinar um passo de cada vez).

Por quê? Porque a IA está constantemente mudando de ideia. À medida que ela aprende, o mundo que ela vê muda. Se você esperar muito tempo para dar feedback (usando um lote grande), a IA pode já ter mudado tanto que o feedback se torna inútil ou até confuso. É como dar instruções a um motorista para uma estrada que não existe mais.

A Nova Ideia: "Escalonamento Adaptativo de Lotes" (EAL)

Os autores deste artigo dizem: "Espere um minuto. A IA não muda de ideia na mesma velocidade o tempo todo."

Eles propõem um método chamado Escalonamento Adaptativo de Lotes (EAL). Pense nisso como um professor inteligente que muda seu estilo de ensino com base na estabilidade do aluno.

  1. Os Primeiros Dias (Modo Caos): Quando a IA começa, ela é selvagem, exploradora e comete erros enormes. Seu comportamento muda rapidamente de um segundo para o outro.
    • A Estratégia: Use Lotes Pequenos. Mantenha o feedback vindo rápido e frequente. Isso permite que a IA permaneça flexível ("plástica") e se adapte rapidamente aos seus próprios erros.
  2. Os Dias Posteriores (Modo Estável): À medida que a IA melhora, ela para de fazer oscilações selvagens. Ela começa a se estabelecer em uma boa rotina. Seu comportamento torna-se previsível e estável.
    • A Estratégia: Alterne para Lotes Grandes. Agora que a IA está estável, você pode esperar mais tempo para coletar mais dados. Isso oferece uma correção superprecisa e de alta qualidade que ajuda a IA a aperfeiçoar suas habilidades e atingir o melhor desempenho mais rápido.

A Ferramenta Secreta: "Divergência Comportamental"

Como a IA sabe quando mudar do "Modo Caos" para o "Modo Estável"? Ela usa uma nova régua de medição chamada Divergência Comportamental.

  • A Analogia: Imagine que a IA é uma dançarina.
    • Alta Divergência: A dançarina está agitando os braços, girando selvagemente e mudando de movimento a cada segundo. O professor vê isso e diz: "Ok, vamos parar e corrigi-la imediatamente!" (Lote Pequeno).
    • Baixa Divergência: A dançarina agora está executando uma rotina suave e consistente. O professor vê isso e diz: "Ótimo, você está estável. Vamos assistir a um minuto inteiro da sua dança antes de fazer uma crítica detalhada." (Lote Grande).

O artigo apresenta uma fórmula matemática para medir exatamente o quanto os "passos de dança" (ações) da IA estão mudando entre as atualizações. Se os movimentos estão mudando muito, o tamanho do lote permanece pequeno. Se os movimentos são estáveis, o tamanho do lote cresce.

Os Resultados: Quebrando as Regras

Por muito tempo, especialistas pensaram que não era possível usar "Lotes Grandes" no Aprendizado por Reforço porque os dados eram muito bagunçados. Eles também pensavam que tornar o "cérebro" da IA (a rede neural) maior tornaria mais difícil treiná-la.

Este artigo prova que eles estão errados.

Ao usar seu método de "Escalonamento Adaptativo de Lotes":

  1. Eles quebraram o limite: Eles treinaram com sucesso agentes de IA usando lotes muito maiores do que nunca antes, o que geralmente faz a IA falhar.
  2. Eles escalaram: Eles combinaram esses lotes grandes com cérebros de IA massivos (redes neurais maiores). Em quase todos os outros campos da IA (como reconhecimento de imagens ou modelos de linguagem), cérebros maiores + lotes maiores = melhores resultados. No AR, isso era considerado impossível.
  3. O Resultado: Seu método funcionou melhor do que os antigos métodos de "apenas lote pequeno" em testes padrão de videogames (jogos Atari). Aprendeu mais rápido no início e terminou mais forte no final.

Resumo

O artigo argumenta que a abordagem "tamanho único" para treinar IA está errada. Em vez de forçar um tamanho de lote pequeno para sempre, devemos permitir que o tamanho do lote cresça à medida que a IA se torna mais estável. Ao medir o quanto o comportamento da IA está mudando, o sistema alterna automaticamente entre "aprendizado rápido e flexível" e "polimento lento e preciso", desbloqueando a capacidade de treinar agentes de IA muito mais inteligentes e maiores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →