← Últimos artigos
🤖 machine learning

Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying

Este artigo introduz o ReMax, um objetivo de gradiente de política que formaliza a exploração como o retorno máximo esperado sobre múltiplas tentativas, levando ao desenvolvimento do RePPO — uma variante do PPO que alcança uma exploração estocástica emergente e eficaz sem termos de bônus explícitos ao otimizar este objetivo com um parâmetro de tentativa contínua.

Autores originais: Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada, Tadashi Kozuno, Toshinori Kitamura, Shin Ishii, Yutaka Matsuo

Publicado 2026-06-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada, Tadashi Kozuno, Toshinori Kitamura, Shin Ishii, Yutaka Matsuo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando encontrar a melhor rota para uma nova cafeteria em uma cidade que nunca visitou. Você tem um mapa, mas ele está incompleto.

O Jeito Antigo (RL Padrão):
A maioria dos agentes de Aprendizado por Reforço (RL) age como um turista nervoso. Eles tentam um caminho, recebem um resultado ruim e imediatamente entram em pânico. Para evitar que eles fiquem presos, pesquisadores geralmente dão um "bônus" ou um "mimo" apenas por tentarem caminhos novos e estranhos. É como um pai dizendo: "Se você tentar uma rua diferente, eu te dou um biscoito", mesmo que essa rua possa levar a um beco sem saída. O agente só explora por causa do biscoito, não porque é inteligente.

A Nova Ideia (ReMax):
Este artigo propõe uma abordagem diferente chamada ReMax. Em vez de dar um biscoito por tentar coisas novas, o ReMax muda a forma como o agente pensa sobre o sucesso.

A ideia central é simples: Não julgue sua decisão baseando-se em apenas uma tentativa; julgue-a com base na sua melhor tentativa entre várias.

A Metáfora da "Tentativa de Novo" (Retry)

Imagine que você está fazendo uma prova de múltipla escolha.

  • RL Padrão: Você escolhe uma resposta e pronto. Se escolheu errado, recebe zero pontos. Você tem medo de arriscar, então só escolhe a resposta da qual tem 1% de certeza (mesmo que esteja errado).
  • ReMax: Imagine que o professor diz: "Você pode escolher uma resposta, mas se errar, poderá tentar de novo até 5 vezes. Sua nota será baseada na melhor resposta que você obteve nessas 5 tentativas."

De repente, a estratégia muda!

  • Se você tem 100% de certeza, você escolhe aquela resposta todas as vezes.
  • Mas se você está incerto (talvez 50/50 entre duas respostas), você não apenas escolhe uma e torce. Você distribui suas apostas. Você tenta uma opção e, se falhar, tenta a outra. Como você mantém o melhor resultado, tentar uma opção arriscada torna-se uma jogada inteligente. Você não está explorando por causa de um "biscoito"; você está explorando porque tentar de novo torna o caminho arriscado mais seguro.

Como Funciona no Artigo

Os autores, liderados por Soichiro Nishimori e Paavo Parmas, formalizaram essa intuição da "tentativa de novo" em uma fórmula matemática chamada ReMax.

  1. O Fator "M": Eles introduziram um número, M, que representa quantas vezes você pode "tentar de novo" ou amostrar uma ação.

    • Se M = 1, é o jeito antigo: uma chance, um resultado. O agente torna-se ganancioso e para de explorar.
    • Se M > 1, o agente percebe que, se tentar algumas coisas diferentes, pode ter sorte com uma recompensa alta. Isso naturalmente incentiva o agente a tentar ações diferentes (explorar) sem precisar de nenhum "bônus" extra adicionado à pontuação.
  2. O Toque "Contínuo": No mundo real, você nem sempre pode tentar de novo exatamente 2 ou 3 vezes. Por isso, eles transformaram a contagem de tentativas em um número contínuo e suave (m).

    • Girar o botão para cima (maior m) torna o agente mais aventureiro e disposto a tentar coisas estranhas.
    • Girar o botão para baixo (menor m) torna o agente mais cauteloso e focado no que já conhece.
    • Isso dá à IA um controle de precisão para a curiosidade.
  3. O Mecanismo "RePPO": Para fazer isso funcionar em jogos complexos (como MinAtar e Craftax), eles construíram uma nova versão de um algoritmo de IA popular chamado PPO, que chamaram de RePPO.

    • Em vez de adicionar um "bônus de curiosidade" (como uma recompensa falsa por visitar novos lugares), o RePPO apenas otimiza para o "melhor de M tentativas".
    • O Resultado: Em seus experimentos, o RePPO aprendeu a jogar melhor do que os métodos padrão. Ele manteve sua "curiosidade" (alta aleatoriedade nas escolhas) naturalmente, sem precisar dos bônus de "biscoito" extras que outros métodos dependem.

A Conclusão

O artigo afirma que a exploração não precisa ser forçada com recompensas externas. Se você simplesmente mudar o objetivo para "maximizar seu melhor possível resultado ao longo de algumas tentativas", o agente naturalmente entende que tentar coisas diferentes é a maneira mais inteligente de vencer.

É como dizer a uma criança: "Você não precisa acertar de primeira; apenas me mostre sua melhor tentativa após algumas tentativas". A criança naturalmente começa a experimentar diferentes maneiras de resolver o quebra-cabeça, não porque você a subornou, mas porque as regras do jogo tornam a experimentação a estratégia vencedora.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →