← Últimos artigos
🤖 AI

Retry Policy Gradients in Continuous Action Spaces

Este artigo estende o objetivo baseado em tentativas ReMax para espaços de ação contínuos ao introduzir estimadores de derivada por caminho, resultando no algoritmo ReMAC que promove a exploração estocástica e alcança um desempenho comparável ao SAC sem regularização de entropia explícita ao remodelar o panorama do gradiente da política.

Autores originais: Soichiro Nishimori, Paavo Parmas

Publicado 2026-06-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Soichiro Nishimori, Paavo Parmas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a caminhar através de uma sala. O robô está vendado e só pode adivinhar onde dar o passo. No mundo da Inteligência Artificial, isso é chamado de Aprendizado por Reforço (Reinforcement Learning). O robô tenta diferentes movimentos, recebe uma "pontuação" (recompensa) por se sair bem e aprende com seus erros.

O grande problema é a exploração: Como fazer o robô tentar coisas novas em vez de apenas repetir os mesmos passos seguros e entediantes?

O Jeito Antigo: Adicionar "Ruído"

Tradicionalmente, para fazer o robô explorar, os cientistas adicionam um pouco de "ruído" ou aleatoriedade ao seu cérebro. É como dizer ao robô: "Ei, às vezes apenas balance suas pernas aleatoriamente!" Isso funciona, mas é como adicionar um tempero a um prato que você tem que medir cuidadosamente e eventualmente remover, ou o prato terá um gosto estranho.

A Nova Ideia: A Estratégia de "Repetição" (Retry)

Este artigo apresenta uma nova maneira de ensinar o robô, chamada ReMax (que significa "Retry Maximum" ou Máximo de Repetições).

Em vez de dizer ao robô para ser aleatório, o ReMax muda as regras do jogo. Imagine que você está fazendo uma prova.

  • O Jeito Antigo: Você tem apenas uma chance de responder a uma pergunta. Você escolhe seu melhor palpite e essa é a sua pontuação.
  • O Jeito ReMax: Você tem o direito de fazer a prova M vezes (digamos, 4 ou 8 vezes) para a mesma pergunta. Você escreve todas as 8 respostas, escolhe a melhor delas e essa é a sua pontuação.

O robô aprende que, se mantiver suas opções abertas (sendo um pouco "estocástico" ou variável), ele tem uma chance melhor de tropeçar em uma resposta excelente entre suas muitas tentativas. Ele não precisa de uma instrução especial de "ruído"; o desejo de encontrar o melhor de muitas tentativas força naturalmente a exploração.

O Que Acontece em Espaços Contínuos?

O artigo foca em espaços de ação contínuos, que é uma forma sofisticada de dizer que o robô pode mover suas articulações para qualquer ângulo, não apenas "esquerda" ou "direita".

Os autores descobriram algo surpreendente sobre como essa estratégia de "Repetição" altera o caminho de aprendizado do robô:

  1. O "Empurrão" (Direção): Quando o robô está longe do objetivo e se movendo de forma rígida (baixa aleatoriedade), a matemática da estratégia de "Repetição" naturalmente o empurra para se tornar mais aleatório. É como se o robô percebesse: "Estou preso em um canto; preciso balançar mais para encontrar uma saída".
  2. O "Freio" (Magnitude): Quando o robô está perto da solução perfeita, a estratégia de "Repetição" age como um freio suave. Ela reduz a velocidade de aprendizado. Isso é bom porque impede o robô de passar direto pela solução perfeita e ultrapassá-la. Isso o mantém explorando um pouco mais antes de se estabelecer.

O Robô "ReMAC"

Os autores construíram um cérebro de robô específico chamado ReMAC (ReMax Actor-Critic) para testar isso. Eles pegaram um cérebro de robô padrão e altamente bem-sucedido (chamado SAC) e simplesmente substituíram as instruções de "ruído" pelas instruções de "Repetição".

Os Resultados:

  • Desempenho: O robô ReMAC aprendeu a caminhar tão bem quanto os melhores robôs do mundo (SAC).
  • Exploração: Sem precisar de temperos extras de "ruído", o robô ReMAC naturalmente manteve seus movimentos mais variados (entropia mais alta) por mais tempo, exatamente como a teoria previa.
  • O Porém: O método de "Repetição" exige que o robô simule múltiplos resultados ao mesmo tempo, o que consome um pouco mais de poder computacional.

A Reviravolta do Otimizador Adam

O artigo também notou que a ferramenta de computador usada para treinar o robô (chamada Adam) possui um pequeno ajuste (um "parâmetro de estabilização") que atua como um botão de volume.

  • Se o botão estiver configurado baixo, o efeito de "frenagem" da estratégia de Repetição é enfraquecido, e o robô aprende rápido, mas pode se estabelecer rápido demais.
  • Se o botão estiver configurado mais alto, o efeito de frenagem é mais forte, mantendo o robô explorando por mais tempo.

Em Resumo

Este artigo mostra que você não precisa forçar uma IA a ser aleatória adicionando ruído. Em vez disso, se você ensinar a IA a otimizar para o melhor de várias tentativas, ela naturalmente entende que ser um pouco imprevisível é a maneira mais inteligente de encontrar a melhor solução. É uma maneira inteligente e integrada de incentivar a curiosidade sem a necessidade de regras extras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →