← Últimos artigos
🤖 AI

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

O artigo propõe o VIGOR, um método de alocação de rollout online guiado por variância que distribui dinamicamente um orçamento de geração fixo para exemplos com a maior variância de recompensa, reduzindo significativamente os custos computacionais e melhorando a estabilidade ao mesmo tempo em que alcança um desempenho superior em tarefas de raciocínio matemático e codificação em comparação ao GRPO padrão.

Autores originais: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

Publicado 2026-07-27
📖 4 min de leitura☕ Leitura rápida

Autores originais: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô muito inteligente, mas um pouco distraído, a resolver quebra-cabeças complexos, como problemas de matemática ou escrever código de computador. Você não pode simplesmente sentar lá e explicar cada passo; em vez disso, você deixa o robô tentar e, quando ele acerta uma resposta, você lhe dá um "high-five" (uma recompensa). Quando ele erra, você diz gentilmente: "tente novamente". Esse processo é chamado de Aprendizado por Reforço. O robô continua tentando diferentes maneiras de resolver o problema e, com o tempo, aprende quais caminhos levam a "high-fives" e quais levam a becos sem saída.

No entanto, há um porém. Para aprender de forma eficaz, o robô precisa tentar muitos caminhos diferentes. Se ele tentar apenas um ou dois, pode ter sorte e pensar que um caminho ruim é, na verdade, bom. Mas se ele tentar milhares de caminhos, será um enorme desperdício de tempo e eletricidade, especialmente porque a maioria desses caminhos é entediante ou inútil. É como pedir a um aluno que escreva 100 ensaios para aprender a escrever, quando 90 deles são apenas rabiscos que não ensinam nada de novo. A grande questão para os cientistas é: Como fazemos o robô tentar o número certo de caminhos sem desperdiçar energia com os mais entediantes?

É aqui que um novo método chamado VIGOR entra em cena. Pense no processo de aprendizado do robô como um jogo de "Quente ou Frio". No modo antigo de fazer as coisas (chamado GRPO), o robô tentaria cegamente o mesmo número de palpites para cada quebra-cabeça, independentemente de o quebra-cabeça ser fácil ou difícil. Era como um professor dando a mesma quantidade de lição de casa para todos os alunos, mesmo que alguns já soubessem a resposta e outros estivessem completamente perdidos.

Os pesquisadores por trás do VIGOR perceberam que a informação mais útil vem dos momentos em que o robô não tem certeza. Se um robô tenta um problema de matemática e obtém uma mistura de respostas certas e erradas, essa "variância" (ou discordância) é um sinal de que ele está aprendendo algo importante. Mas se ele obtém a mesma resposta errada todas as vezes, ou a mesma resposta certa todas as vezes, ele está apenas perdendo tempo.

O VIGOR muda o jogo ao agir como um treinador inteligente que observa as primeiras tentativas do robô. Em vez de dar a cada quebra-cabeça um número fixo de tentativas, o VIGOR começa deixando o robô dar apenas alguns palpites em tudo. Então, ele analisa os resultados:

  1. Se o robô obteve a mesma resposta todas as vezes (baixa variância), o treinador diz: "Ok, já entendemos, vamos seguir em frente".
  2. Se as respostas do robô estavam todas espalhadas (alta variância), o treinador diz: "Este é difícil! Vamos dar mais tentativas para resolvê-lo".

O método então despeja mais "energia de palpite" (rollouts) apenas nos quebra-cabeças que estão causando mais confusão, ignorando aqueles que são fáceis demais ou quebrados demais para aprender. É como um videogame que só gera inimigos mais difíceis para o jogador que está com dificuldades, em vez de tornar os níveis fáceis mais difíceis apenas para preencher o tempo.

O artigo mostra que esta abordagem é um divisor de águas. Ao usar esta estratégia "guiada pela variância", o robô atinge o mesmo nível de habilidade usando significativamente menos palpites. Em problemas de matemática, o VIGOR atingiu sua precisão alvo com até 2,3 vezes menos rollouts do que o método padrão. Em tarefas de programação, atingiu a mesma taxa de sucesso com 1,49 vezes menos rollouts e até melhorou a taxa de sucesso final em 3,4 pontos.

Os autores sugerem que isso não é apenas um pequeno ajuste; é uma mudança fundamental na forma como ensinamos a IA a raciocinar. Eles mediram esses resultados em diferentes tamanhos de modelos de IA e descobriram que o VIGOR aprende consistentemente de forma mais rápida e eficiente. Isso prova que você não precisa jogar mais poder computacional em um problema para resolvê-lo; você só precisa ser mais inteligente sobre onde gasta esse poder. Ao focar apenas nos momentos de incerteza, o VIGOR ajuda a IA a aprender a raciocinar de forma mais eficaz, transformando um processo caótico de tentativa e erro em uma jornada focada e eficiente de descoberta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →