← Últimos artigos
📊 statistics

Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems

Este artigo introduz o Pass-at-k Policy Optimization (PKPO), uma nova estrutura de aprendizado por reforço que deriva estimadores não viesados para otimizar diretamente o sucesso coletivo de conjuntos de amostras (pass@k) em vez de tentativas isoladas, aumentando assim a exploração e resolvendo problemas mais difíceis enquanto mantém ou melhora o desempenho de pass@1 através de k-annealing.

Autores originais: Christian Walder, Deep Karkhanis

Publicado 2026-06-11
📖 4 min de leitura☕ Leitura rápida

Autores originais: Christian Walder, Deep Karkhanis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um professor tentando ajudar um aluno a aprender como resolver problemas matemáticos difíceis.

O Jeito Antigo: A Armadilha da "Primeira Tentativa"
Tradicionalmente, ao treinar modelos de IA (como os que escrevem código ou resolvem matemática), o computador tenta resolver um problema, recebe uma pontuação e depois ajusta seu cérebro com base nessa única tentativa. Se a primeira tentativa falha, o computador não aprende nada com as outras tentativas que ele poderia ter feito em segundo plano. É como um aluno fazendo uma prova, errando uma questão e imediatamente desistindo, ignorando o fato de que ele poderia ter resolvido corretamente na segunda ou terceira tentativa se tivesse apenas continuado.

Este método otimiza o Pass@1: "A primeira resposta funcionou?" Isso força a IA a ser segura e conservadora, muitas vezes evitando os palpites arriscados e criativos necessários para resolver problemas realmente difíceis.

A Nova Ideia: A Abordagem "O Melhor do Lote"
Os autores deste artigo propõem uma nova estratégia chamada Otimização de Política Pass@K (PKPO).

Em vez de se importar apenas com a primeira resposta, este método diz: "Vamos gerar K tentativas diferentes (digamos, 8 ou 16) para cada problema. Não nos importamos se as primeiras 7 estiverem erradas; só nos importamos se pelo menos uma delas estiver certa."

Pense nisso como uma rede de pesca.

  • Método Antigo: Você lança uma linha. Se você errar o peixe, você a puxa de volta e não aprende nada.
  • Método PKPO: Você lança uma rede com 16 linhas. Se até mesmo uma linha pegar um peixe, a rede inteira é um sucesso. A IA é recompensada pelo melhor peixe na rede, não pela média de todas as linhas.

O Truque de Mestre: O Cartão de Pontuação
A parte difícil é descobrir como ensinar a IA a fazer isso. Se você apenas disser à IA "Você acertou na linha nº 4", ela pode ignorar as linhas nº 1, nº 2 e nº 3. Mas se você disser "Você pegou um peixe, então você fez um bom trabalho", ela pode não perceber qual linha foi a heroína.

Os autores inventaram um "cartão de pontuação" matemático especial (um estimador) que atua como um árbitro inteligente.

  1. Ele olha para todas as 16 tentativas.
  2. Ele calcula uma pontuação que recompensa a IA por ter qualquer resposta correta no grupo.
  3. Crucialmente, ele dá um pouco de crédito às respostas "erradas" também, porque elas fizeram parte do grupo que eventualmente produziu o vencedor. Isso incentiva a IA a continuar explorando e tentando ideias ousadas e arriscadas, sabendo que mesmo um palpite "ruim" contribui para o sucesso da equipe se um palpite "bom" aparecer mais tarde.

Por Que Isso Importa
O artigo mostra que este método funciona como um superpoder para tarefas difíceis:

  • Ele desbloqueia problemas difíceis: Em desafios de matemática e programação muito complexos, onde o antigo método da "primeira tentativa" fica travado, este novo método continua aprendendo e eventualmente resolve os problemas.
  • É flexível: Você pode dizer à IA: "Para a primeira metade do treinamento, seja um tomador de riscos e foque no melhor de 8 tentativas. Para a segunda metade, foque em acertar a primeira tentativa." Esse "recozimento" (annealing — mudar as regras lentamente) ajuda a IA a aprender a explorar primeiro, para depois refinar suas habilidades.
  • Funciona com modelos reais: Eles testaram isso em modelos populares de código aberto (GEMMA2 e LLAMA3.1) e descobriram que melhorou significamente a capacidade deles de resolver problemas matemáticos e escrever código em comparação com métodos anteriores.

Em Resumo
O artigo ensina a IA a parar de se preocupar em ser perfeita logo no primeiro palpite. Em vez disso, ensina a IA a gerar um conjunto diversificado de ideias, recompensar o grupo por ter qualquer vencedor e usar esse sucesso coletivo para aprender a resolver os quebra-cabeças mais difíceis. Trata-se de valorizar o esforço de equipe de múltiplos palpites, em vez de apenas o desempenho individual de um único palpite.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →