← Últimos artigos
💬 NLP

On Advantage Estimates for Max@K Policy Gradients

Este artigo introduz o MaxPO, um novo método de gradiente de política para otimizar objetivos max@K em aprendizado por reforço com recompensas verificáveis, o qual utiliza uma nova linha de base Leave-Two-Out para garantir vantagens centradas, reduzir a variância do gradiente e unificar estimadores existentes para um pós-treinamento de LLM mais eficaz.

Autores originais: Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um professor tentando treinar um aluno para resolver um problema matemático muito difícil. O aluno é uma IA, e o problema é uma "tarefa de raciocínio".

Na forma antiga de treinar essas IAs (Aprendizado por Reforço), o professor pedia ao aluno para tentar resolver o problema uma vez. Se a resposta estivesse errada, o aluno não recebia feedback (recompensa zero). Se estivesse certa, ele ganhava uma estrela de ouro. O problema? O aluno tinha que adivinhar o caminho certo em um labirinto gigante de possibilidades, e ganhar uma estrela de ouro era tão raro que o aluno frequentemente ficava travado, sem saber quais palpites estavam "quase certos" e quais estavam "completamente errados".

Para corrigir isso, pesquisadores começaram uma nova estratégia: A Abordagem "Tentar Muitas Vezes".

Em vez de pedir ao aluno para resolver o problema uma vez, o professor pede que ele gere K soluções diferentes ao mesmo tempo. O objetivo não é apenas conseguir uma resposta correta; é garantir que pelo menos uma dessas K tentativas seja correta. Isso é chamado de otimizar para Max@K (ou Pass@K).

O Problema com os Velhos Métodos de "Tentar Muitas Vezes"

O artigo argumenta que, embora essa abordagem de "Tentar Muitas Vezes" seja ótima, a matemática usada para ensinar a IA como melhorar estava ligeiramente falha.

Imagine que você tem um grupo de 8 alunos (um "lote") tentando resolver um quebra-cabeça. Você quer dizer a cada aluno o quão bem ele se saiu.

  • O Método Antigo (EI-apenas): Olhava para a resposta de um aluno e a comparava com a melhor resposta dos outros 7 alunos. Se o aluno tivesse se saído melhor que os outros, recebia um enorme sinal de "Bom Trabalho!". Se tivesse se saído pior, recebia um sinal de "0".
  • A Falha: Como o sinal de "Bom Trabalho!" era sempre positivo (ou zero) e nunca negativo, o professor estava essencialmente dizendo: "Você está sempre fazendo melhor que a média!". Isso é enganoso. É como um treinador que só consegue dizer "Ótimo!" e nunca aponta que um jogador está, na verdade, abaixo do desempenho esperado em comparação ao potencial real da equipe. Isso cria muita "variância" (ruído) no treinamento, tornando o aprendizado da IA instável e lento.

A Solução: O Baseline "Leave-Two-Out"

Os autores deste artigo propõem uma forma mais inteligente de avaliar os alunos, que eles chamam de MaxPO (Max@K Policy Optimization).

Eles introduzem uma nova regra para avaliação, que chamam de baseline Leave-Two-Out (L2O). Veja como funciona usando uma analogia simples:

Imagine que você está julgando um show de talentos com 8 concorrentes.

  1. O Jeito Antigo: Para julgar o Concorrente A, você o compara com o melhor dos outros 7. Se A for o melhor, ele recebe uma pontuação alta. Se não for, ele recebe zero. Isso é tendencioso porque o "melhor dos outros 7" é um alvo móvel que muda dependendo de quem está na sala.
  2. O Novo Jeito (L2O): Para julgar o Concorrente A, você remove temporariamente tanto o Concorrente A quanto o Concorrente B da sala. Você então olha para as 6 pessoas restantes para ver o que representa um desempenho "justo" médio.
    • Você calcula como o Concorrente A teria se saído contra esse grupo "justo".
    • Crucialmente, ao remover duas pessoas, você garante que o grupo "justo" não inclua acidentalmente a pessoa que você está tentando julgar (Concorrente A) ou um "rival" específico (Concorrente B) que possa distorcer a comparação.

Por que isso é melhor?
Este método garante que a pontuação "média" de todo o grupo seja exatamente zero. Alguns alunos recebem uma pontuação positiva (fizeram melhor que a média justa) e alguns recebem uma pontuação negativa (fizeram pior que a média justa). Esses valores positivos e negativos se cancelam perfeitamente.

  • O Resultado: A IA recebe um sinal muito mais claro e com menos "ruído". Ela sabe exatamente onde está em relação a um baseline justo, em vez de apenas ser informada que "você é ótimo" ou "você é nada".

O Que o Artigo Descobriu

Os pesquisadores testaram este novo método "Leave-Two-Out" de duas maneiras:

  1. Em Jogos Simples (Bandidos e Labirintos): Eles mostraram que este novo método reduziu o "ruído" no sinal de aprendizado em uma margem enorme (até 77% menos ruído em alguns casos). Isso significa que a IA aprende de forma mais constante e não se confunde com flutuações aleatórias.
  2. Em Modelos de IA Reais (LLMs): Eles testaram isso em grandes modelos de linguagem (como Llama e Qwen) tentando resolver problemas matemáticos.
    • O Resultado: A IA treinada com o novo método (MaxPO) tornou-se significativamente melhor em resolver problemas quando permitida a tentar muitas vezes (ex: Pass@256).
    • No modelo Qwen, melhorou a taxa de sucesso em 5,2%.
    • No modelo Llama, melhorou a taxa de sucesso em 2,4%.

A Visão Geral

Pense no método antigo como um treinador excessivamente otimista que dá um adesivo de "Bom Trabalho" para todos, mesmo quando eles estão enfrentando dificuldades. O novo método (MaxPO) é um treinador que utiliza um sistema de pontuação rigoroso, justo e equilibrado. Ao remover o "ruído" e garantir que as pontuações estejam centradas em torno de zero, a IA pode aprender de forma muito mais rápida e eficaz, especialmente quando o objetivo é encontrar pelo menos uma resposta correta entre várias tentativas.

O artigo conclui que esta abordagem "Leave-Two-Out" é a maneira matematicamente correta de treinar IAs para estas tarefas de "tentar muitas vezes", fornecendo uma base unificada e estável para melhorias futuras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →