← Últimos artigos
🤖 AI

GRPO is Secretly a Process Reward Model

Este artigo prova teoricamente que a Otimização de Política Relativa por Grupo (GRPO) com um modelo de recompensa por resultado é equivalente a um modelo de recompensa por processo, identifica uma falha em seu tratamento de etapas desbalanceadas e propõe uma modificação simples (λ\lambda-GRPO) que melhora significativamente o desempenho de raciocínio e a eficiência do treinamento sem exigir modelos de recompensa por processo explícitos.

Autores originais: Michael Sullivan, Alexander Koller

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Michael Sullivan, Alexander Koller

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O "Segredo da Receita"

Imagine que você está ensinando um robô a resolver um problema complexo de matemática. Você dá ao robô um prompt, e ele tenta escrever a solução passo a passo.

Geralmente, existem duas maneiras de avaliar o robô:

  1. A Nota Final (Recompensa de Resultado): Você olha apenas para o final. Ele chegou à resposta correta? Se sim, +10 pontos. Se não, 0 pontos. Isso é como um professor que olha apenas para a nota do exame final e ignora como o aluno fez o trabalho.
  2. A Nota Passo a Passo (Recompensa de Processo): Você avalia cada passo individual. "Bom trabalho ao montar a equação", "Ops, sinal errado aqui". Isso é mais difícil de fazer porque você precisa de um humano (ou uma IA inteligente) para verificar cada linha.

A Descoberta do Artigo:
Os autores descobriram que um método de treinamento popular chamado GRPO (Otimização de Política Relativa em Grupo) está, na verdade, fazendo a segunda coisa (avaliação passo a passo) por acidente, mesmo que seja suposto fazer apenas a primeira (Nota Final).

Eles chamam isso de "Modelo de Recompensa de Processo" (PRM), mas afirmam que o GRPO é "secretamente" um deles. É como um chef que acha que está apenas assando um bolo, mas está usando um ingrediente secreto que faz o bolo crescer perfeitamente, sem que ele saiba que está lá.


Como o "Segredo" Funciona: A Analogia do Grupo de Conversa

Para entender como o GRPO avalia passos secretamente, imagine uma sala de aula de alunos (um "Grupo") todos tentando resolver o mesmo enigma.

  1. O Cenário: O professor faz uma pergunta. Cinco alunos escrevem suas respostas.

  2. A Sobreposição:

    • Aluno A escreve: "Primeiro, eu somo 2..."
    • Aluno B escreve: "Primeiro, eu somo 2..."
    • Aluno C escreve: "Primeiro, eu somo 2..."
    • Aluno D escreve: "Primeiro, eu multiplico por 5..."
    • Aluno E escreve: "Primeiro, eu multiplico por 5..."

    Note que os Alunos A, B e C compartilham o mesmo primeiro passo ("Somar 2"). Os Alunos D e E compartilham um primeiro passo diferente.

  3. A Avaliação Secreta:

    • Se a resposta final do grupo for boa, o professor dá uma nota alta para o grupo inteiro.
    • Como A, B e C compartilharam o mesmo primeiro passo, o algoritmo percebe: "Ei, este passo específico ('Somar 2') parece levar a bons resultados para essas três pessoas."
    • Então, ele concede um "bônus" para aquele passo específico para todos que o usaram.
    • Por outro lado, se o grupo falhar, e D e E ambos começarem com "Multiplicar por 5", o algoritmo percebe que aquele passo é arriscado e aplica uma penalidade.

O Resultado: Mesmo que o professor tenha olhado apenas para a resposta final, o algoritmo efetivamente descobriu quais passos foram bons e quais foram ruins, apenas vendo quais passos apareceram juntos em grupos bem-sucedidos.


O Problema: A "Multidão Injusta"

Os autores encontraram uma falha nesse mecanismo secreto. Ele funciona muito bem quando a multidão é equilibrada, mas falha quando a multidão é desequilibrada.

A Analogia:
Imagine um sistema de votação onde você conta quantas pessoas votaram em uma ideia específica.

  • Cenário: 90% da turma começa com "Somar 2", e apenas 10% começa com "Multiplicar por 5".
  • A Falha: Se o grupo "Somar 2" receber uma pontuação ligeiramente inferior à média, o algoritmo pune o passo "Somar 2" 90 vezes mais forte do que puniria o passo "Multiplicar por 5", simplesmente porque há tantas pessoas fazendo isso.
  • A Consequência: O robô pode parar de tentar o caminho "Somar 2" completamente, mesmo que fosse realmente um bom caminho, apenas porque a "multidão" era muito grande e recebeu uma pontuação ligeiramente ruim. Ele fica com medo de explorar novos caminhos ou manter-se em bons caminhos se os números estiverem distorcidos.

A Solução: λ\lambda-GRPO (O "Filtro de Justiça")

Os autores propuseram uma solução simples chamada λ\lambda-GRPO.

A Analogia:
Em vez de contar cada voto individualmente de forma igual, eles adicionam um "filtro de justiça".

  • Se um passo é muito popular (muitos alunos o fizeram), o filtro diz: "Ok, vamos dividir a pontuação pelo número de pessoas."
  • Se um passo é raro, o filtro diz: "Ok, vamos dar a este um peso maior."

Isso garante que um passo seja julgado por seu próprio mérito, e não por quantas pessoas aconteceram de fazê-lo naquele grupo específico. Impede que o algoritmo seja intimidado pelo tamanho da multidão.

Os Resultados: Mais Rápido e Mais Inteligente

Os autores testaram essa correção em problemas reais de matemática:

  1. Melhor Desempenho: Os modelos usando a correção (λ\lambda-GRPO) obtiveram melhores pontuações em tarefas de raciocínio matemático do que os modelos padrão.
  2. Aprendizado Mais Rápido: Eles atingiram seu desempenho máximo em metade do tempo (menos etapas de treinamento).
  3. Sem Custo Extra: Eles não precisaram contratar humanos caros para avaliar cada passo. Eles apenas ajustaram a matemática do algoritmo existente.

Resumo

O artigo revela que um método popular de treinamento de IA (GRPO) estava secretamente agindo como um avaliador passo a passo o tempo todo. No entanto, ele tinha um bug onde ficava confuso com grupos desequilibrados. Os autores corrigiram esse bug com um ajuste matemático simples (λ\lambda-GRPO), fazendo com que a IA aprenda tarefas de raciocínio mais rápido e melhor, sem precisar de ferramentas extras e caras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →