← Últimos artigos
💬 NLP

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

Este artigo apresenta o GTPO e o GRPO-S, dois novos algoritmos de aprendizado por reforço que aprimoram o raciocínio de Grandes Modelos de Linguagem ao implementar a modelagem dinâmica de recompensa baseada em entropia para alcançar uma atribuição de crédito detalhada, em nível de token e de sequência, superando assim as limitações de granularidade grosseira de métodos existentes como GRPO e DAPO.

Autores originais: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

Publicado 2026-02-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Nota de "Tudo ou Nada"

Imagine que você está ensinando um aluno (a IA) a resolver um problema de matemática muito longo e complexo. O aluno escreve uma solução de 50 etapas.

  • As etapas 1 a 49 são brilhantes, lógicas e corretas.
  • A etapa 50 (a resposta final) está errada devido a um pequeno erro de cálculo.

Nos métodos predominantes atuais (como o GRPO), o professor olha para o resultado final, vê que está errado e dá à redação de 50 etapas uma nota de reprovação inteira (0 pontos).

  • O Resultado: O aluno pensa: "Ah, acho que as etapas 1 a 49 também foram inúteis". Eles esquecem as partes boas e podem tentar uma abordagem completamente diferente e aleatória na próxima vez.
  • A Falha: Isso é chamado de atribuição de crédito de granularidade grosseira (coarse-grained credit assignment). Trata toda a cadeia de pensamento como um único bloco, ignorando que a maior parte foi, na verdade, perfeita.

A Solução: A Bússola da "Entropia"

Os autores deste artigo propõem uma nova maneira de dar nota ao aluno. Eles introduzem o conceito de Entropia da Política (Policy Entropy).

Pense na Entropia como uma medida de "pensar intensamente" ou "incerteza".

  • Baixa Entropia: O aluno está muito confiante. Ele está apenas digitando o que já sabe (ex: "1 + 1 = 2").
  • Alta Entropia: O aluno está fazendo uma pausa, considerando múltiplas opções e lutando com uma escolha difícil. Ele está explorando diferentes caminhos.

O artigo argumenta que a Alta Entropia é boa quando você está certo (significa que você explorou o caminho certo cuidadosamente), mas a Alta Entropia é ruim quando você está errado (significa que você estava adivinhando confiantemente na direção errada).

Os Dois Novos Algoritmos

O artigo apresenta dois novos "professores" (algoritmos) que usam esta bússola de Entropia para dar um feedback melhor.

1. GTPO (Group Token Policy Optimization)

A Analogia: O Professor "Marca-texto"
Em vez de avaliar a redação inteira de uma vez, o GTPO avalia cada palavra (token) individualmente.

  • Se a redação estiver Correta: O professor destaca as palavras onde o aluno hesitou ou explorou diferentes opções (Alta Entropia) e dá pontos de bônus extras para elas. Isso diz ao aluno: "Bom trabalho ao pensar intensamente sobre esse passo específico!"
  • Se a redação estiver Incorreta: O professor procura as palavras onde o aluno estava confiante demais, mas errou (Baixa Entropia). Eles aplicam uma penalidade pesada a essas palavras. Isso diz ao aluno: "Você estava seguro demais de si aqui, e estava errado. Não seja tão confiante da próxima vez."

Por que ajuda: Ele salva as partes boas do raciocínio e pune os momentos específicos de excesso de confiança que levaram ao erro.

2. GRPO-S (Sequence-Level GRPO)

A Analogia: O Professor do "Boletim"
Às vezes, avaliar cada palavra individualmente é muito lento ou computacionalmente pesado. O GRPO-S é uma versão mais leve.

  • Em vez de olhar para as palavras individuais, ele olha para o esforço de pensamento médio de toda a redação.
  • Se a redação estiver Correta: Ele verifica: "O aluno pensou intensamente e explorou em geral?" Se sim, toda a redação recebe um impulso.
  • Se a redação estiver Incorreta: Ele verifica: "O aluno estava confiante, mas errado?" Se sim, toda a redação recebe uma penalidade maior.

Por que ajuda: É mais rápido, mas ainda assim mais inteligente do que o antigo método de "Tudo ou Nada". É particularmente bom para manter a estabilidade do aluno durante tarefas de raciocínio muito longas.

Os Resultados: O Que Aconteceu?

Os autores testaram esses novos professores em benchmarks matemáticos difíceis (como AIME e MATH).

  • O Jeito Antigo (GRPO/DAPO): O aluno frequentemente ficava travado. Eles desistiam muito rápido ou ficavam "presos" em um ciclo de respostas confiantes, porém erradas (Colapso da Política/Policy Collapse).
  • O Novo Jeito (GTPO/GRPO-S):
    • Exploração: Os alunos continuaram tentando caminhos diferentes por mais tempo porque foram recompensados por "pensar intensamente" (alta entropia) quando estavam certos.
    • Precisão: Eles aprenderam a parar de estar confiantemente errados.
    • Desempenho: Eles pontuaram significativamente mais alto em problemas matemáticos difíceis, resolvendo cadeias de raciocínio mais complexas do que antes.

Resumo em Uma Sentença

Este artigo ensina modelos de IA a pararem de tratar uma longa cadeia de pensamento como uma nota única de "passou ou falhou" e, em vez disso, lhes dá um boletim detalhado que os recompensa por pensar intensamente quando estão certos e por serem humildes quando estão errados, levando a um raciocínio muito mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →