← Últimos artigos
🤖 machine learning

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

O artigo apresenta o Klear-Reasoner, um modelo de raciocínio de alto desempenho que supera benchmarks complexos em matemática e programação ao utilizar dados de treinamento de alta qualidade e uma nova técnica de otimização chamada GPPO, que preserva gradientes para melhorar a exploração e o aprendizado durante o treinamento por reforço.

Autores originais: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

Publicado 2026-04-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um estudante muito inteligente, mas que às vezes se perde em problemas complexos de matemática ou programação. Ele sabe as fórmulas, mas não sabe como pensar passo a passo para chegar à solução.

O relatório técnico Klear-Reasoner é como a história de como uma equipe de pesquisadores (da Kuaishou Technology) transformou esse estudante em um gênio da lógica. Eles não apenas deram mais livros para ele ler; eles mudaram a forma como ele aprende e como lida com os erros.

Aqui está a explicação do que eles fizeram, usando analogias do dia a dia:

1. A Base: O "Treino de Mestre" (SFT)

Antes de ensinar o aluno a pensar sozinho, eles precisaram mostrar a ele como um mestre resolveria os problemas. Isso se chama Ajuste Fino Supervisionado (SFT).

  • O Problema: Muitos acham que quanto mais exemplos o aluno tiver, melhor. Mas a equipe descobriu que qualidade é melhor que quantidade.
    • Analogia: É como tentar aprender a cozinhar. Você não quer 1.000 receitas de alguém que queima a comida. Você quer 50 receitas perfeitas de um chef estrela. Eles escolheram apenas os melhores exemplos de raciocínio (matemática e código) e ignoraram os dados "barulhentos" ou de baixa qualidade.
  • O Segredo dos Erros Difíceis: Eles notaram algo curioso. Se o aluno erra em coisas fáceis, é ruim. Mas se ele erra em coisas muito difíceis, isso é bom!
    • Analogia: Se você está aprendendo a andar de bicicleta e cai em um terreno plano, você fica confuso. Mas se você cair tentando subir uma ladeira íngreme, você aprende que precisa de mais força e equilíbrio. Os "erros difíceis" ensinam o modelo a explorar novas soluções, em vez de apenas seguir o caminho óbvio.

2. A Grande Inovação: O "Treinador Gentil" (GPPO)

A parte mais brilhante do relatório é a nova técnica chamada GPPO (Otimização de Política com Preservação de Gradiente).

Para entender isso, imagine que o modelo está jogando um jogo de tabuleiro e o treinador (o algoritmo) diz: "Se você fizer um movimento muito arriscado e errar, eu vou apagar esse movimento da sua memória e dizer 'não aprenda nada com isso'". Isso é o que os métodos antigos faziam. Eles "cortavam" (clipping) os movimentos arriscados para evitar que o aluno ficasse louco e mudasse de estratégia de repente.

O que o Klear-Reasoner fez de diferente?
Eles criaram um treinador que diz: "Ok, você fez um movimento arriscado e errou. Não vamos apagar a memória. Vamos olhar para o que aconteceu, mas com cuidado."

  • A Analogia do "Sinal de Trânsito":
    • Método Antigo: Se o carro (o modelo) faz uma curva muito rápida (alta probabilidade de erro), o treinador corta o motor. O carro para e não aprende nada sobre aquela curva.
    • Método Klear-Reasoner (GPPO): O treinador coloca o carro em "marcha lenta" (gradiente preservado). Ele ainda deixa o carro sentir a curva e aprender com ela, mas impõe um limite de velocidade para que o carro não saia da pista.
    • Resultado: O modelo aprende a explorar caminhos novos (curvas arriscadas) sem ter medo de errar, e aprende mais rápido com os erros, porque ninguém apaga a lição.

3. O Sistema de Recompensas: "Prêmio por Esforço"

Na programação, às vezes o código não funciona 100%, mas funciona 50%.

  • Método Antigo: Se o código falha em um teste, o treinador diz: "Você errou tudo. Nota zero." (Recompensa Dura). Isso desmotiva o aluno.
  • Método Klear-Reasoner: Se o código passa em 5 de 10 testes, o treinador diz: "Ótimo! Você acertou metade. Aqui está 50% de pontos." (Recompensa Suave).
    • Analogia: É como um professor que dá pontos parciais. Isso incentiva o aluno a tentar melhorar aos poucos, em vez de desistir na primeira dificuldade.

4. O Resultado Final

Com essa combinação de:

  1. Exemplos de alta qualidade (menos lixo, mais ouro).
  2. Um treinador que não apaga os erros difíceis (GPPO).
  3. Recompensas justas (pontos parciais).

O modelo Klear-Reasoner se tornou um campeão. Ele superou outros modelos famosos em testes de matemática (como o AIME, que é como uma Olimpíada de Matemática) e programação.

Resumo em uma frase:
O Klear-Reasoner é como um aluno que aprendeu a pensar melhor porque teve professores perfeitos, um treinador que o incentivou a explorar caminhos arriscados sem puni-lo severamente, e um sistema de notas que valorizava cada pequeno progresso.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →