← Últimos artigos
💬 NLP

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LamPO é um método inovador de otimização de políticas para modelos de linguagem de raciocínio que aprimora a aprendizagem por reforço com recompensas verificáveis ao substituir vantagens grupais escalares por uma vantagem decomposta em pares para preservar informações relacionais de alta granularidade, alcançando assim treinamento mais estável e desempenho superior em benchmarks matemáticos e científicos em comparação com abordagens existentes como o GRPO.

Autores originais: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

Publicado 2026-05-21
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno a resolver problemas matemáticos complexos. Você lhe dá uma pergunta, e ele retorna com oito tentativas diferentes de resposta.

No método antigo de ensino (chamado GRPO), você analisaria todas as oito respostas, calcularia a pontuação "média" e, em seguida, diria ao aluno: "Você fez melhor que a média, então bom trabalho!" ou "Você fez pior que a média, então tente novamente."

O problema com essa abordagem é que ela trata a "média" como um único número. Ela esquece os detalhes. Se o aluno teve uma resposta que estava quase perfeita e outra que estava completamente errada, o método antigo as vê apenas como "acima da média" e "abaixo da média". Ele perde a nuance de quanto uma foi melhor que a outra.

LamPO é uma maneira nova e mais inteligente de ensinar esses alunos de IA. Veja como funciona, usando analogias simples:

1. O Torneio "Cara a Cara" (Vantagem Decomposta em Pares)

Em vez de comparar cada resposta a uma média entediante, o LamPO coloca as respostas em um torneio. Ele pega todos os pares possíveis de respostas e os compara diretamente.

  • O Método Antigo: "Você está 2 pontos acima da média da turma."
  • O Método LamPO: "Sua resposta venceu a Resposta B por 5 pontos, mas a Resposta C venceu você por 2 pontos."

O LamPO observa a lacuna entre cada par individual de respostas. Se a resposta do aluno for ligeiramente melhor que uma errada, o LamPO dá um pequeno empurrão. Se for muito melhor, ele dá um grande impulso. Isso preserva a "informação relacional"—ele sabe exatamente quem venceu quem e por quanto.

2. O "Medidor de Confiança" (Ponderação)

Às vezes, o aluno de IA está muito inseguro sobre suas respostas. O LamPO possui um "medidor de confiança" especial.

  • Se a IA tem muita certeza de que a Resposta A é melhor que a Resposta B, o LamPO presta muita atenção a essa comparação.
  • Se a IA está confusa e acha que são quase iguais, o LamPO trata essa comparação com menos peso.

É como um treinador que ouve com mais atenção um jogador que tem 100% de certeza de sua estratégia, e com menos atenção quando o jogador está chutando.

3. O "Sistema de Dicas" (Recompensa Auxiliar Densa)

Geralmente, em matemática ou programação, você recebe apenas um sinal de "Certo" ou "Errado" no final. Isso é como um professor dizer "Errado" sem dizer onde você errou.

O LamPO adiciona um "Sistema de Dicas" quando o professor tem o gabarito correto. Ele usa uma ferramenta chamada ROUGE-L (que é como um "verificador de sobreposição de palavras") para ver o quanto o processo de pensamento do aluno se assemelha ao correto.

  • Mesmo que a resposta final esteja errada, se os passos do aluno parecerem 80% com os passos corretos, o LamPO lhe dá uma pequena "pontuação bônus" por estar no caminho certo. Isso impede que o aluno fique desanimado com uma pontuação total de "Zero".

Os Resultados: Uma Viagem Mais Suave

O artigo testou esse novo método (LamPO) contra o método antigo (GRPO) em quebra-cabeças difíceis de matemática e ciência (como os conjuntos de dados AIME e MATH).

  • Melhores Notas: Os modelos de IA treinados com LamPO obtiveram pontuações mais altas nesses testes.
  • Menos Drama: O processo de treinamento foi muito mais suave. O método antigo às vezes fazia a IA oscilar selvagemente entre bom e mau desempenho (como uma montanha-russa). LamPO manteve a aprendizagem estável, como uma viagem tranquila de elevador.
  • Eficiência: A IA aprendeu mais rápido, precisando de menos tentativas para ficar boa nas tarefas.

A Pegadinha (Limitações)

Há um pequeno custo para esse método. Como o LamPO compara cada resposta com todas as outras (como um torneio todos contra todos), leva um pouco mais de poder de computador para calcular todos esses pares. No entanto, o artigo observa que, para os tamanhos de grupo que eles usaram, esse custo foi muito pequeno e valeu a melhoria.

Em resumo: LamPO é um método de treinamento mais inteligente para IA. Em vez de apenas olhar para a média da turma, ele observa cada confronto direto, ouve a confiança da IA e fornece dicas úteis ao longo do caminho. Isso leva a modelos de raciocínio mais inteligentes e estáveis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →