← Últimos artigos
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

O artigo introduz a Otimização de Política de Evidência Contrastiva (CEPO), um novo método de auto-distilação RLVR que aproveita tanto os rollouts corretos quanto os rejeitados para gerar um sinal de recompensa contrastivo, identificando assim com precisão os passos decisivos de raciocínio enquanto evita o vazamento de informações e supera as bases existentes como o GRPO em benchmarks de raciocínio matemático multimodal.

Autores originais: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

Publicado 2026-05-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a resolver um problema matemático complexo. Você deixa o robô tentar resolvê-lo e, quando ele obtém a resposta correta, você lhe dá uma estrela dourada. Quando ele erra, você dá um sinal de "tente novamente".

É assim que funciona o treinamento atual de IA (chamado RLVR). Mas há um grande problema com essa abordagem: o robô recebe a mesma estrela dourada por cada palavra que digitou, mesmo que algumas palavras tenham sido insights brilhantes e outras apenas "hum", "então" ou "portanto".

É como um professor dar uma nota A+ a um aluno por todo um ensaio, mesmo que o aluno tenha escrito apenas uma frase excelente e o restante tenha sido apenas preenchimento. O robô não sabe quais palavras específicas realmente resolveram o problema, então ele aprende lentamente e fica confuso.

A Solução Antiga (e por que falhou)

Os cientistas tentaram corrigir isso dizendo: "Ok, vamos dizer ao robô a resposta correta antes de ele escrever e ver o que ele teria escrito de diferente".

No entanto, isso criou um novo problema chamado "Vazamento de Informação".

  • A Analogia: Imagine um aluno trapaceando em uma prova. Se você disser ao aluno o gabarito enquanto ele está escrevendo, ele pode apenas memorizar o gabarito em vez de aprender a matemática. Ele começa a escrever coisas que parecem o gabarito, mas que na verdade não fazem sentido. O artigo descobriu que os métodos anteriores fizeram exatamente isso: a IA começou a "trapacear" memorizando a resposta em vez de aprender o raciocínio.

A Nova Solução: CEPO

Os autores propõem um novo método chamado CEPO (Otimização de Política com Evidência Contrastiva). Veja como funciona, usando uma analogia simples:

A Entrevista "Polícia Bom, Polícia Mau"
Em vez de apenas perguntar ao robô: "Você obteve a resposta correta?", o CEPO faz uma pergunta mais afiada: "Esta palavra específica ajudou você a obter a resposta correta e prejudicou suas chances de obter a resposta errada?"

  1. O Bom Professor (Resposta Correta): A IA examina a solução correta e pergunta: "Eu teria escrito esta palavra se soubesse que a resposta estava certa?"
  2. O Mau Professor (Resposta Errada): A IA examina uma tentativa falha (uma que já tentou e errou) e pergunta: "Eu teria escrito esta palavra se estivesse tentando obter a resposta errada?"

A Comparação Mágica:

  • Palavras de "Preenchimento": Se a palavra for apenas "portanto" ou "o", tanto o Bom Professor quanto o Mau Professor a teriam escrito de qualquer maneira. Como ambos concordam, a palavra recebe uma pontuação neutra. Ela não ganha pontos extras.
  • Palavras "Decisivas": Se a palavra for uma etapa matemática crucial (como "dividir por 2"), o Bom Professor diz: "Sim, preciso disso!", mas o Mau Professor diz: "Não, eu não faria isso!". Como eles discordam, a IA percebe: "Aha! Esta palavra é a chave para resolver o problema!" Ela recebe um enorme aumento de crédito.

Por Que Isso é Melhor

  • Sem Trapacear: Como a IA compara o caminho "Certo" com um caminho "Errado do mesmo lote de tentativas", ela não vaza a resposta no processo de treinamento. Ela permanece segura e aprende a lógica real.
  • Precisão: Ela para de desperdiçar tempo elogiando o robô por escrever "o" ou "e". Ela concentra toda a elogia nos passos específicos que realmente resolveram o quebra-cabeça.

Os Resultados

O artigo testou isso em dois tamanhos de modelos de IA (2 bilhões e 4 bilhões de parâmetros) usando problemas matemáticos envolvendo geometria e lógica.

  • O Vencedor: O CEPO consistentemente superou os melhores métodos anteriores.
  • Os Perdedores: Os métodos antigos que tentaram "trapacear" vazando a resposta (chamados OPSD e SDPO) na verdade tiveram desempenho pior do que o robô não treinado. Isso provou que a teoria dos autores estava correta: se você não impedir a IA de memorizar a resposta, ela fica mais estúpida.

Resumo

Pense no CEPO como um holofote inteligente. Em vez de iluminar todo o palco (toda a frase) com uma luz brilhante, ele foca apenas no ator que realmente está entregando a piada final. Ele ignora o ruído de fundo e o preenchimento, garantindo que a IA aprenda exatamente o que fez a solução funcionar, sem memorizar acidentalmente o gabarito.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →