← Últimos artigos
🤖 machine learning

Self-Distilled Policy Gradient

Este artigo propõe o SDPG, um framework de gradiente de política autodistilada que integra autodestilação on-policy via perda KL reversa de vocabulário completo com vantagens de verificador grupo-relativas e regularização de política de referência para aumentar a estabilidade e o desempenho de aprendizado por reforço de recompensa esparsa.

Autores originais: Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

Publicado 2026-06-04
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Ensinando um Aluno a Pensar Melhor

Imagine que você está treinando um aluno brilhante, mas inexperiente (o modelo de IA) para resolver problemas matemáticos difíceis. O aluno é inteligente, mas muitas vezes se perde em seus próprios passos de raciocínio.

Atualmente, a forma padrão de treinar esses alunos é o Aprendizado por Reforço com Recompensas Verificáveis (RLVR). Pense nisso como um exame de "Aprovado/Reprovado". O aluno escreve uma solução inteira e um fiscal rigoroso (o Verificador) checa a resposta final.

  • Se a resposta estiver correta: O aluno ganha uma estrela dourada (+1).
  • Se a resposta estiver errada: Ele recebe um X vermelho (0).

O Problema: Este sistema de "Aprovado/Reprovado" é muito vago. Se o aluno errar a resposta, ele não sabe qual passo específico causou o erro. Ele errou a álgebra no passo 3? Ou a lógica no passo 7? Como o feedback é esparso (apenas ao final), o aluno aprende lentamente e às vezes fica confuso, o que leva a um treinamento instável.

A Solução: O Tutor "Auto-Destilado"

Os autores propõem um novo método chamado SDPG. Em vez de apenas esperar por uma nota final, o aluno recebe uma "folha de dicas" ou uma "visão privilegiada" da solução enquanto está escrevendo.

Aqui está como o SDPG funciona, dividido em três partes:

1. Os Dois Chapéus: Aluno e Professor

No ensino tradicional, você precisa de um professor grande e caro (Professor) para ensinar um aluno pequeno. Isso é difícil porque você precisa rodar dois computadores massivos ao mesmo tempo.
Na Auto-Destilação, o aluno usa dois chapéus:

  • O Chapéu de Aluno: O modelo tenta resolver o problema usando apenas a pergunta (sem dicas).
  • O Chapéu de Professor: O mesmo modelo tenta resolver o problema novamente, mas desta vez ele possui um "contexto privilegiado" (uma dica, um caminho de solução ou um guia de raciocínio gerado por uma IA poderosa como o Gemini).

O modelo aprende tentando fazer com que as previsões do seu "Chapéu de Aluno" correspondam às previsões do seu "Chapéu de Professor". É como um músico praticando uma música: ele ouve a gravação perfeita (Professor) e tenta combinar sua própria execução (Aluno) nota por nota. Isso fornece um feedback denso, passo a passo, em vez de apenas uma nota final.

2. A Rede de Segurança: O Filtro de "Boa Ideia"

Existe um risco aqui. Se o aluno estiver em um caminho completamente errado (por exemplo, resolvendo o problema errado inteiramente), o "Chapéu de Professor" ainda pode dar a ele uma solução perfeita para o problema errado. Se o aluno copiar cegamente, ele apenas ficará melhor em estar errado.

O SDPG resolve isso com o Gating de Vantagem Positiva (Positive Advantage Gating).

  • A Analogia: Imagine um treinador observando o aluno. Se o aluno estiver sainًdo do campo (obtendo uma pontuação ruim do Verificador), o treinador diz: "Pare! Não ouça a solução perfeita ainda, porque você está resolvendo a coisa errada".
  • O sistema só permite que o aluno aprenda com o "Chapéu de Professor" se o "Chapéu de Aluno" já tiver produzido um caminho que o Verificador considera promissor (uma recompensa positiva). Isso garante que o aluno apenas internalize o raciocínio correto, não apenas respostas perfeitas para perguntas ruins.

3. O Aquecimento e o Resfriamento

Os autores também perceberam que você não pode forçar o aluno a ouvir o professor imediatamente ou para sempre.

  • Aquecimento: No início, o aluno está confuso demais para aprender com o professor. Então, eles começam apenas com o exame de "Aprovado/Reprovado". Assim que começam a acertar algumas respostas, eles ligam lentamente as lições do "Chapéu de Professor".
  • Resfriamento: Perto do fim do treinamento, o aluno já internalizou as lições. Se continuarem ouvindo o professor demais, podem parar de pensar por conta própria (um problema chamado "colapso de modo" ou mode collapse). Por isso, o sistema desliga gradualmente a voz do professor, deixando o aluno confiar em suas próprias habilidades.

O Resultado

Ao combinar a nota final (do Verificador) com o guia passo a passo (do Auto-Professor), mas filtrando para que o aluno aprenda apenas de caminhos bons, a IA torna-se:

  1. Mais Estável: Ela não trava ou fica confusa durante o treinamento.
  2. Mais Inteligente: Ela aprende a raciocinar melhor porque recebe feedback em cada passo, não apenas no final.
  3. Mais Rápida: Ela alcança altos níveis de desempenho em menos etapas de treinamento do que os métodos anteriores.

Em resumo, o SDPG é como dar a um aluno um tutor que só fala quando o aluno está no caminho certo, e depois deixa o aluno fazer a prova sozinho assim que ele domina o conteúdo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →