← Últimos artigos
🤖 machine learning

Self-Distilled RLVR

O artigo propõe o RLSD, um método que combina RLVR e auto-distilação para utilizar as diferenças de política em nível de token como magnitudes de atualização e o feedback ambiental como direção, superando assim as limitações de vazamento de informação e instabilidade observadas na auto-distilação puramente on-policy.

Autores originais: Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan

Publicado 2026-04-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um aluno muito inteligente (um Modelo de IA) a resolver problemas de matemática complexos ou raciocinar sobre imagens. O objetivo é fazer com que ele aprenda sozinho, mas de forma eficiente e sem "trapacear".

Este artigo apresenta uma nova técnica chamada RLSD (Aprendizado por Reforço com Auto-Distilação) e explica por que uma técnica anterior, chamada OPSD, falhava de uma maneira muito estranha.

Vamos usar uma analogia de um aluno e um professor para entender o que está acontecendo.

1. O Problema: O Aluno que "Vê o Gabarito" (Falha do OPSD)

Antes do RLSD, existia um método chamado OPSD. A ideia era genial: usar o próprio modelo como professor e aluno ao mesmo tempo.

  • O Aluno: Tenta resolver o problema apenas com a pergunta.
  • O Professor: É o mesmo modelo, mas ele recebe a pergunta E a resposta correta (o "gabarito" ou pista privilegiada) para ensinar o aluno.

O que deu errado?
Imagine que o professor está no mesmo quarto que o aluno, mas o aluno não sabe disso. O professor diz: "Escreva 'X' aqui". O aluno obedece.
O problema é que, com o tempo, o aluno começa a perceber que o professor só dá instruções específicas quando ele já sabe a resposta. O aluno começa a tentar adivinhar o que o professor está pensando, em vez de aprender a lógica da matemática.

No mundo da IA, isso se chama Vazamento de Informação Privilegiada.

  • A Analogia: É como se o aluno, durante a prova final (quando o professor não está lá), começasse a falar sozinho: "Espera, o professor me disse para usar 9 valores... ah, mas ele não está aqui! Vou chutar que são 9 valores mesmo!".
  • O Resultado: O modelo começa a "alucinar" referências a respostas que ele nunca deveria ter visto. Ele melhora rápido no começo, mas depois de um tempo, ele começa a piorar porque está aprendendo a "imitar o professor" em vez de "aprender a matéria".

2. A Solução: O RLSD (O Professor que dá Dicas, não Respostas)

Os autores do artigo perceberam que o erro não era usar o professor, mas como o professor estava sendo usado. Eles criaram o RLSD.

Aqui está a grande mudança de mentalidade:

  • No método antigo (OPSD): O aluno tentava copiar exatamente o que o professor escrevia (distribuição de probabilidade). Isso forçava o aluno a "ler a mente" do professor.
  • No novo método (RLSD): O professor não diz o que escrever. Ele apenas avalia o quanto cada palavra escrita pelo aluno foi boa ou ruim, com base na resposta correta que ele tem.

A Analogia do Treinador Esportivo:
Imagine um treinador de futebol (o Professor) e um jogador (o Aluno).

  • Método Antigo (OPSD): O treinador pega a bola e joga exatamente para onde o jogador deveria chutar, dizendo: "Chute aqui!". O jogador aprende a seguir o treinador, mas não entende o jogo. Se o treinador sumir, o jogador não sabe jogar.
  • Método Novo (RLSD): O jogador chuta a bola. O treinador, que tem a visão de cima (o "gabarito"), não muda o chute do jogador. Em vez disso, ele grita:
    • Se o jogador chutou para o gol (resposta certa): "Ótimo chute! Mas você poderia ter dado mais força na perna esquerda (palavra específica)!" -> Recompensa alta.
    • Se o jogador chutou para fora (resposta errada): "Que chute ruim! E você errou feio na direção (palavra específica)!" -> Punição alta.

O treinador não muda a direção do chute (isso é decidido pelo resultado do jogo: gol ou não gol). Ele apenas ajusta a intensidade da recompensa ou punição para cada palavra específica.

3. Por que o RLSD é melhor?

  1. Sem Vazamento: Como o professor nunca diz "escreva X", o aluno nunca tenta adivinhar o que o professor está pensando. Ele foca apenas em acertar o problema.
  2. Aprendizado Fino: O método antigo dava a mesma recompensa para toda a frase se a resposta estivesse certa. O RLSD sabe exatamente qual palavra foi a chave para o acerto e qual palavra foi o erro. É como dar uma nota de 10 para a conclusão e 2 para o cálculo errado, em vez de dar 6 para a folha inteira.
  3. Estabilidade: O aluno continua melhorando por muito mais tempo, sem começar a "alucinar" com pistas que não existem.

Resumo em uma frase

O RLSD é como ter um treinador que não faz o trabalho por você, mas que, ao final de cada jogada, te diz exatamente quais movimentos foram brilhantes e quais foram desastrosos, permitindo que você aprenda a jogar de verdade, sem depender de segredos que só ele conhece.

Isso faz com que a Inteligência Artificial aprenda a raciocinar de forma mais sólida, rápida e estável, superando os métodos anteriores que faziam o modelo "colar na prova" mentalmente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →