← Últimos artigos
🤖 machine learning

On-Policy Delta Distillation

Este artigo introduz o On-Policy Delta Distillation (OPD2^2), um novo método de pós-treinamento para aprendizagem por reforço que utiliza um "sinal delta" — representando a diferença entre um modelo professor e o seu modelo base antes do ajuste de raciocínio — para transferir capacidades de raciocínio de forma mais eficaz e alcançar um desempenho sólido em benchmarks de matemática, ciência e código com um pós-treinamento mínimo.

Autores originais: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

Publicado 2026-07-17
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os computadores são como bibliotecas gigantescas e famintas que leram quase todos os livros já escritos. Essas bibliotecas, chamadas Modelos de Linguagem de Grande Escala (LLMs), são incrivelmente inteligentes em adivinhar a próxima palavra em uma frase. Mas apenas saber como terminar uma frase não é suficiente para resolver um problema matemático difícil ou depurar um programa de computador quebrado. Para se tornarem realmente bons nessas tarefas, precisamos ensiná-los a pensar.

Pense nesse processo como treinar um aluno. Primeiro, o aluno lê uma biblioteca massiva (pré-treinamento) para aprender o básico da linguagem. Depois, um professor entra para dar lições específicas sobre como resolver quebra-cabeças (pós-treinamento). Geralmente, os professores usam dois métodos principais: ou eles mostram ao aluno a resposta perfeita e dizem: "Copie isto" (Ajuste Fino Supervisionado), ou deixam o aluno tentar, dão uma nota e dizem: "Tente novamente, mas faça melhor na próxima vez" (Aprendizado por Reforço). Recentemente, um novo método chamado "Destilação On-Policy" tornou-se popular. É como um professor observando o aluno resolver um problema em tempo real e sussurrando: "Sim, essa palavra foi boa", ou "Não, essa palavra estava errada", com base no que o professor diria. É eficiente e evita o negócio complicado de projetar sistemas de graduação complexos.

Mas aqui está a pegadinha: mesmo este método inteligente tem uma falha. Quando o professor sussurra, ele pode acidentalmente sussurrar coisas que o aluno já sabe, como ser educado ou contar uma história, em vez dos momentos específicos de "eureka!" da lógica que tornam o professor um gênio no raciocínio. O artigo que você está prestes a ler faz uma pergunta simples: E se pudéssemos filtrar o ruído e ensinar ao aluno apenas os novos truques que o professor aprendeu?

Este artigo introduz uma técnica inteligente chamada On-Policy Delta Distillation (OPD2). Os pesquisadores perceberam que um "Professor de Raciocínio" é, na verdade, dois modelos em um: o modelo "Base" original (antes de aprender a raciocinar) e o modelo de "Raciocínio" (após aprender a raciocinar). Se você subtrair os pensamentos do modelo Base dos pensamentos do modelo de Raciocínio, você obtém um "Sinal Delta". Este sinal é como um vídeo de melhores momentos de exatamente o que mudou quando o professor aprendeu a pensar. Em vez de apenas copiar a resposta final do professor, o aluno aprende com este "Sinal Delta" — a diferença específica que representa o salto na capacidade de raciocínio.

Os autores testaram essa ideia misturando problemas de matemática, ciência e programação. Eles descobriram que usar este "Sinal Delta" como a recompensa principal ajudou os alunos a aprenderem muito mais rápido e melhor do que os métodos antigos. Na verdade, seu novo método, o OPD2, superou consistentemente as técnicas anteriores em diferentes tamanhos de modelos, desde modelos minúsculos de 1,7 bilhão de parâmetros até modelos massivos de 8 bilhões. Funcionou tão bem que um modelo menor treinado com OPD2 às vezes podia superar um modelo muito maior treinado com métodos antigos. O artigo sugere que, ao focar apenas na mudança de pensamento, em vez de toda a personalidade do professor, podemos ensinar a IA a raciocinar de forma mais eficaz sem perder tempo com o que ela já sabe.

A História do Sinal "Delta"

Vamos mergulhar na mecânica desta descoberta usando uma analogia simples. Imagine que você está aprendendo a jogar um videogame complexo. Você tem uma versão "Base" do seu personagem que sabe andar, pular e falar. Então, você recebe uma versão "Pro" desse personagem que dominou os níveis mais difíceis do jogo.

A maneira antiga de ensinar (Destilação On-Policy padrão) é como o personagem Pro parado ao seu lado dizendo: "Faça exatamente o que eu faço". O problema é que o personagem Pro ainda caminha e fala exatamente como o personagem Base fazia. Então, quando o Pro diz: "Ande para frente", ele está apenas repetindo algo que você já sabe fazer. Você passa seu tempo praticando o ato de andar, não aprendendo os combos secretos que o tornam um profissional.

Os autores deste artigo, Byeongho Heo, Jaehui Hwang, Sangdoo Yun e Dongyoon Han, do NAVER AI Lab, propuseram uma abordagem diferente. Eles perguntaram: "E se ensinássemos ao aluno apenas a diferença entre o Pro e o Base?"

Essa diferença é o Sinal Delta.

  • O Modelo Base: Sabe falar e escrever, mas pode tropeçar em uma lógica complexa.
  • O Professor de Raciocínio: Sabe falar, escrever e resolver quebra-cabeças lógicos difíceis.
  • O Delta: A "mágica" específica que o Professor aprendeu para resolver o quebra-cabeça.

No artigo, eles visualizam isso com nuvens de palavras. Quando olharam para o que o método antigo ensinava, estava cheio de palavras genéricas como "ver", "tentar" e "verificar". Mas quando olharam para o Sinal Delta, as palavras que se destacavam eram conectores lógicos como "portanto", "entretanto", "note" e "em vez disso". Estas são as palavras que colam um argumento lógico. O Sinal Delta efetivamente filtra o conteúdo "tedioso" que o aluno já conhece e destaca o "ingrediente secreto" do raciocínio.

Como Eles Construíram o OPD2

Para fazer isso funcionar, os pesquisadores tiveram que resolver alguns problemas complicados. Se você apenas der ao aluno o Sinal Delta, ele pode ficar confuso porque o sinal não leva em conta o que o próprio aluno está fazendo. É como um treinador gritando instruções sem observar a posição atual do jogador.

Então, eles adicionaram dois ingredientes especiais à sua receita:

  1. Centralização: Eles ajustaram o sinal para que ele fosse equilibrado em torno de zero. Isso ajuda o aluno a entender se um movimento é "melhor que a média" ou "pior que a média", em vez de apenas receber uma pontuação bruta que pode ser enganosa.
  2. Condicionamento Conjunto: Eles garantiram que o novo Sinal Delta só entre em ação quando concorda com o método antigo e padrão. Isso atua como uma rede de segurança. Se o Sinal Delta tentar empurrar o aluno em uma direção estranha que contradiga o estilo geral do professor, o sistema diz: "Espere um pouco" e interrompe a atualização. Isso evita que o aluno fique confuso ou esqueça como falar adequadamente enquanto tenta aprender a pensar.

Os Resultados: Um Novo Campeão

A equipe testou seu novo método, que nomearam de OPD2, contra o padrão antigo (OPD) e um método mais recente e avançado chamado ExOPD. Eles usaram uma mistura de 100.000 perguntas de conjuntos de dados de matemática, ciência e programação. Testaram isso em vários modelos, incluindo a família Qwen3 (tamanhos 1.7B, 4B e 8B) e o modelo Gemma4.

Os resultados foram impressionantes. No modo "sem pensamento" (onde os modelos respondem rapidamente sem mostrar o passo a passo), o OPD2 superou consistentemente os outros.

  • Para o modelo Qwen3-1.7B em matemática, o OPD2 aumentou a pontuação média de 34,8 para 54,6. Esse é um salto enorme, superando o próximo melhor método por mais de 3 pontos.
  • Para o Qwen3-4B, o OPD2 atingiu uma média de 70,3, enquanto o anterior melhor (ExOPD) estava em 66,4.
  • Surpreendentemente, o modelo 4B treinado com OPD2 teve um desempenho melhor do que o modelo 8B treinado com os métodos antigos. Isso sugere que como você treina importa tanto quanto o tamanho do seu modelo.

Eles também testaram os modelos no modo "pensando", onde os modelos já são bastante inteligentes e mostram seus passos de raciocínio. É mais difícil melhorar isso porque os modelos já são bons. No entanto, o OPD2 ainda conseguiu extrair um desempenho extra. Por exemplo, no benchmark de matemática HMMT25, o modelo Qwen3-8B melhorou sua pontuação de 44,3 para 52,3 com o OPD2, enquanto os outros métodos na verdade pioraram a pontuação ou mal mudaram.

O método também funcionou no Gemma4, uma família diferente de modelos. Enquanto outros métodos lutaram ou até pioraram o modelo, o OPD2 melhorou as pontuações de matemática de 60,6 para 67,8. Isso mostra que a ideia de usar o "Sinal Delta" não é apenas uma coincidência para um modelo específico; parece ser um princípio geral que ajuda a IA a pensar melhor.

Por Que Isso Importa

O artigo sugere que a chave para ensinar a IA a raciocinar não é apenas alimentá-la com mais dados ou tornar o professor maior. É ser preciso sobre o que estamos ensinando. Ao isolar as mudanças específicas que ocorrem quando um modelo aprende a raciocinar (o Delta), podemos transferir essa habilidade de forma muito mais eficiente.

Os autores observam que este método é computacionalmente eficiente. Ele leva cerca de 24-28% mais tempo para treinar do que o método padrão porque o computador precisa rodar o modelo "Base" em segundo plano para calcular a diferença. No entanto, como essas sessões de treinamento são geralmente curtas (muitas vezes menos de uma passagem completa pelos dados), esse pequeno custo adicional vale o enorme ganho de desempenho.

Em resumo, o OPD2 é como um mestre chef que percebe que, para ensinar um aprendiz o segredo de uma sopa perfeita, ele não deve apenas dizer "adicione sal". Ele deve dizer: "Adicione esta quantidade a mais de sal do que você costuma fazer, porque essa é a diferença entre uma sopa boa e uma ótima". Ao focar na diferença, o aluno aprende o segredo mais rápido e melhor. O artigo conclui que esta abordagem é um passo significativo para tornar a IA mais inteligente, mais rápida e mais capaz de resolver os problemas complexos do futuro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →