← Últimos artigos
💬 NLP

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

Este artigo apresenta o OPDLM, um framework de eficiência de dados que transforma modelos de linguagem autorregressivos em modelos de linguagem de difusão via destilação on-policy, eliminando efetivamente o descompasso entre treinamento e inferência e preservando o conhecimento prévio ao reduzir os requisitos de tokens de treinamento em até 7.000x.

Autores originais: Xingyu Su, Jacob Helwig, Shubham Parashar, Atharv Chagi, Lakshmi Jotsna, Degui Zhi, James Caverlee, Dileep Kalathil, Shuiwang Ji

Publicado 2026-06-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xingyu Su, Jacob Helwig, Shubham Parashar, Atharv Chagi, Lakshmi Jotsna, Degui Zhi, James Caverlee, Dileep Kalathil, Shuiwang Ji

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef brilhante e de classe mundial (o Modelo Autoregressivo, ou ARLM) que passou anos aperfeiçoando seu ofício cozinhando um prato de cada vez, passo a passo, sempre olhando para o que acabou de colocar na panela para decidir o próximo ingrediente. Este chef é incrivelmente rápido e sabe muito, mas ele só sabe cozinhar em linha reta.

Agora, imagine que você quer que este chef aprenda um novo estilo de cozinha revolucionário chamado Difusão (o Modelo de Linguagem de Difusão, ou DLM). Neste novo estilo, em vez de cozinhar passo a passo, o chef começa com uma tigela de ingredientes aleatórios e irreconhecíveis (uma sequência "mascarada") e os refina gradualmente em uma refeição perfeita de uma só vez. Este novo estilo é ótimo porque ele pode adivinhar vários ingredientes ao mesmo tempo, podendo cozinhar muito mais rápido.

O Problema: A Lacuna de "Tradução"
O artigo explica que as tentativas anteriores de transformar o chef passo a passo no chef "de uma só vez" tiveram dois grandes problemas:

  1. A Perda de Memória: Quando você força o chef a parar de cozinhar passo a passo e começar a adivinhar o prato inteiro de uma vez, eles tendem a esquecer os milhares de receitas que aprenderam durante seus anos de treinamento. É como dizer a um mestre pianista para de repente tocar de olhos fechados e em um tom diferente; ele pode perder o seu toque.
  2. O Descompasso entre Prática e Performance: No método antigo, o chef praticava jogando ingredientes aleatoriamente em uma tigela e tentando consertá-los (mascaramento aleatório). Mas no mundo real (inferência), o chef na verdade refina o prato com base em quão confiante ele está em seus palpites. A prática não correspondia à performance, então o chef estava sempre um pouco enferrujado quando importava.

A Solução: OPDLM (O Mentor "On-Policy")
Os autores introduzem um novo método chamado OPDLM (Modelo de Linguagem de Difusão On-Policy). Pense nisso como um campo de treinamento inteligente que resolve ambos os problemas usando uma técnica chamada Destilação On-Policy.

Veja como funciona, usando uma analogia simples:

  • O Estudante e o Professor: O "Estudante" é o novo chef de Difusão. O "Professor" é o chef passo a passo original, congelado (que é mantido em uma vitrine, inalterado).
  • O Toque "On-Policy": Em vez de praticar em tigelas de ingredientes aleatórias e bagunçadas (o jeito antigo), o chef Estudante tem permissão para cozinhar uma refeição completa usando seu próprio novo estilo "de uma só vez". Eles geram seu próprio caminho de uma tigela bagunçada até um prato finalizado.
  • A Destilação: Assim que o estudante termina uma refeição, o professor congelado olha para aquela mesma refeição específica e diz: "Se eu tivesse cozinhado este prato específico, aqui está exatamente o que eu teria dito para cada ingrediente que faltava".
  • O Aprendizado: O Estudante compara seu palpite com a resposta do Professor e aprende com ela.

Por que Isso é um Diferencial
Porque o Estudante pratica em refeições que eles mesmos geram (correspondendo à performance real) e é corrigido pelo especialista original, eles não esquecem seu conhecimento antigo e aprendem muito mais rápido.

O artigo afirma que este método é incrivelmente eficiente:

  • Economia de Dados: Requer de 15 a 7.000 vezes menos exemplos de treinamento do que os métodos anteriores. Se outros métodos precisassem ler uma biblioteca de um bilhão de livros para aprender, este método pode precisar de apenas algumas dezenas.
  • Sem Custo de "Pré-treinamento": Você não precisa treinar um novo chef de Difusão do zero (o que é caro e lento). Você apenas pega um especialista existente, dá a ele este treinamento específico e ele se transforma.
  • Mantendo a Magia: O novo modelo mantém as habilidades de "pensamento" e "multilinguismo" do chef original, mesmo que isso não tenha sido explicitamente ensinado durante a transformação. É como se o chef naturalmente lembrasse de falar francês ou resolver enigmas complexos porque o treinamento preservou seu cérebro original.

O Resultado
O artigo mostra que este novo chef "OPDLM" desempenha tão bem quanto os melhores chefs existentes em tarefas de matemática, programação e conhecimentos gerais, mas chegou lá com uma fração minúscula do esforço e dos dados. Ele transforma o difícil processo de mudar o "cérebro" de um modelo em um upgrade de pós-treinamento simples e eficiente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →