← Últimos artigos
💻 computer science

Draft-OPD: On-Policy Distillation for Speculative Draft Models

Este artigo apresenta o Draft-OPD, um framework de destilação on-policy que supera as limitações do ajuste fino supervisionado para decodificação especulativa, utilizando rolagens assistidas pelo modelo-alvo e reexecutando o rascunho a partir de posições de erro para alcançar uma aceleração sem perdas superior a 5x em modelos de raciocínio.

Autores originais: Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haodi Lei, Yafy Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando escrever uma história longa e complexa com um autor muito famoso e brilhante (o Modelo Alvo). Este autor é incrivelmente inteligente e escreve frases perfeitas, mas também é muito lento. Ele leva muito tempo para pensar em cada palavra antes de escrevê-la.

Para acelerar as coisas, você contrata um estagiário rápido e energético (o Modelo de Rascunho) para adivinhar as próximas palavras. O estagiário escreve algumas palavras rapidamente e, em seguida, o autor famoso as verifica. Se o estagiário estiver certo, o autor diz: "Ótimo, continue!" e segue em frente. Se o estagiário estiver errado, o autor risca o erro, escreve a palavra correta e recomeça.

Esse processo é chamado de Decodificação Especulativa. O objetivo é fazer com que o estagiário adivinhe tão bem que o autor raramente precise parar e corrigi-lo, fazendo com que toda a história seja escrita muito mais rápido.

O Problema: O "Livro Didático" vs. O "Jogo Real"

Por muito tempo, a maneira de treinar esses estagiários era como dar-lhes um livro didático. Você mostrava a eles histórias que o autor famoso já havia escrito e dizia: "Memorize esses padrões". Isso é chamado de Ajuste Fino Supervisionado (SFT).

No início, isso funciona muito bem. O estagiário fica cada vez melhor em copiar o livro didático. Mas, eventualmente, ele atinge um limite. Não importa o quanto mais ele estude o livro didático, ele para de ficar mais rápido em adivinhar em tempo real.

Por quê?
Porque o livro didático é estático. Ele apenas mostra os caminhos que o autor famoso percorreu. Mas, no jogo real, o estagiário é quem faz o primeiro movimento. Às vezes, o estagiário adivinha uma palavra estranha que o autor nunca escreveu no livro didático. Quando o estagiário comete um erro, o autor o corrige. Mas o estagiário nunca aprende com esse erro porque o livro didático não tinha aquele cenário específico de "adivinhação errada". O estagiário está estudando um mapa de uma cidade por onde ele nunca realmente passou.

A Solução: "Draft-OPD" (Aprendendo Fazendo)

Os autores deste artigo propõem um novo método de treinamento chamado Draft-OPD. Em vez de apenas ler o livro didático, eles deixam o estagiário praticar em um jogo simulado onde o autor famoso está lá para orientá-lo em tempo real.

Veja como funciona, usando uma analogia simples:

  1. A Execução Segura de Treino (Rolagem Assistida pelo Alvo):
    Imagine que o estagiário tenta escrever um parágrafo. Se ele ficar preso ou sair do caminho, o autor famoso intervém imediatamente para corrigi-lo e manter a história avançando. Isso garante que a sessão de treino não se transforme em uma bagunça de nonsense (o que acontece se o estagiário tentar escrever uma história inteira sozinho).

  2. A "Repetição do Erro" (O Segredo):
    Esta é a parte mais importante. Quando o estagiário faz uma adivinhação e o autor precisa corrigi-la, o sistema não apenas segue em frente. Ele aperta "Rebobinar".

    • Ele volta exatamente para o momento em que o estagiário fez a adivinhação errada.
    • Ele pede ao estagiário para tentar aquela adivinhação específica novamente.
    • Ele pede ao autor para explicar por que aquela adivinhação estava errada.

    Isso é como um treinador dizendo: "Pare! Você tentou chutar a bola para a esquerda, mas o goleiro estava lá. Vamos rebobinar e tentar novamente para que você aprenda a chutar para a direita." Isso ensina ao estagiário especificamente sobre os erros que ele comete, e não apenas os caminhos perfeitos que o autor percorreu.

  3. Pontuação Inteligente (Destilação Consciente de Aceitação):
    O sistema trata as adivinhações do estagiário de forma diferente com base no resultado:

    • Se o estagiário estava certo: O sistema diz: "Bom trabalho, continue fazendo exatamente o que você fez." (Reforçar os bons hábitos).
    • Se o estagiário estava errado: O sistema diz: "Você estava confiante nesta resposta errada, mas estava errada. Vamos focar fortemente em corrigir este tipo específico de erro." (Punir os erros confiantes).

Os Resultados

O artigo testou esse novo método em alguns modelos de IA muito avançados (chamados de "Modelos Pensantes" porque são bons em matemática e programação).

  • Método Antigo (Aprendizado com Livro Didático): O estagiário conseguiu acelerar o processo de escrita em cerca de 4,5 vezes.
  • Novo Método (Draft-OPD): O estagiário acelerou as coisas em mais de 5 vezes.

Em termos simples, o novo método de treinamento fez o estagiário ficar muito melhor em adivinhar, de modo que o autor famoso teve que parar e corrigi-lo muito menos frequentemente. Isso significa que a história é escrita muito mais rápido, sem perder nenhuma qualidade.

Resumo

O artigo argumenta que, para tornar a IA mais rápida, não podemos apenas ensiná-la a copiar exemplos perfeitos. Temos que deixá-la praticar, deixá-la cometer erros e, em seguida, ensiná-la especificamente a corrigir esses erros. Ao relembrar os momentos em que a IA adivinhou errado, podemos treinar uma IA de "rascunho" que é muito melhor em prever o futuro, tornando todo o sistema significativamente mais rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →