← Últimos artigos
🤖 AI

Trajectory-Refined Distillation

Este artigo introduz a Destilação de Trajetória Refinada (TRD), um novo método de destilação on-policy que mitiga o problema estrutural de "falha de prefixo" ao aplicar correções em nível de trajetória aos rollouts do aluno sob a orientação do professor, melhorando assim a precisão e a cobertura de raciocínio em vários benchmarks e escalas de modelos.

Autores originais: Li Jiang, Haoran Xu, Yichuan Ding, Amy Zhang

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Li Jiang, Haoran Xu, Yichuan Ding, Amy Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno (a IA) a resolver um problema matemático complexo. Você tem um professor brilhante (uma IA mais avançada) que sabe a resposta correta.

No método padrão descrito no artigo, chamado On-Policy Distillation (OPD), o processo funciona assim:

  1. O aluno tenta resolver o problema por conta própria.
  2. À medida que o aluno escreve seus passos, o professor observa e diz: "Para esta palavra específica que você acabou de escrever, aqui está a probabilidade do que vem a seguir".
  3. O aluno tenta ajustar seu cérebro para corresponder às probabilidades do professor para cada palavra.

O Problema: "Prefix Failure" (O Caminho Errado)

O artigo identifica uma falha importante no método padrão chamada Prefix Failure.

Imagine que o aluno está caminhando por um caminho para resolver o problema. No passo 3, ele toma um caminho errado. Ele agora está em uma rua sem saída.

  • O Dilema do Professor: O professor vê que o aluno está perdido. O professor sabe que o caminho correto começa com "Espere, na verdade..." e então segue uma direção completamente diferente.
  • A Confusão: Mas o professor é forçado a olhar para a localização atual do aluno (o beco sem saída). Assim, o conselho do professor torna-se uma mistura confusa de: "Fique neste beco sem saída porque você já está aqui" E "Vire imediatamente".
  • O Resultado: O aluno recebe um sinal fragmentado. Ele tenta aprender com o professor, mas como o aluno está preso no caminho errado, o conselho do professor fica fragmentado. O aluno aprende a ser "bom em estar perdido" em vez de aprender como voltar ao trilho certo. O artigo chama isso de "mistura bimodal" — o professor está tentando ensinar duas coisas opostas ao mesmo tempo, e o aluno fica confuso.

Soluções existentes tentaram corrigir isso apenas ajustando a "nota" (a função de perda/loss function) para palavras específicas, mas não corrigiram o fato de que o aluno ainda estava preso no caminho errado.

A Solução: Trajectory-Refined Distillation (TRD)

Os autores propõem um novo método chamado Trajectory-Refined Distillation (TRD). Em vez de apenas dar nota ao rascunho bagunçado do aluno palavra por palavra, eles mudam o fluxo de trabalho:

  1. O Rascunho: O aluno ainda dá uma primeira tentativa no problema (o "raw rollout").
  2. A Reescrita: Antes de avaliar, o professor pega esse rascunho bagunçado e o reescreve. O professor corrige os caminhos errados, corrige a lógica e produz uma versão limpa e perfeita da solução baseada no ponto de partida do aluno.
  3. A Lição: O aluno então aprende com esta versão limpa e corrigida, não com o original bagunçado.

A Analogia:

  • O Jeito Antigo: Você escreve uma história com um furo no enredo no meio. Seu editor lê seu texto e diz: "Para a palavra 'gato' no parágrafo 3, você deveria ter escrito 'cachorro'". Mas você ainda está preso no parágrafo 3 tentando entender por que escreveu 'gato' em primeiro lugar. É confuso.
  • O Jeito TRD: Você escreve a história com o furo no enredo. Seu editor pega seu rascunho, corrige o furo no enredo e reescreve toda a parte central para que a história flua perfeitamente. Então, você estuda a versão reescrita pelo editor para aprender a escrever histórias melhores na próxima vez.

Por Que Isso Funciona Melhor

  1. Corrige a Causa Raiz: Ao corrigir o "erro de direção" antes que o aluno tente aprender com ele, o conselho do professor não é mais confuso. É um caminho único e claro.
  2. Explora Novos Caminhos: Mesmo que o aluno acerte a resposta de primeira, o professor pode mostrar a ele um caminho diferente, mais curto ou mais inteligente para resolver o problema. Isso ensina o aluno a ser mais flexível.
  3. Eficiência: O artigo descobriu que os caminhos "reescritos" eram frequentemente muito mais curtos e claros do que as tentativas originais prolixas do aluno, o que, na verdade, tornou o treinamento mais rápido.

Os Resultados

Os pesquisadores testaram este método em competições matemáticas difíceis (como AIME e HMMT) e desafios de programação. Eles descobriram que:

  • O novo método (TRD) consistentemente superou os métodos antigos.
  • Foi especialmente bom em ajudar a IA a resolver os problemas mais difíceis onde ela geralmente ficava travada.
  • Funcionou tanto quando o professor era uma IA separada e maior quanto quando era a mesma IA atuando como seu próprio "professor inteligente" (usando uma técnica chamada "informação privilegiada").

Em suma, o artigo argumenta que, para ensinar uma IA de forma eficaz, você não deve apenas avaliar seus erros palavra por palavra enquanto eles estão acontecendo. Em vez disso, você deve deixar o professor corrigir todo o caminho primeiro e, então, deixar o aluno aprender com a jornada corrigida.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →