← Últimos artigos
💻 computer science

A Systematic Post-Train Framework for Video Generation

Este artigo propõe um framework sistemático de pós-treinamento para modelos de difusão de vídeo que integra Ajuste Fino Supervisionado, uma nova etapa de RLHF baseada em Otimização de Política Relativa de Grupo, aprimoramento de prompts e otimização de inferência para reduzir a lacuna entre o desempenho no pré-treinamento e a implantação no mundo real, melhorando significativamente o seguimento de instruções, a coerência temporal e a qualidade visual, ao mesmo tempo que reduz os custos de inferência.

Autores originais: Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

Publicado 2026-04-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef brilhante, de classe mundial, que passou anos aprendendo a cozinhar a partir de todos os livros de receitas existentes. Este chef (o Modelo Pré-treinado) pode criar pratos deslumbrantes e complexos. No entanto, se você pedir para "fazer um macarrão apimentado com queijo extra", ele pode ficar confuso, queimar a cozinha ou servir um prato que parece ótimo, mas não tem nenhum sabor de macarrão. Eles são talentosos, mas imprevisíveis e caros de operar.

Este artigo propõe um campo de treinamento de quatro etapas para transformar esse chef brilhante, mas errático, em um profissional confiável, eficiente e obediente, capaz de trabalhar em um restaurante movimentado.

Veja como as quatro etapas funcionam, usando analogias simples:

Etapa 1: O Campo de Treinamento de "Obediência Básica" (Ajuste Fino Supervisionado)

O Problema: O chef sabe cozinhar, mas não ouve bem. Ele pode ignorar seu pedido ou criar suas próprias regras.
A Solução: Antes de ensinar truques avançados, colocamos ele em um campo de treinamento rigoroso. Mostramos a ele milhares de exemplos do que fazer exatamente quando recebe uma ordem específica.
O Resultado: O chef para de inventar suas próprias regras. Ele aprende a dizer "Sim, Chef" e a seguir instruções de forma confiável. Isso cria uma base estável para que ele não enlouqueça quando começarmos a pressioná-lo mais forte depois.

Etapa 2: A Competição de "Degustação" (Aprendizado por Reforço)

O Problema: O chef agora segue ordens, mas a comida ainda pode parecer um pouco estranha, o molho pode estar grumoso ou o prato pode desmontar após alguns minutos.
A Solução: Não apenas dizemos ao chef o que fazer; deixamos que ele tente diferentes versões do mesmo prato e os julgamos uns contra os outros.

  • A Analogia: Imagine que o chef faz 8 versões de um prato de macarrão. Um painel de juízes (os Modelos de Recompensa) os prova e escolhe os vencedores com base em quatro coisas:
    1. Ele parece bom? (Estética Visual)
    2. O molho está liso? (Qualidade de Movimento)
    3. Tem o sabor do pedido? (Alinhamento de Texto)
    4. A apresentação é bonita? (Estética da Imagem)
  • A Magia: Em vez de adivinhar, o chef aprende comparando suas próprias tentativas. Se a Versão A parece melhor que a Versão B, o chef aprende a fazer mais do que a Versão A fez. Isso é chamado de GRPO (Otimização de Política Relativa em Grupo). É como um time de esportes praticando contra si mesmo para ficar mais rápido, em vez de esperar um treinador gritar com eles.

Etapa 3: A Atualização de "Tradutor" (Melhoria de Prompt)

O Problema: Às vezes o chef é ótimo, mas você (o cliente) é ruim em descrever o que quer. Você diz: "Faça um vídeo legal", e o chef faz algo chato porque "legal" é vago.
A Solução: Contratamos um tradutor inteligente (um Modelo de Linguagem) para ficar entre você e o chef.

  • A Analogia: Você diz ao tradutor: "Quero um vídeo legal". O tradutor reescreve isso como: "Um tiro cinematográfico de uma cidade futurista ao pôr do sol com luzes de neon e carros voadores".
  • O Treinamento: Este tradutor também é treinado usando a mesma competição de "Degustação". Se o prompt reescrito pelo tradutor levar a um prato melhor, o tradutor recebe uma pontuação alta. Agora, mesmo que você dê uma ordem vaga, o tradutor a transforma em uma receita perfeita para o chef.

Etapa 4: O Treinamento de "Corrida de Velocidade" (Distilação Autoregressiva)

O Problema: O chef agora é incrível, mas é lento. Ele leva horas para cozinhar um único prato porque está verificando cada ingrediente contra todos os outros na cozinha.
A Solução: Ensinamos ao chef uma nova maneira mais rápida de cozinhar que não exige verificar tudo de uma vez.

  • A Analogia: Em vez de olhar para toda a cozinha para decidir o que fazer a seguir, o chef aprende a cozinhar quadro a quadro (ou passo a passo), usando apenas o que acabou de fazer para decidir o próximo passo.
  • O Resultado: O chef agora pode servir o prato muito mais rápido (inferência eficiente) sem perder a qualidade que aprendeu nas etapas anteriores. É como trocar uma transmissão manual lenta e cuidadosa por uma automática de alta velocidade.

O Resultado Final

Ao final deste processo de quatro etapas, o modelo de geração de vídeo está:

  1. Obediente: Ele realmente ouve suas instruções.
  2. Bonito: Os vídeos parecem suaves, realistas e de alta qualidade.
  3. Robusto: Não quebra quando você dá um prompt complexo.
  4. Rápido: Pode gerar vídeos com velocidade suficiente para ser útil no mundo real.

O artigo testou isso em seu modelo de vídeo interno e descobriu que a etapa de "Degustação" sozinha tornou os vídeos 31% melhores em avaliações humanas, e adicionar o "Tradutor" os tornou mais 20% melhores. O resultado é um sistema pronto para ser usado em aplicações reais, em vez de ser apenas um experimento legal em um laboratório.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →