← Últimos artigos
🤖 machine learning

Parallel Decoding Distillation for Fast Image and Video Generation

Este artigo apresenta o Parallel Decoding Distillation (PDD), um método baseado em trajetórias escalável e simplificado que acelera a geração de imagens e vídeos ao prever múltiplos passos de denoising por avaliação de rede, alcançando o estado da arte com 4–8 avaliações de função enquanto melhora significativamente a diversidade de vídeo em comparação com técnicas de destilação existentes.

Autores originais: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

Publicado 2026-07-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a pintar uma obra-prima ou a dirigir um filme. No mundo da inteligência artificial, isso é feito usando modelos de "difusão" ou "fluxo". Pense nesses modelos como artistas que começam com uma tela coberta de ruído estático — como uma TV sintonizada em um canal morto — e, lentamente, passo a passo, limpam essa imagem até que uma imagem ou vídeo claro apareça. O problema é que esse processo de limpeza é incrivelmente lento. Para obter um resultado de alta qualidade, o robô pode precisar dar centenas de pequenos passos, verificando seu trabalho em cada um deles. É como tentar atravessar uma sala dando passos de um milímetro por vez; você chegará lá, mas levará uma eternidade.

Para acelerar isso, os cientistas têm tentado ensinar esses robôs a dar saltos maiores. Alguns métodos tentam adivinhar o destino final em um único salto gigante, enquanto outros tentam aprender o "caminho" que o robô deve seguir para que ele possa pular as partes chatas do meio. No entanto, os melhores métodos atuais para vídeo são complicados. Eles frequentemente dependem de truques de treinamento complexos e instáveis que podem fazer o robô esquecer como se mover, resultando em vídeos que parecem ótimos, mas que estão congelados no tempo, ou que colapsam em padrões repetitivos e entediantes. A grande questão é: Podemos ensinar esses modelos a se mover de forma rápida e suave sem perder a magia de sua criatividade?

Este artigo apresenta uma nova técnica chamada Destilação de Decodificação Paralela (PDD - Parallel Decoding Distillation), que atua como um treinador super eficiente para esses artistas de IA. Em vez de forçar o robô a dar um passo de cada vez, a PDD o ensina a prever uma sequência inteira de passos em um único olhar. Imagine que você está caminhando por um corredor. Um robô normal para em cada porta para verificar se ela está aberta antes de seguir para a próxima. A PDD, no entanto, olha pelo corredor inteiro, prevê exatamente como o chão parecerá sob seus pés para os próximos dez passos e, então, avança com confiança, percorrendo toda essa distância de uma só vez.

Os autores descobriram que, ao treinar o modelo para prever a "velocidade média" (ou velocidade) para um bloco de tempo de uma só vez, eles conseguiram gerar imagens e vídeos de alta qualidade em apenas 4 a 8 passos (chamados de Avaliações de Função, ou NFE), comparado às centenas geralmente necessárias. Este é um aumento massivo de velocidade. Ao contrário de métodos anteriores que tentavam forçar o robô a seguir um caminho rígido ou usar matemática complicada que frequentemente quebrava a capacidade do modelo de criar variedade, a PDD utiliza uma abordagem mais simples e direta. Ela não precisa calcular derivadas complexas ou usar jogos adversariais (onde duas IAs lutam entre si para melhorar), que são conhecidos por causar o "colapso de modo" — uma forma elegante de dizer que a IA fica presa fazendo a mesma coisa repetidamente.

O artigo mostra que este método funciona incrivelmente bem em modelos de larga escala, incluindo aqueles que geram conteúdo de texto para vídeo e texto para imagem. Por exemplo, no modelo de vídeo Wan2.1, a PDD produziu vídeos com 4 NFE que foram não apenas mais rápidos, mas também mais diversos e dinâmicos do que outros métodos de ponta. Em testes com o modelo LTX-2.3, que cria vídeos de 10 segundos com áudio, a PDD conseguiu igualar a qualidade de um modelo professor que levava 4 × 30 NFE (120 passos no total) usando apenas 8 NFE. Os resultados sugerem que a PDD é uma forma robusta de tornar a geração de IA mais rápida sem sacrificar a variedade e o movimento que fazem os vídeos parecerem vivos. É um passo significativo à frente, provando que você não precisa dar um milhão de passos minúsculos para obter um ótimo resultado; às vezes, você só precisa aprender a enxergar todo o caminho à frente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →