← Últimos artigos
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 introduz um método de adaptação de timesteps vetorizado e não destrutivo (VTA) que permite controle temporal fino e zero-shot — incluindo conversão de imagem para vídeo, condicionamento de quadros inicial e final, e extensão de vídeo — em modelos de difusão de vídeo pré-treinados, preservando integralmente as capacidades generativas originais do modelo base.

Autores originais: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Publicado 2026-05-27
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef de cozinha mestre, incrivelmente habilidoso em preparar um tipo específico de prato do zero: Texto-para-Vídeo. Você entrega a ele uma receita (um prompt de texto), e ele prepara um vídeo delicioso. Este chef é o "modelo base" (especificamente, um modelo chamado Wan-T2V).

No entanto, há um problema. Se você quiser dar ao chef um ingrediente inicial específico (como uma foto de um gato) e dizer: "Faça um vídeo começando com este gato", o chef fica confuso. Na maneira antiga de fazer as coisas, o chef tinha que aprender uma maneira completamente nova de cozinhar do zero, muitas vezes esquecendo como preparar os pratos originais com qualidade no processo. Isso é como forçar o chef a esquecer todo o seu treinamento culinário apenas para aprender um novo truque.

Aí entra o Pusa V1.0.

O Problema: O "Relógio Rígido"

Os modelos atuais de IA para vídeo funcionam como um relógio rígido e sincronizado. Imagine que um vídeo é uma fileira de dominós caindo. Nesses modelos antigos, cada dominó individual (quadro) deve cair exatamente na mesma velocidade e no mesmo momento.

  • Se você quiser que o primeiro dominó permaneça em pé (sua imagem inicial) enquanto os demais caem, o relógio quebra.
  • Para corrigir isso, outros modelos tentam "retreinar" o chef, o que é caro, lento e frequentemente arruína a capacidade dele de preparar os pratos originais.

A Solução: Os "Controles Remotos Individuais"

O Pusa introduz um conceito chamado Adaptação Vetorial de Passos de Tempo (VTA).

Em vez de um único relógio mestre para todo o vídeo, o Pusa dá um controle remoto próprio para cada quadro individual.

  • Quadro 1 (sua imagem inicial) recebe um controle remoto configurado para "Pausar".
  • Quadro 2 recebe um controle remoto configurado para "Mover devagar".
  • Quadro 3 recebe um controle remoto configurado para "Mover rápido".

Isso permite que a IA evolua cada quadro independentemente. O primeiro quadro permanece exatamente onde você o colocou, enquanto o restante do vídeo flui naturalmente ao seu redor.

O Truque de Mágica: Cirurgia "Não Destrutiva"

A parte mais impressionante do Pusa é como ele aprende isso.

  • Maneira Antiga: Para aprender o truque de "começar com uma imagem", os modelos antigos (como o Wan-I2V) precisavam passar por uma reforma massiva e destrutiva. Eles tinham que ser re-treinados com milhões de exemplos, essencialmente reconstruindo o cérebro do chef. Isso custava uma fortuna em poder de computação e frequentemente fazia com que esquecessem como realizar a tarefa original de texto-para-vídeo.
  • Maneira do Pusa: O Pusa realiza ajustes "cirúrgicos". Ele não reconstrói o cérebro do chef; apenas adiciona uma ferramenta minúscula e especializada (o passo de tempo vetorial) ao cérebro existente.
    • Analogia: Imagine que o chef já sabe cozinhar perfeitamente. Em vez de demití-lo e contratar um novo, você apenas entrega a ele um temporizador específico que diz exatamente quando parar de mexer a primeira panela. As habilidades principais do chef permanecem 100% intactas.

Os Resultados: Barato, Rápido e Versátil

Como o Pusa não precisa reaprender tudo do zero, os resultados são impressionantes:

  1. Ultra-eficiente: Enquanto outros modelos precisavam de milhões de exemplos e orçamentos massivos de computação (custando mais de US$ 100.000 em processamento), o Pusa alcançou resultados de nível superior com apenas 4.000 exemplos e uma fração ínfima do custo (cerca de US$ 500).
  2. Superpoderes Zero-Shot: Como o cérebro do chef não foi sobrescrito, o Pusa não apenas aprendeu a começar com uma imagem. Ele ganhou instantaneamente a capacidade de realizar outros truques complexos sem nenhum treinamento adicional, como:
    • Quadros Inicial e Final: Fornecer ao IA uma imagem para o início e para o fim, e fazê-lo preencher o meio.
    • Extensão de Vídeo: Pegar um vídeo curto e torná-lo mais longo de forma perfeita.
    • Texto-para-Vídeo: Ele manteve sua capacidade original de criar vídeos a partir de prompts de texto perfeitamente.

Resumo

O Pusa V1.0 é como atualizar o motor de um carro sem desmontá-lo. Ao dar a cada quadro seu próprio "disco de tempo" em vez de forçá-los a marchar em uníssono, o modelo consegue lidar com tarefas complexas de vídeo (como começar a partir de uma imagem específica) com eficiência incrível. Ele preserva a inteligência do modelo original enquanto desbloqueia novas capacidades flexíveis, tornando a geração de vídeos de alta qualidade muito mais barata e acessível.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →