← Últimos artículos
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 introduce un método de adaptación de pasos de tiempo vectorizado no destructivo (VTA) que permite un control temporal fino y sin ejemplos previos, incluida la conversión de imagen a video, la condicionamiento de fotogramas inicial y final, y la extensión de video, en modelos de difusión de video preentrenados, preservando completamente las capacidades generativas originales del modelo base.

Autores originales: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Publicado 2026-05-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un chef maestro que es increíblemente bueno cocinando un tipo específico de plato desde cero: Texto-a-Video. Le das una receta (un prompt de texto) y él prepara un video delicioso. Este chef es el "modelo base" (específicamente, un modelo llamado Wan-T2V).

Sin embargo, hay un problema. Si quieres darle al chef un ingrediente de partida específico (como una foto de un gato) y decirle: "Haz un video empezando con este gato", el chef se confunde. En la vieja forma de hacer las cosas, el chef tenía que aprender una forma completamente nueva de cocinar desde cero, a menudo olvidando cómo cocinar bien los platos originales en el proceso. Esto es como obligar al chef a olvidar toda su formación culinaria solo para aprender un nuevo truco.

Aquí entra Pusa V1.0.

El Problema: El "Reloj Rígido"

Los modelos actuales de video con IA funcionan como un reloj rígido y sincronizado. Imagina que un video es una fila de fichas de dominó cayendo. En estos modelos antiguos, cada ficha individual (frame) debe caer a la misma velocidad y en el mismo momento exacto.

  • Si quieres que la primera ficha se mantenga de pie (tu imagen de inicio) mientras el resto cae, el reloj se rompe.
  • Para solucionar esto, otros modelos intentan "reentrenar" al chef, lo cual es costoso, lento y a menudo arruina su capacidad para cocinar los platos originales.

La Solución: Los "Mandos a Distancia Individuales"

Pusa introduce un concepto llamado Adaptación de Paso de Tiempo Vectorizado (VTA).

En lugar de un reloj maestro para todo el video, Pusa le da un mando a distancia a cada frame individual.

  • Frame 1 (tu imagen de inicio) obtiene un mando configurado en "Pausa".
  • Frame 2 obtiene un mando configurado en "Moverse lentamente".
  • Frame 3 obtiene un mando configurado en "Moverse rápido".

Esto permite que la IA evolucione cada frame de forma independiente. El primer frame se queda exactamente donde lo pusiste, mientras que el resto del video fluye naturalmente a su alrededor.

El Truco de Magia: Cirugía "No Destructiva"

La parte más impresionante de Pusa es cómo aprende esto.

  • Antigua Forma: Para aprender el truco de "empezar con una imagen", los modelos antiguos (como Wan-I2V) tenían que someterse a una revisión masiva y destructiva. Tenían que ser reentrenados en millones de ejemplos, esencialmente reconstruyendo el cerebro del chef. Esto costaba una fortuna en potencia de computación y a menudo hacía que olvidaran cómo realizar la tarea original de texto-a-video.
  • Forma de Pusa: Pusa realiza ajustes "quirúrgicos". No reconstruye el cerebro del chef; simplemente añade una herramienta pequeña y especializada (el paso de tiempo vectorizado) al cerebro existente.
    • Analogía: Imagina que el chef ya sabe cocinar perfectamente. En lugar de despedirlo y contratar a uno nuevo, simplemente le entregas un temporizador específico que le dice exactamente cuándo dejar de remover la primera olla. Las habilidades centrales del chef permanecen intactas al 100%.

Los Resultados: Barato, Rápido y Versátil

Como Pusa no necesita reaprender todo desde cero, los resultados son asombrosos:

  1. Ultra-eficiente: Mientras que otros modelos necesitaban millones de ejemplos y enormes presupuestos de computación (costando más de $100,000 en computación), Pusa logró resultados de primer nivel con solo 4,000 ejemplos y una fracción minúscula del costo (alrededor de $500).
  2. Superpoderes Zero-Shot: Como el cerebro del chef no fue sobrescrito, Pusa no solo aprendió a empezar con una imagen. Instantáneamente ganó la capacidad de realizar otros trucos complejos sin entrenamiento adicional, como:
    • Frames de Inicio-Fin: Darle a la IA una imagen para el principio y para el final, y que ella rellene el medio.
    • Extensión de Video: Tomar un video corto y hacerlo más largo de forma perfecta.
    • Texto-a-Video: Mantuvo su capacidad original de crear videos a partir de prompts de texto perfectamente.

Resumen

Pusa V1.0 es como actualizar el motor de un coche sin desmontar el vehículo. Al darle a cada frame su propio "selector de tiempo" en lugar de obligarlos a marchar al unísono, el modelo puede manejar tareas complejas de video (como empezar desde una imagen específica) con una eficiencia increíble. Preserva la inteligencia del modelo original mientras desbloquea nuevas capacidades flexibles, haciendo que la generación de video de alta calidad sea mucho más barata y accesible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →