← Derniers articles
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 introduit une méthode d'adaptation temporelle vectorisée non destructive (VTA) permettant un contrôle temporel fin et sans exemple préalable — incluant la conversion image-vidéo, la conditionnement par les images de début et de fin, et l'extension vidéo — dans des modèles de diffusion vidéo préentraînés, tout en préservant intégralement les capacités génératives originales du modèle de base.

Auteurs originaux : Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Publié 2026-05-27
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un chef étoilé incroyablement doué pour cuisiner un type de plat spécifique à partir de zéro : Texte-vers-Vidéo. Vous lui donnez une recette (un prompt textuel), et il prépare un délicieux vidéo. Ce chef est le « modèle de base » (spécifiquement, un modèle appelé Wan-T2V).

Cependant, il y a un problème. Si vous voulez donner au chef un ingrédient de départ spécifique (comme une photo d'un chat) et dire : « Fais une vidéo en commençant par ce chat », le chef se perd. Dans l'ancienne méthode, le chef devait apprendre une façon complètement nouvelle de cuisiner à partir de zéro, oubliant souvent comment cuisiner les plats originaux avec brio au passage. C'est comme forcer le chef à oublier toute sa formation culinaire juste pour apprendre un seul nouveau tour de magie.

Voici Pusa V1.0.

Le Problème : L'« Horloge Rigide »

Les modèles de vidéo IA actuels fonctionnent comme une horloge rigide et synchronisée. Imaginez qu'une vidéo soit une rangée de dominos qui tombent. Dans ces anciens modèles, chaque domino (image) doit tomber à la même vitesse et au même moment exact.

  • Si vous voulez que le premier domino reste debout (votre image de départ) tandis que les autres tombent, l'horloge se brise.
  • Pour résoudre cela, d'autres modèles tentent de « réentraîner » le chef, ce qui est coûteux, lent et ruine souvent leur capacité à cuisiner les plats originaux.

La Solution : Les « Télécommandes Individuelles »

Pusa introduit un concept appelé Adaptation Vectorisée des Pas de Temps (VTA).

Au lieu d'une seule horloge maîtresse pour toute la vidéo, Pusa donne à chaque image sa propre télécommande.

  • Image 1 (votre image de départ) reçoit une télécommande réglée sur « Pause ».
  • Image 2 reçoit une télécommande réglée sur « Bouger lentement ».
  • Image 3 reçoit une télécommande réglée sur « Bouger vite ».

Cela permet à l'IA de faire évoluer chaque image indépendamment. La première image reste exactement là où vous l'avez placée, tandis que le reste de la vidéo s'écoule naturellement autour d'elle.

Le Tour de Magie : La Chirurgie « Non Destructrice »

L'aspect le plus impressionnant de Pusa est la façon dont il apprend cela.

  • Ancienne Méthode : Pour apprendre le tour de « commencer par une image », les anciens modèles (comme Wan-I2V) devaient subir une refonte massive et destructrice. Ils devaient être réentraînés sur des millions d'exemples, reconstruisant essentiellement le cerveau du chef. Cela coûtait une fortune en puissance de calcul et les faisait souvent oublier comment accomplir la tâche originale de texte-vers-vidéo.
  • Méthode de Pusa : Pusa effectue des ajustements « chirurgicaux ». Il ne reconstruit pas le cerveau du chef ; il ajoute simplement un petit outil spécialisé (le pas de temps vectorisé) au cerveau existant.
    • Analogie : Imaginez que le chef sait déjà cuisiner parfaitement. Au lieu de le licencier et d'en embaucher un nouveau, vous lui remettez simplement un minuteur spécifique qui lui indique exactement quand arrêter de remuer la première casserole. Les compétences de base du chef restent intactes à 100 %.

Les Résultats : Économique, Rapide et Polyvalent

Parce que Pusa n'a pas besoin de tout réapprendre à partir de zéro, les résultats sont époustouflants :

  1. Ultra-Efficace : Alors que d'autres modèles avaient besoin de millions d'exemples et d'énormes budgets de calcul (coûtant plus de 100 000 $ en calcul), Pusa a obtenu des résultats de premier plan avec seulement 4 000 exemples et une fraction infime du coût (environ 500 $).
  2. Super-pouvoirs Zero-Shot : Parce que le cerveau du chef n'a pas été écrasé, Pusa n'a pas seulement appris à commencer par une image. Il a instantanément acquis la capacité d'accomplir d'autres tours complexes sans entraînement supplémentaire, tels que :
    • Images de Début et de Fin : Donner à l'IA une image pour le début et la fin, et lui faire remplir le milieu.
    • Extension Vidéo : Prendre une courte vidéo et l'allonger de manière transparente.
    • Texte-vers-Vidéo : Il a conservé sa capacité originale à créer des vidéos à partir de prompts textuels parfaitement.

Résumé

Pusa V1.0 est comme mettre à niveau le moteur d'une voiture sans démonter la voiture. En donnant à chaque image son propre « cadran de temps » au lieu de les forcer à marcher au pas, le modèle peut gérer des tâches vidéo complexes (comme démarrer à partir d'une image spécifique) avec une efficacité incroyable. Il préserve l'intelligence du modèle original tout en débloquant de nouvelles capacités flexibles, rendant la génération vidéo de haute qualité beaucoup moins chère et plus accessible.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →