← Derniers articles
💻 computer science

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 est un cadre open-source amélioré qui privilégie la préparation à la production et l'ingénierie systématique pour offrir une génération de vidéos longues de qualité commerciale, stable et cohérente en termes d'identité, avec une inférence accélérée, surpassant les systèmes propriétaires leaders dans divers scénarios.

Auteurs originaux : Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

Publié 2026-05-27
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous souhaitiez créer un personnage numérique capable de parler, de chanter et d'agir exactement comme un être humain réel, mais que vous ne disposiez que d'une photo de lui et d'un enregistrement audio de sa voix. Pendant longtemps, faire en sorte que ces personnages paraissent « réels » pendant plus de quelques secondes a été comparable à essayer d'équilibrer une maison de cartes dans une tempête de vent : ils pouvaient sembler bons un instant, puis leurs visages se déformaient, leurs lèvres ne synchronisaient pas les mots, ou leurs corps commençaient à bouger de manière étrange.

Le document LongCat-Video-Avatar 1.5 de l'équipe Meituan LongCat est un rapport technique présentant une nouvelle « recette » open-source pour construire ces personnages numériques. Au lieu d'inventer un nouveau type de magie, ils se sont concentrés sur le perfectionnement de l'ingénierie pour rendre le résultat suffisamment stable pour une utilisation réelle (comme dans les films, les journaux télévisés ou le service client).

Voici comment ils ont procédé, expliqué avec des analogies simples :

1. La mise à niveau de l'« Oreille » : Whisper Large

Dans l'ancienne version, le modèle utilisait une « oreille » standard (un encodeur audio appelé Wav2Vec2) pour écouter la voix. C'était correct, mais parfois, il manquait les nuances subtiles de la parole.

  • La mise à niveau : Ils ont remplacé cela par Whisper Large, un système audio beaucoup plus puissant.
  • L'analogie : Imaginez l'ancienne oreille comme quelqu'un qui écoute une chanson dans une pièce bruyante avec des bouchons d'oreilles. Le nouveau Whisper Large, c'est comme porter des écouteurs antibruit haut de gamme dans un studio calme. Il entend chaque détail infime de la voix, ce qui permet aux lèvres du personnage de bouger avec une précision parfaite, correspondant exactement au son, même dans les vidéos longues.

2. La « Salle de sport » pour les données : Curation de l'ensemble d'entraînement

On ne peut pas enseigner à un acteur numérique en lui montrant simplement des vidéos au hasard. Si vous lui montrez une vidéo avec un visage flou, une personne tenant une pancarte, ou deux personnes parlant en même temps, le modèle se confond.

  • La solution : Ils ont construit une « salle de sport des données » rigoureuse. Ils n'ont pas simplement déversé des milliers de vidéos dans le système. Ils les ont triées comme un bibliothécaire organisant une bibliothèque :
    • Données silencieuses : Ils ont enseigné au modèle quoi faire lorsque personne ne parle (par exemple, cligner des yeux, respirer, regarder autour de soi) afin que le personnage ne se fige pas ni ne semble étrange lorsque l'audio s'arrête.
    • Données émotionnelles : Ils ont spécifiquement nourri le modèle avec des vidéos de personnes exprimant différentes émotions (rires, pleurs, réactions) afin que le personnage ne ressemble pas simplement à un robot lisant un script.
    • Données multi-personnes : Ils ont enseigné au modèle comment gérer une scène avec deux personnes qui parlent. Ils ont utilisé un astuce spéciale (donnant aux personnages d'arrière-plan une piste audio « silencieuse ») afin que seule la personne censée parler bouge réellement la bouche, tandis que les autres restent immobiles.

3. Le « Coach » (RLHF) : Apprendre des retours humains

Même avec de bonnes données, le modèle pourrait encore commettre de petites erreurs, comme une main qui semble légèrement tordue ou un visage qui bouge de manière non naturelle.

  • La méthode : Ils ont utilisé une technique appelée Group-Relative Policy Optimization (GRPO).
  • L'analogie : Imaginez un instructeur de danse observant un élève. Au lieu de simplement dire « Bien joué » ou « Mal joué », l'instructeur compare la danse de l'élève à celle d'un groupe d'autres danseurs et dit : « Le mouvement de ton bras est 10 % meilleur que la moyenne, mais ta technique de pied est 5 % pire ». Le modèle apprend de ces comparaisons pour affiner ses mouvements image par image, assurant que les mains paraissent réelles et que le corps bouge naturellement.

4. Le « Mode Turbo » : Rendre cela rapide

Généralement, la génération vidéo de haute qualité est lente. C'est comme faire cuire un gâteau où vous devez vérifier le four toutes les 5 minutes pendant une heure.

  • L'innovation : Ils ont utilisé une technique appelée Distillation pour compresser le processus.
  • L'analogie : Ils ont enseigné au modèle à cuire le gâteau en 8 étapes au lieu des 50 habituelles. C'est comme entraîner un coureur à parcourir toute la course en 8 foulées géantes au lieu de 50 petites étapes lentes. Le résultat est une vidéo qui paraît tout aussi bonne mais qui se génère beaucoup plus rapidement, la rendant pratique pour une utilisation en temps réel.

5. Les résultats : Comment se compare-t-il ?

L'équipe a testé leur nouveau modèle contre les meilleurs systèmes « boîte fermée » (secrets, payants) actuellement sur le marché, comme HeyGen et Kling Avatar.

  • Le verdict : Dans un test en aveugle avec plus de 500 scénarios différents (incluant des têtes parlantes, du chant, des styles anime, et même des animaux), LongCat-Video-Avatar 1.5 a souvent été noté comme meilleur ou égal à ces systèmes commerciaux coûteux.
  • Principales victoires :
    • Synchronisation labiale : Les mouvements de la bouche correspondaient parfaitement à l'audio.
    • Stabilité : Le personnage ne clignotait pas ni ne changeait de visage pendant les vidéos longues.
    • Identité : Le personnage ressemblait à la même personne du début à la fin.
    • Complexité : Il gérait des situations délicates, comme une personne tenant une guitare ou deux personnes parlant, sans que les personnages d'arrière-plan ne bougent accidentellement les lèvres.

Résumé

LongCat-Video-Avatar 1.5 est essentiellement une boîte à outils « prête pour la production ». Il prend le côté désordonné et expérimental de la génération vidéo par IA et le polit avec de meilleures oreilles (Whisper), de meilleures données d'entraînement (Silencieuses/Émotionnelles/Multi-personnes), un coach strict (RLHF) et un boost de vitesse (Distillation). L'objectif n'était pas seulement de créer une démo cool, mais de construire un système suffisamment fiable pour être utilisé dans de véritables entreprises, et ils ont prouvé qu'il fonctionne aussi bien que (ou mieux que) les meilleurs outils payants disponibles aujourd'hui.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →