← Derniers articles
💻 computer science

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

Cet article présente Goku, un ensemble de données à grande échelle de 2 millions de paires d'édition vidéo alignées sur des instructions couvrant des manipulations structurelles et multi-tâches complexes, ainsi que le modèle Goku-Edit et le benchmark Goku-Bench, afin de faire progresser les capacités d'édition vidéo basée sur des instructions au-delà de simples changements d'apparence.

Auteurs originaux : Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

Publié 2026-06-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez un éditeur vidéo magique capable de tout changer dans un film par une simple phrase comme : « Fais courir le chien plus vite et rends le ciel violet. » Pendant longtemps, ces outils magiques étaient comme des apprentis maladroits : ils pouvaient changer la couleur d'une chemise ou supprimer un objet gênant, mais si vous leur demandiez de déplacer un personnage à travers une pièce ou de changer l'angle de la caméra, ils s'embrouillaient, se figeaient ou faisaient n'importe quoi.

Le document présente Goku, un nouveau projet massif conçu pour entraîner ces éditeurs magiques à devenir de véritables maîtres. Voici la décomposition de ce qu'ils ont fait, expliquée simplement :

1. Le problème : Les jeux de données « un seul tour dans le ventre »

Avant cela, les données d'entraînement pour ces éditeurs vidéo IA étaient comme une bibliothèque remplie de livres traitant d'un seul sujet : changer la couleur d'une voiture. Si vous vouliez apprendre à conduire une voiture (déplacer un sujet) ou changer le décor (mouvement de caméra), la bibliothèque ne contenait aucun livre. Les modèles d'IA étaient bloqués parce qu'ils ne savaient faire que des tâches simples de type « coloriage magique ».

2. La solution : La bibliothèque « Goku »

Les chercheurs ont construit Goku, un jeu de données massif contenant 2 millions de paires de vidéos. Considérez cela comme la construction d'une immense salle de sport de haute technologie pour l'IA.

  • Ce qu'il y a dedans ? Contrairement aux bibliothèques précédentes, celle-ci contient des défis complexes. Elle inclut des vidéos où la caméra effectue un panoramique, des vidéos où une personne se déplace d'un côté à l'autre de la pièce, et des vidéos où plusieurs changements se produisent simultanément (ex : « Change la chemise ET ajoute un chapeau »).
  • Comment l'ont-ils fabriquée ? Ils n'ont pas seulement filmé ces vidéos ; ils ont construit une usine robotisée pour les créer. Ils ont utilisé une IA avancée pour décomposer des demandes complexes en étapes petites et gérables. Par exemple, pour faire courir un chien, ils ont d'abord appris à l'IA à faire courir un chien sur une seule image, puis comment faire évoluer cette image de manière fluide en une vidéo.
  • Le contrôle qualité : Pour s'assurer que les vidéos n'étaient pas de la pacotille, ils ont installé un système de sécurité à « triple vérification ». Chaque vidéo a été vérifiée trois fois par une IA super intelligente (Gemini) pour s'assurer que les instructions étaient suivies, que le mouvement paraissait réel et que la vidéo ne présentait pas de bugs. Ils ont jeté environ 88 % des tentatives pour ne garder que les 2 millions de meilleures versions.

3. Le nouvel outil : Goku-Edit

Avec cette nouvelle bibliothèque, ils ont construit un nouvel éditeur vidéo appelé Goku-Edit.

  • Le cerveau : Au lieu de simplement lire du texte, cet éditeur utilise un « Modèle de Langage Large Multimodal » (MLLM). Considérez cela comme le fait de donner à l'éditeur un cerveau capable de réellement comprendre l'histoire et les instructions, et non de simplement faire correspondre des mots-clés.
  • L'approche à deux mains : La plus grande innovation est que l'éditeur possède deux « mains » travaillant ensemble :
    • La Main A (L'Architecte) : Cette main dessine une carte rudimentaire (un masque) de l'endroit les changements doivent avoir lieu. Elle se concentre sur la structure et le mouvement.
    • La Main B (Le Peintre) : Cette main se concentre sur les détails, les couleurs et les textures.
    • Pourquoi c'est important : En séparant le « où » du « quoi », l'éditeur ne s'embrouille pas. Il sait exactement où déplacer le chien sans peindre accidentellement le pelage du chien en bleu.
  • Le « Spatial CFG » : C'est un terme technique qui désigne un filet de sécurité. Il garantit que lorsqu'l'éditeur effectue un changement, il ne déborde pas accidentellement et ne gâche pas le reste de la vidéo. Cela maintient les changements précis et contenus.

4. Le test : Goku-Bench

Pour prouver que leur nouvel éditeur est le meilleur, ils ont créé un nouveau test appelé Goku-Bench.

  • Au lieu de tests simples, ils ont donné à l'IA 1 000 défis difficiles, comme « Déplace la caméra vers la gauche pendant que le chat saute ».
  • Ils ont utilisé 7 nouvelles méthodes pour noter les résultats, vérifiant des points tels que « Est-ce que la physique était cohérente ? » et « Est-ce que la caméra bougeait de manière fluide ? ».
  • Le résultat : Goku-Edit a battu tous les autres modèles open-source, améliorant sa capacité à suivre les instructions de près de 8 %. Il était particulièrement performant pour déplacer des objets et gérer des requêtes complexes à étapes multiples là où les autres modèles échouaient.

Résumé

En résumé, le document affirme : « Nous avons construit une immense bibliothèque d'entraînement de haute qualité (Goku) qui apprend à l'IA à réaliser des montages vidéo complexes, et non de simples changements de couleur. Nous avons construit un nouvel éditeur (Goku-Edit) qui utilise un système en deux parties pour comprendre séparément la structure et les détails, et nous avons prouvé qu'il est plus performant que tout le reste grâce à un nouveau test plus difficile (Goku-Bench). »

Ils n'ont pas prétendu que cette technologie est prête pour les hôpitaux ou des usages cliniques spécifiques ; ils se sont concentrés entièrement sur le fait de rendre le montage vidéo plus intelligent, plus flexible et plus capable de gérer des requêtes créatives complexes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →