← Derniers articles
💻 computer science

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo introduit un cadre à double moteur agentique qui exploite du code Blender exécutable comme une chaîne de pensée au niveau du processus pour générer des vidéos physiquement cohérentes en créant d'abord un brouillon spatio-temporel déterministe, puis en le raffinant en une sortie photoréaliste, surpassant de manière significative les bases de référence existantes sur les bancs d'essai de cohérence physique.

Auteurs originaux : Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou
Publié 2026-07-31
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez essayer d'apprendre à un robot comment faire un gâteau en lui chuchotant simplement : « Fais quelque chose de délicieux ». Le robot pourrait comprendre le mot « délicieux », mais sans recette, il n'a aucune idée s'il doit mélanger les œufs avant la farine, combien de temps le faire cuire, ou pourquoi le gâteau ne doit pas se transformer en une brique. C'est la lutte actuelle dans le monde de la génération de vidéos par IA. Les scientifiques construisent des modèles capables de transformer des descriptions textuelles en images animées, mais ces « rêveurs » de l'IA peinent souvent avec les lois de la physique. Ils pourraient faire flotter une balle vers le haut au lieu de la laisser tomber, ou faire éclater un verre avant même qu'il ne touche le sol, car l'IA devine la séquence des événements plutôt que de comprendre réellement comment le monde fonctionne.

Pour corriger cela, les chercheurs chercheent un moyen de faire « réfléchir » l'IA avant qu'elle n'agisse, un concept connu sous le nom de Chaîne de Pensée (Chain-of-Thought). Au lieu de passer directement à l'image finale, on encourage l'IA à créer un plan intermédiaire. Pensez-y comme un architecte dessinant des plans avant de construire une maison, ou un chef écrivant une recette avant de cuisiner. La grande question est : quel type de plan est le meilleur ? Est-ce une liste de mots ? Quelques croquis sommaires ? Ou quelque chose de plus précis ? C'elle est l'énigme que l'article VideoCoCo cherche à résoudre, visant à rendre les vidéos générées par l'IA non seulement esthétiques, mais aussi respectueuses des règles de la réalité.


La Magie du « Code-as-CoT » : Une Équipe de Choc à Deux Moteurs

Découvrez VideoCoCo, un nouveau système qui agit comme un réalisateur super intelligent et un artiste talentueux travaillant ensemble pour créer des vidéos qui ne violent pas les lois de la physique. Les chercheurs ont réalisé que lorsque l'IA tente de deviner comment une scène évolue à partir d'une simple consigne textuelle, elle se trompe souvent dans l'« histoire ». Ils ont donc donné à l'IA un nouvel outil : le code exécutable.

Voyez le processus ainsi :

  1. Le Réalisateur (L'Agent de Codage) : Lorsque vous donnez à l'IA une consigne comme « du beurre qui fond dans une poêle chaude », le Réalisateur ne se contente pas d'imaginer la scène. À la place, il écrit un programme Blender (un ensemble d'instructions informatiques). Ce code est comme une recette stricte et inviolable. Il dit explicitement à l'ordinateur : « Placez un bloc de beurre ici. Allumez la chaleur. Faites en sorte que le beurre ramollisse, s'affaisse et s'étale sur exactement 5 secondes. » Parce qu'il s'agit de code, il doit s'exécuter exactement comme écrit. Ce n'est pas une supposition ; c'est une simulation.
  2. Le Bac à Sable (Le Moteur de Simulation) : L'ordinateur exécute ce code dans un espace de jeu sûr et isolé appelé « bac à sable » (sandbox). Le résultat n'est pas encore un beau film ; c'est un brouillon déterministe. Imaginez une animation rudimentaire en pâte à modeler blanche. Cela ressemble à un croquis grossier fait de pâte à modeler, mais le mouvement est parfaitement précis. Le beurre fond exactement comme la physique le dicte, car le code l'a imposé.
  3. L'Artiste (Le Moteur de Vidéo Générative) : Maintenant, le second moteur intervient. C'est l'artiste qui prend ce croquis brut en pâte à model Fre blanche et peint par-dessus pour en faire un véritable film en haute définition. Puisque l'artiste possède déjà la version parfaite en « pâte à modeler » pour copier, il n'a pas besoin de deviner comment le beurre doit bouger. Il se concentre simplement sur le rendu : le rendre brillant, doré et délicieux.

Pourquoi cette approche change la donne

L'article soutient que les méthodes précédentes essayaient de faire trop de choses à la fois. Certains modèles d'IA tentaient d'écrire un plan textuel (comme « le beurre fond »), mais le texte est vague. D'autres tentaient de deviner l'image suivante d'une vidéo, mais c'est comme essayer de peindre un chef-d'œuvre en regardant une photo floue de l'image précédente.

VideoCoCo dit : « Arrêtez de deviner la physique. Simulez-la, tout simplement. »

En utilisant le code comme « Chaîne de Pensée », le système sépare la logique du mouvement de la beauté de l'image. Le code gère le « quoi et quand », tandis que le moteur vidéo gère le « aspect visuel ». C'est un changement majeur car cela transforme un jeu de devinettes en un processus en deux étapes où la première étape est 100 % fiable.

La preuve par l'exemple (et par la physique)

Les chercheurs ont testé leur système sur deux défis majeurs : PhyGenBench et VBench-2.0. Ce sont comme des examens pour l'IA, testant spécifiquement si les vidéos respectent les règles du monde réel comme la gravité, la chaleur et le comportement des matériaux.

  • Les Résultats : Avant VideoCoCo, l'IA de base (appelée OmniWeaving) obtenait une moyenne de 0,475 au test de physique. Après l'ajout du système « Code-as-CoT », le score a bondi à 0,558. Sur l'autre test (VBench-2.0), le score a grimpé en flèche, passant de 52,18 % à 77,88 %.
  • Le Moment « Eurêka » : Les plus grandes améliorations ont eu lieu dans les domaines où l'IA échoue habituellement le plus : la dynamique thermique (comme la chaleur et la fusion) et la dynamique des matériaux (comment les choses se brisent ou s'écoulent). Cela prouve que le brouillon par code a réellement enseigné à l'IA comment la physique fonctionne, et ne s'est pas contenté de rendre la vidéo plus jolie.

Ce que l'article écarte

Il est important de noter ce que VideoCoCo n'est pas. L'article argumente explicitement contre l'idée que nous puissions simplement entraîner une IA plus grande pour qu'elle « apprenne » la physique à partir de millions de vidéos. Ils ont constaté que sans un plan explicite et exécutable (le code), l'IA peine toujours à obtenir la séquence correcte des événements. Ils démontrent également que le simple fait d'avoir un plan textuel sommaire ou quelques images clés ne suffit pas ; le plan doit être un code exécutable que l'ordinateur peut réellement exécuter pour créer un brouillon.

Le revers de la médaille et l'avenir

Bien que les résultats soient impressionnants, l'article est honnête sur les limites. Le système est actuellement un peu plus lent car il doit écrire le code, exécuter une simulation, puis peindre la vidéo. C'est comme avoir un architecte et un peintre de génie, mais cela prend un peu plus de temps que de simplement prendre une photo. De plus, le système est limité par la complexité du simulateur Blender ; des phénomènes très complexes comme le mouvement chaotique de l'eau pourraient encore être difficiles à simuler parfaitement pour l'instant.

Cependant, les auteurs suggèrent que cette approche « Code-as-CoT » est une nouvelle façon puissante de penser l'IA. Au lieu d'espérer que l'IA comprenne magiquement le monde, nous pouvons lui donner un outil pour construire d'abord un modèle du monde, puis la laisser créer l'art sur cette base solide. C'est un rappel que, parfois, la meilleure façon de créer quelque chose de beau est d'abord de construire quelque chose qui fonctionne.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →