← Nieuwste papers
💻 computer science

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo introduceert een agentisch dual-engine framework dat uitvoerbare Blender-code gebruikt als een procesniveau chain of thought om fysiek consistente video's te genereren door eerst een deterministische spatiotemporele conceptversie te creëren en deze vervolgens te verfijnen tot een fotorealistische output, waarmee het bestaande baselines op benchmarks voor fysieke consistentie aanzienlijk overtreft.

Oorspronkelijke auteurs: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou
Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een cake moet bakken door alleen maar te fluisteren: "Maak het heerlijk." De robot begrijpt misschien het woord "heerlijk", maar zonder recept heeft hij geen idee of hij de eieren vóór het meel moet mengen, hoe lang hij het moet bakken, of waarom de cake geen baksteen mag worden. Dit is de huidige strijd in de wereld van AI-videogeneratie. Wetenschappers bouren modellen die tekstbeschrijvingen kunnen omzetten in bewegende beelden, maar deze AI-"dromers" worstelen vaak met de wetten van de natuurkunde. Ze laten misschien een bal omhoog zweven in plaats van naar beneden vallen, of een glas breken voordat het de grond raakt, omdat de AI de opeenvolging van gebeurtenissen gokt in plaats van echt te begrijpen hoe de wereld werkt.

Om dit op te lossen, zoeken onderzoekers naar een manier om de AI te laten "denken" voordat hij handelt, een concept dat bekend staat als Chain-of-Thought (keten van gedachten). In plaats van direct naar het uiteindelijke beeld te springen, wordt de AI aangemoedigd om een tussenliggend plan te maken. Denk aan een architect die blauwdrukken tekent voordat hij een huis bouwt, of een chef die een recept schrijft voordat hij gaat koken. De grote vraag is: wat voor soort blauwdruk is het beste? Is het een lijst met woorden? Een paar ruwe schetsen? Of iets meer precies? Dit is de puzzel die het paper VideoCoCo probeert op te lossen, met als doel AI-gegenereerde video's niet alleen mooi te laten lijken, maar ze ook daadwerkelijk de regels van de werkelijkheid te laten volgen.


De Magie van "Code-as-CoT": Een Dreamteam van Twee Motoren

Maak kennis met VideoCoCo, een nieuw systeem dat fungeert als een superintelligente regisseur en een getalenteerde kunstenaar die samenwerken om video's te maken die de wetten van de natuurkunde niet breken. De onderzoekers realiseerden zich dat wanneer AI probeert te raden hoe een scène zich ontwikkelt op basis van alleen een tekstprompt, de AI de "verhaallijn" vaak fout krijgt. Daarom gaven ze de AI een nieuw hulpmiddel: uitvoerbare code.

Zie het proces als volgt:

  1. De Regisseur (De Coding Agent): Wanneer je de AI een prompt geeft zoals "een klontje boter dat smelt in een hete pan", stelt de Regisseur niet alleen de scène voor. In plaats daarvan schrijft hij een Blender-programma (een reeks computerinstructies). Deze code is als een strikt, onbreekbaar recept. Het vertelt de computer expliciet: "Plaats een blok boter hier. Zet de hitte aan. Laat de boter zachter worden, zakken en uitspreiden over precies 5 seconden." Omdat dit code is, moet het exact worden uitgevoerd zoals geschreven. Het is geen gok; het is een simulatie.
  2. De Sandbox (De Simulatie-engine): De computer voert deze code uit in een veilige, geïsoleerde speeltuin die een "sandbox" wordt genoemd. Het resultaat is nog geen mooie film; het is een deterministisch concept. Stel je een kwalitatief laagstaande, wit-klei animatie voor. Het ziet eruit als een ruwe schets van klei, maar de beweging is perfect accuraat. De boter smelt precies zoals de natuurkunde voorschrijft, omdat de code dit heeft afgedwongen.
  3. De Kunstenaar (De Generatieve Video-engine): Nu stapt de tweede motor in. Dit is de kunstenaar die die ruwe, wit-klei schets neemt en eroverheen schildert om er een echte, high-definition film van te maken. Omdat de kunstenaar al over de perfecte "klei-versie" beschikt om te kopiëren, hoeft hij niet te raden hoe de boter moet bewegen. Hij kan zich volledig concentreren op het maken van de look: glanzend, goudbruin en heerlijk.

Waarom deze aanpak een Game-changer is

Het paper betoogt dat eerdere methoden probeerden te veel tegelijk te doen. Sommige AI-modellen probeerden een tekstueel plan te schrijven (zoals "boter smelt"), maar tekst is vaag. Anderen probeerden de volgende frame van een video te raden, maar dat is alsof je probeert een meesterwerk te schilderen door naar een wazige foto van de vorige frame te kijken.

VideoCoCo zegt: "Stop met het gokken van de natuurkunde. Simuleer het gewoon."

Door code te gebruiken als de "Chain of Thought", scheidt het systeem de logica van de beweging van de schoonheid van het beeld. De code handelt de "wat gebeurt er en wanneer" af, terwijl de video-editor de "hoe ziet het eruit" afhandelt. Dit is een enorme verschuiving omdat het de gokprocedure verandert in een tweestaps-proces waarbij de eerste stap 100% betrouwbaar is.

Het bewijs zit in de pudding (en de natuurkunde)

De onderzoekers hebben hun systeem getest op twee belangrijke uitdagingen: PhyGenBench en VBench-2.0. Dit zijn als examens voor AI, specifal bedoeld om te testen of de video's de regels van de echte wereld volgen, zoals zwaartekracht, hitte en hoe materialen zich gedragen.

  • De Resultaten: Voordat VideoCoCo de baseline AI (genaamd OmniWeaving) een gemiddelde score van 0,475 haalde op de natuurkunde-test. Na het toevoegen van het "Code-as-CoT"-systeem sprong de score omhoog naar 0,558. Op de andere test (VBench-2.0) schoot de score omhoog van 52,18% naar 77,88%.
  • Het "Aha!"-moment: De grootste verbeteringen vonden plaats op gebieden waar AI meestal het meest faalt: thermische dynamica (zoals hitte en smelten) en materiaaldynamica (hoe dingen breken of stromen). Dit bewijst dat het codemodel de AI daadwerkelijk leerde hoe de natuurkunde werkt, en niet alleen de video mooier maakte.

Wat het paper uitsluit

Het is belangrijk om op te merken wat VideoCoCo niet is. Het paper voert expliciet argumenten aan tegen het idee dat we gewoon een grotere AI kunnen trainen om natuurkunde te "leren" van miljoenen video's. Ze ontdekten dat zonder een expliciet, uitvoerbaar plan (de code), de AI nog steeds moeite heeft om de volgorde van gebeurtenissen juist te krijgen. Ze laten ook zien dat het simpelweg hebben van een ruw tekstplan of een paar keyframes niet genoeg is; het plan moet uitvoerbare code zijn die de computer daadwerkelijk kan draaien om een concept te creëren.

De keerzijde en de toekomst

Hoewel de resultaten indrukwekkend zijn, is het paper eerlijk over de beperkingen. Het systeem is momenteel iets trager omdat het eerst code moet schrijven, een simulatie moet draaien en vervolgens de video moet schilderen. Het is alsof je een briljante architect en een schilder hebt, maar het duurt iets langer dan het simpelweg maken van een foto. Ook wordt het systeem beperkt door hoe complex de Blender-simulator kan zijn; supercomplexe zaken zoals kolkend, chaotisch water kunnen op dit moment nog steeds lastig perfect te simuleren zijn.

De auteurs suggereren echter dat deze "Code-as-CoT"-benadering een krachtige nieuwe manier is om over AI na te denken. In plaats van te hopen dat de AI de wereld magisch begrijpt, kunnen we het een hulpmiddel geven om eerst een model van de wereld te bouwen, en de AI vervolgens de kunst te laten creëren op basis van dat solide fundament. Het is een herinnering dat de beste manier om iets moois te creëren, soms is om eerst iets te bouwen dat werkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →