← Nieuwste papers
💻 computer science

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct introduceert een planner-executor reinforcement learning-framework dat gebruikmaakt van hiërarchische groepsverkenning en op maat gemaakte beloningen om temporele decompositie en stap-geconditioneerde executie te optimaliseren, waardoor ambiguïteit en foutpropagatie in autoregressieve videogeneratie worden opgelost terwijl temporele plausibiliteit en visuele kwaliteit worden gewaarborgd.

Oorspronkelijke auteurs: Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Verwarde Hond"

Stel je voor dat je een video-generator vraagt om een clip van een hond te maken. Je geeft één enkele instructie: "De hond zit, dan springt hij op een bal, en dan brengt hij hem terug."

In huidige video-AI-systemen (specifiek "autoregressieve" systemen) probeert de AI de video frame-voor-frame (of chunk-voor-chunk) op te bouwen. Het probleem is dat de AI last krijgt van temporele verwarring. De AI hoort de hele instructie in één keer, maar weet niet wanneer hij welk deel moet uitvoeren.

  • Het resultaat: De AI laat de hond misschien al de bal vasthouden terwijl hij nog zit, of de AI begint al te rennen voordat de hond überhaupt heeft gezeten. Het is als een film waarbij de scènes allemaal door elkaar zijn gehusseld. De AI kent het verhaal, maar kan de tijdlijn niet recht houden.

De Oude Oplossingen (En waarom ze faalden)

  1. De "Eén Prompt"-aanpak: Je vertelt de AI gewoon het hele verhaal in één keer. Resultaat: De AI raakt in de war over de volgorde van de gebeurtenissen.
  2. De "Stap-voor-stap"-aanpak: Je probeert de AI te vertellen: "Nu doe stap 1," en daarna "Nu doe stap 2." Resultaat: De AI komt vast te zitten. Wanneer de AI overschakelt van "Stap 1" naar "Stap 2", vergeet de AI vaak de vorige context, mengt de twee acties door elkaar (bijv. de hond is half zittend en half springend) of neemt fouten uit de eerste stap mee naar de tweede.

Het paper stelt dat het simpelweg trainen van de AI op meer voorbeelden (Supervised Fine-Tuning) niet werkt, omdat de AI leert om de leraar te kopiëren, in plaats van te begrijpen hoe hij moet schakelen wanneer het verhaal verandert.

De Oplossing: TempAct (De Regisseur en de Acteur)

De auteurs stellen TempAct voor, wat videogeneratie behandelt als een theaterproductie met twee verschillende rollen die samenwerken:

1. De Planner (De Regisseur)

Zie dit als een LLM (Large Language Model) die optreedt als Regisseur.

  • Taak: Voordat de video begint, leest de Regisseur jouw grote instructie en breekt deze af in een script. De Regisseur bepaalt precies wanne Wanneer de hond moet zitten, wanneer hij moet springen en wanneer hij moet terugkeren.
  • De Twist: In plaats van slechts één script te schrijven, schrijft de Regisseur meerdere verschillende versies van het script (bijv. "Misschien zit de hond 3 seconden, of misschien 5?"). De Regisseur verkent verschillende manieren om het verhaal uiteen te leggen.

2. De Executor (De Acteur)

Zie dit als het Videomodel dat optreedt als Acteur.

  • Taak: De Acteur neemt het script van de Regisseur en voert de scène daadwerkelijk uit. De AI genereert de video-chunks op basis van de specifieke "stap" waar hij op dat moment mee bezig is.
  • De Uitdaging: De Acteur moet direct kunnen schakelen van "Zit-modus" naar "Spring-modus" zonder te struikelen of te vergeten waar hij mee bezig was.

Hoe ze samen leren: De "Groepsauditie"

Dit is de kerninnovatie. In plaats van slechts één Regisseur en één Acteur die één keer proberen, gebruikt TempAct een strategie van hiërarchische groepsexploratie. Het is als een enorme auditieprocedure:

  1. De Planning-groep: De Regisseur genereert 4 verschillende scripts (plannen) voor hetzelfde verhaal.
  2. De Executie-groep: Voor elk van die 4 scripts probeert de Acteur het 8 verschillende keren uit te voeren.
    • Scenario: De Regisseur zegt: "Laten we Script A proberen." De Acteur probeert het 8 keer uit te voeren. Dan zegt de Regisseur: "Laten we Script B proberen." De Acteur probeert dat ook 8 keer.

Het Score-systeem (De Juryleden)

Na de audities beoordeelt een "Rechter" (een andere AI) hen om te beslissen wie de baan krijgt. De scoring vindt plaats op twee niveaus:

  • Voor de Planner (De Regisseur):

    • Maakte het script logisch zin? (Plan Kwaliteit)
    • Volgde de uiteindelijke video daadwerkelijk de volgorde van het verhaal? (Temporele Consistentie)
    • Beloning: Als een specifiek script leidt tot een video waarin de hond daadwerkelijk springt nadat hij heeft gezeten, krijgt de Regisseur een hoge score voor dat script.
  • Voor de Executor (De Acteur):

    • Was de overgang vloeiend? (Stap-volgen)
    • Zag het er goed uit tijdens het schakelen? (Esthetische Kwaliteit)
    • Beloning: Als de Acteur van "zitten" naar "springen" schakelt zonder het beeld te vervagen of de hond er vreemd uit te laten zien, krijgt de Acteur een hoge score.

De "Credit Assignment" Analogie

Stel je een estafette voor.

  • De Oude Manier: Als het team verliest, krijgt iedereen evenveel de schuld.
  • De TempAct Manier:
    • Als de Regisseur een verwarrende kaart gaf, krijgt de Regisseur straf, zelfs als de hardloper (de Acteur) snel rende.
    • Als de Regisseur een perfecte kaart gaf, maar de Acteur struikelde op het exacte moment van de overdracht (de prompt-wissel), krijgt de Acteur straf.
    • Dit stelt het systeem in staat om precies te leren wat er misging: Was het verhaal gebroken, of was de uitvoering slordig?

Het Resultaat

Door zowel de Regisseur als de Acteur samen te trainen met deze "probeer veel, beoordeel veel" methode, creëert TempAct video's waarin de gebeurtenissen in de juiste volgorde plaatsvinden.

  • Vóór: De hond houdt de bal misschien al vast terwijl hij zit.
  • Ná (met TempAct): De hond zit, dan laat hij de bal vallen, dan springt hij erop. De tijdlijn is logisch en de visuele kwaliteit blijft hoog.

Kortom: TempAct lost het probleem van video-AI op door een "Regisseur" toe te voegen om de tijdlijn te plannen en een "Coach" om de "Acteur" te trainen in hoe hij vloeiend tussen scènes kan schakelen, gebruikmakend van een massaal groepsauditiesysteem om de beste manier te vinden om het verhaal te vertellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →