← Nieuwste papers
💻 computer science

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

Dit artikel introduceert Anchored Tree Sampling (ATS), een trainingsvrije inferentieplanner die drift en continuïteitsproblemen op lange termijn in video's mitigeert door sequentiële autoregressieve rollouts te vervangen door een hiërarchische, ankergebonden imputatiestrategie, waardoor superieure kwaliteit en stabiliteit worden bereikt bij video-naar-videogeneratie met een statische camera.

Oorspronkelijke auteurs: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

Gepubliceerd 2026-05-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorm muurschildering van 40 minuten te schilderen, maar je hebt slechts een klein doek dat op elk moment maar 10 seconden aan kunst past.

De Oude Weg (Autoregressieve Generatie): Het "Domino-effect"
Momenteel werken de meeste AI-videogeneratoren als een rij dominostenen. Om een lang video te maken, schildert de AI eerst 10 seconden, gebruikt die schildering om te raden hoe de volgende 10 seconden eruit moeten zien, gebruikt dat om de volgende te raden, en zo verder.

Het paper noemt dit "Drift". Net als bij het spel "Telefoontje" gebeuren er in elk blok van 10 seconden kleine fouten. Tegen de tijd dat de AI minuut 30 bereikt, kan het gezicht van het personage zijn veranderd in een monster, kan de achtergrond van kleur zijn veranderd, of kan het verhaal zijn plot zijn verloren. De AI moet ook wachten tot het vorige blok klaar is voordat het volgende begint, wat het proces zeer traag maakt.

De Nieuwe Weg (Verankerde Boom-Stalsteekproef): Het "Bouwsteiger"
De auteurs, van Descript, Inc., stellen een slimmere manier voor genaamd Anchored Tree Sampling (ATS). In plaats van het muurschildering één klein strookje tegelijk te schilderen, bouwen ze een steiger.

Zo werkt het, met een bouw-analogie:

  1. De Root Call (Het Plaatsen van de Palen): Eerst kijkt de AI naar het hele verhaal van 40 minuten in één keer. Het probeert niet elk frame te schilderen. In plaats daarvan plaatst het een paar "ankerpalen" (spaarzame frames) op cruciale momenten: het zeer begin, het zeer einde, en een paar plekken ertussen. Denk aan deze als de belangrijkste pijlers die een brug dragen.
  2. De Verfijning (Het Opvullen van de Gaten): Nu kijkt de AI naar de opening tussen de eerste paal en de tweede paal. Het schildert de ruimte tussen hen, wetende precies hoe het begin en het einde eruitzien. Het doet hetzelfde voor de opening tussen de tweede en derde paal.
  3. De Bladeren (De Einddetails): Tot slot vult het de kleine gaten op tussen die nieuw geschilderde secties in totdat de hele video compleet is.

Waarom Dit Een Game-Changer Is

  • Geen Drift Meer: Omdat elke sectie van de video "verankerd" is door een bekend start- en eindpunt, kan de AI niet afdwalen. Als je het zegt om een rode auto aan het begin en een rode auto aan het einde te schilderen, zal het de auto rood houden in het midden. Het hoeft niet te raden op basis van een wazig, foutenrijk vorig frame.
  • Super Snelheid: De oude manier is als een enkele persoon die een muur schildert van links naar rechts. De nieuwe manier is als een team van schilders. Zodra de "palen" zijn geplaatst, kunnen verschillende teams de verschillende secties van de muur tegelijkertijd schilderen. Dit maakt het genereren van lange video's veel sneller.
  • Consistentie: De video blijft trouw aan de oorspronkelijke instructies (zoals een specifieke houding of randtekening) van begin tot einde zonder dat het personage plotseling van kleding verandert of de achtergrond verschuift.

Waar Het Het Beste Werkt (en Waar Het Strijdt)
Het paper toont aan dat deze methode ongelooflijk goed werkt voor statische camera video's (waar de camera niet wild rond beweegt, zoals een persoon die tegen de camera praat of een vaste shot van een scène). In deze gevallen kan de AI de "ankerpalen" gemakkelijk voorspellen omdat de achtergrond niet veel verandert.

Echter, de auteurs erkennen dat het nu beperkingen heeft:

  • Dynamische Camera's: Als de camera door een stad vliegt of ronddraait, heeft de AI soms moeite om de "ankerpalen" correct te raden omdat het beeld te veel verandert.
  • Nieuwe Personages: Als een nieuw object of persoon in het midden van de video verschijnt dat niet in de start- of eind-"ankers" zat, kan de AI het iets anders tekenen dan als het eerder was verschenen.
  • Tekst-naar-Video: Momenteel werkt dit het beste als je de AI een video geeft om te wijzigen (Video-naar-Video). Het is moeilijker te gebruiken als je gewoon een tekstprompt typt, omdat de AI die "ankerpalen" nodig heeft om mee te beginnen.

Het Conclusie
Het paper introduceert een "boom"-structuur die lange video's opsplitst in beheersbare, verbonden blokken. Door de video op specifieke punten te verankeren en de gaten parallel op te vullen, hebben ze het probleem opgelost dat video's na verloop van tijd "slordig" worden en het proces aanzienlijk sneller gemaakt. Ze hebben succesvol 40 minuten lange video's gegenereerd die consistent en van hoge kwaliteit bleven, iets waar eerdere methoden moeite mee hadden zonder fouten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →