← Nieuwste papers
💻 computer science

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

LiveAnimate is een nieuw real-time, miljardenschaal videogeneratiesysteem gebouwd op een 14B-parameter Diffusion Transformer dat stabiele, langdurige streaming menselijke animatie bereikt met constante latentie en een hoge perceptuele kwaliteit via een tweestaps trainingspipeline en een gespecialiseerd Pose-Retrieval Sink Attention-mechanisme.

Oorspronkelijke auteurs: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

Gepubliceerd 2026-08-13
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren dansen. Je geeft het een foto van een persoon en een stroom aan dansbewegingen, en je wilt dat de robot direct een video genereert van die persoon die de dans uitvoert. Dit is de wereld van "pose-gestuurde menselijke animatie". Lange tijd konden de beste robots dit alleen in "offline modus" doen. Denk aan het bakken van een complexe taart: je mengt de ingrediënten, wacht uren tot het rijst, bakt het, en serveert het dan pas. Als je de dansbeweging wilde veranderen, moest je het hele bakproces opnieuw starten. Dit is geweldig voor het maken van films, maar verschrikkelijk voor live streaming of videogames waar je nodig hebt dat de robot reageert. De grote uitdaging was om een robot te maken die zowel ongelooflijk slim is (om er echt uit te zien en consistent te blijven) als ongelooflijk snel (om een live stream bij te houden) zonder dat de video na een paar minuten uit elkaar valt.

Maak kennis met LiveAnimate, een nieuw systeem dat deze kloof eindelijk overbrugt. De onderzoekers hebben een "digitale danser" gebouwd die een video kan genereren van een persoon die danst in realtime, blok voor blok, terwijl de gezichtskenmerken en kleding van de persoon gedurende de gehele stream exact hetzelfde blijven. Het is also$ een live poppenspeler die nooit moe wordt, nooit vergeet hoe de pop eruitziet, en de show urenlang kan voortzetten zonder dat het gezicht van de pop smelt of de kleding van kleur verandert. Het paper laat zien dat dit systeem op krachtige computers ongeveer 20 frames per seconde kan draaien (wat aanvoelt als realtime beweging), waarbij de hoge kwaliteit minstens drie minuten lang behouden blijft—een prestatie die eerdere methoden ofwel niet in realtime konden, ofwel uren zouden duren om te berekenen.

De Goocheltruc: Hoe het werkt

Om te begrijpen hoe LiveAnimate deze truc uitvoert, moeten we kijken naar de drie belangrijkste ingrediënten die het mengt: een superintelligent brein, een speciale trainingsroutine en een slimme geheugentruc.

1. Het Brein: Een Gigantische Video Transformer
In het hart van het systeem zit een massaal AI-model genaamd een "Diffusion Transformer" (of DiT) met 14 miljard parameters. Stel je dit voor als een gigantische bibliotheek van elke mogelijke manier waarop een menselijk lichaam kan bewegen en eruit kan zien. Normaal gesproken zijn deze bibliotheken "bidirectioneel", wat betekent dat ze naar de toekomst en het verleden kunnen kijken om een scène te begrijpen. Maar voor een livestream kun je niet in de toekomst kijken; je kunt alleen reageren op wat er nu gebeurt. De onderzoekers moesten dit gigantische brein hertrainen om "causaal" te zijn, wat betekent dat het alleen naar het verleden en het heden kijkt, net zoals een mens die een dans in realtime bekijkt.

2. De Training: Twee Fasen van Leren
Je kunt niet simpelweg een brein met 14 miljard parameters vertellen om "live te gaan" en verwachten dat het werkt. Het paper beschrijft een tweefasig trainingsproces om het klaar te stomen:

  • Fase 1 (De Leraar): Eerst leren ze het model met behulp van "Reference-Anchored Teacher-Forcing". Stel je een leraar voor die een perfect script vasthoudt (de grondwaarheid) en de student (de AI) stap voor stap door de dans leidt. De student leert de bewegingen perfect te kopiëren terwijl de referentiefoto altijd in het achterhoofd wordt gehouden, zodat de danser op de juiste persoon lijkt.
  • Fase 2 (De Snelheidsronde): De eerste fase is nog steeds te traag voor realtime. Daarom gebruiken ze in de tweede fase een techniek genaamd "Block-wise Self-Forcing Distillation". Dit is alsof je de student de dans op eigen houtje laat oefenen zonder de leraar, en vervolgens alleen de huidige beweging corrigeert die hij op dat moment uitvoert. Hierdoor kan het model leren van zijn eigen fouten zonder de hele geschiedenis van de dans in één keer in zijn geheugen te hoeven houden. Het resultaat? Het model leert om in slechts 3 stappen hoogwaardige video te generen in plaats van de gebruikelijke 50, waardoor het snel genoeg is om in realtime te draaien.

3. De Geheugentruc: De Pose-Retrieval Sink
Dit is het meest creatieve deel. Als je een computer vraagt om een video van 3 minuten te onthouden, raakt hij meestal zijn geheugen kwijt of begint hij in de war te raken. Als de danser een pose aanneemt die hij 2 minuten geleden ook deed, zou een normaal systeem die pose misschien vergeten zijn, wat leidt tot vreemde glitches of een gezicht dat er net even anders uitziet.

LiveAnimate lost dit op met een slim geheugensysteem genaamd Pose-Retrieval Sink Attention (PR-Sink). Stel je voor dat de AI een klein "notitieblokje" heeft (een Rolling Window) dat alleen de laatste paar seconden van de dans vasthoudt. Maar het heeft ook een speciale "Pose Bibliotheek" (een Memory Bank) waar het snapshots van specifieke poses die het eerder heeft gezien, opslaat.

  • De Statische Sink: Dit is een permanent anker. Het houdt het allereerste frame van de video voor altijd vast in het geheugen, zodat de identiteit van de danser nooit afdwaalt.
  • De Dynamische Sink: Dit is de magie. Wanneer de danser een pose aanneemt die overeenkomt met een pose in de "Pose Bibliotheek", pakt het systeem onmiddellijk het "notitieblokje" van dat moment uit het verleden en plakt het in het huidige beeld. Het is alsof de danser plotseling herinnert: "Oh, ik deed deze beweging 2 minuten geleden, en toen zag ik er geweldig uit!" en direct die exacte look kopieert. Dit gebeurt zonder dat het systeem de volledige 3 minuten aan video hoeft te onthouden, waardoor het geheugengebruik constant blijft, ongeacht hoe lang de stream duurt.

De Resultaten: Snel, Stabiel en Echt

De onderzoekers hebben LiveAnimate getest op een danssequentie van drie minuten. De resultaten waren opmerkelijk. Terwijl andere systemen er ofwel 2 tot 5 uur over deden om dezelfde clip te genereren, of de kwaliteit lieten verslechteren (het gezicht werd wazig, de kleding veranderde van kleur, of de identiteit verschoof) na een minuut, hield LiveAnimate de kwaliteit constant van de eerste seconde tot de laatste.

  • Snelheid: Het draait op ongeveer 19,63 frames per seconde op twee krachtige NVIDIA H100 GPU's. Dit is snel genoeg om als een live interactie aan te voelen.
  • Consistentie: Het systeem behield een bijna perfecte score voor visuele kwaliteit en identiteitsconsistentie gedurende de gehele drie minuten. In tegen tegenstelling hiertoe zagen andere methoden hun kwaliteit aanzienlijk dalen naarmate de video langer werd.
  • Efficiëntie: Het geheugengebruik blijft gelijk, of de video nu 10 seconden of 10 minuten lang is, dankzij de slimme "Pose Library"-truc.

Wat het (nog) niet is

Het paper merkt zorgvuldig op wat dit systeem niet doet. Het genereert momenteel video op een resolutie van 480×480 pixels, wat goed is voor een scherm maar niet voor Hollywood-cinemakwaliteit. Het richt zich ook op scènes met één persoon en kan nog geen complexe scenario's aan met meerdere mensen die samen dansen of complexe camerabewegingen. De auteurs suggereren dat het vergroten van deze limieten naar hogere resoluties en complexere scènes de volgende stap is voor toekomstig werk.

Waarom dit ertoe doet

LiveAnimate vertegenwoordigt een nieuw operatiepunt voor AI. Het bewijst dat we niet hoeven te kiezen tussen "hoge kwaliteit" en "realtime snelheid". Door een massaal AI-brein te combineren met een slim, begrensd geheugensysteem, hebben de onderzoekers een tool gecreëerd die de volgende generatie interactieve avatars, live virtuele concerten en telepresence-systemen kan aandrijven, waarbij een digitale mens direct kan dansen, praten en met je kan interageren, zonder ooit te vergeten wie hij is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →