← Nieuwste papers
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

Dit artikel introduceert DyMoS, een trainingsvrije en modelonafhankelijke methode die de bewegingsdynamiek in beeld-naar-video-generatie verbetert door de dominantie van referentiekaders in het aandachtsmechanisme te herbekijken, waardoor bewegingsonderdrukking wordt overwonnen zonder afbreuk te doen aan de visuele trouw of extra training te vereisen.

Oorspronkelijke auteurs: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Bevroren" Video

Stel je hebt een foto van een paard en je vraagt een computer om er een video van te maken waarin het paard rent. Je zou verwachten dat het paard galoppeert. Maar vaak zijn huidige AI-modellen te "beleefd" tegenover de originele foto. Ze houden het paard op zijn plaats, misschien met slechts een lichte beweging van de oren, omdat ze zo bang zijn om het beeld dat je hebt gegeven te veranderen.

Het paper noemt dit de "Static Motion Bias" (Statische Bewegingstendens). De AI is zo gefocust op het perfect houden van het eerste frame (de referentieafbeelding) dat ze vergeet de rest van de video in beweging te brengen.

De Ontdekking: De "Te Opmerkzame" Student

De onderzoekers keken onder de motorkap van hoe deze AI-modellen werken. Ze ontdekten een specifiek gedrag dat ze "Reference-Frame Dominance" (Dominantie van het Referentiekader) noemen.

Stel je het AI-model voor als een student die een toets maakt.

  • De Tekstprompt is de vraag: "Laat het paard rennen."
  • De Referentieafbeelding is een foto van het paard op het bureau.

In een normaal Text-to-Video-model kijkt de student naar de vraag en stelt zich het rennende paard voor.
In een Image-to-Video-model staart de student echter te hard naar de foto op het bureau. Elke keer als de student probeert het volgende frame van de video te tekenen, kijkt hij naar de foto en zegt: "Oké, ik moet ervoor zorgen dat dit volgende frame er exact zo uitziet als de foto."

Omdat de student zo bezeten is van het kopiëren van de foto, tekent hij het paard nooit echt in beweging. De "foto" overheerst de "verbeelding".

De Oplossing: DyMoS (De "Bewegingsregelaar")

De onderzoekers hebben een tool gemaakt genaamd DyMoS (Dynamic Motion Slider). Het vereist geen hertraining van de AI of het veranderen van de originele foto. In plaats daarvan fungeert het als een volumeknop voor de obsessie van de student.

Hoe het werkt:

  1. De Interventie: Tijdens de allereerste momenten van het maken van de video (de "denoising"-stappen), tikt DyMoS de student zachtjes op de schouder. Het zegt: "Hé, stop met zo hard naar de referentiefoto te staren. Je moet nu de beweging verbeelden."
  2. Het Mechanisme: Technisch gezien past het een specifiek getal (een "bias") aan in het aandachtsysteem van de AI. Het verlaagt iets de score die de AI toekent aan de tokens van de referentieafbeelding wanneer het moet beslissen hoe het volgende frame eruit moet zien.
  3. Het Resultaat: De AI mag de foto nog steeds zien (dus het paard ziet er nog steeds uit als het paard), maar het wordt niet langer gedwongen om het perfect te kopiëren. Dit geeft de AI de vrijheid om het paard te laten rennen, de auto te laten rijden of het water te laten spatten.

De "Slider"-Functie

Het coolste deel van DyMoS is dat het een slider is, en niet zomaar een aan/uit-schakelaar. De gebruiker heeft één getal dat hij kan draaien:

  • Draai het omlaag (Negatieve getallen): De AI wordt meer bezeten van de foto. De video wordt nog statischer (handig als je een stilstaand beeld wilt dat nauwelijks beweegt).
  • Draai het omhoog (Positieve getallen): De AI krijgt te horen om de "bevroren" aard van de foto meer te negeren. De video wordt zeer dynamisch en energiek.
  • Middenweg: Je kunt de perfecte balans vinden waarbij de video natuurlijk beweegt, maar het personage er nog steeds precies zo uitziet als de foto waarmee je bent begonnen.

Waarom Het Beter Is dan Eerdere Methoden

Eerdere pogingen om dit probleem van de "bevroren video" op te lossen, waren als proberen een auto te repareren door de motor te verbrijzelen of de wielen te overschilderen.

  • Sommige methoden vereisten hertraining van de hele AI (duur en traag).
  • Anderen probeerden de invoerfoto te vervagen of te verstoren om beweging af te dwingen, wat vaak resulteerde in een lelijke of vervormde video.

DyMoS is anders omdat:

  1. Het Training-Free is: Je hoeft de AI niets nieuws te leren. Je gebruikt de tool gewoon terwijl de AI werkt.
  2. Het Model-Agnostisch is: Het werkt op bijna elke moderne video-AI (zoals Wan 2.2, HunyuanVideo, CogVideoX).
  3. Het Kwaliteit Behoudt: Het laat de video bewegen zonder dat de foto er wazig of raar uitziet.

Samenvatting

Het paper identificeert dat Image-to-Video-modellen "te beleefd" zijn tegenover hun invoerafbeeldingen, waardoor video's saai en stilstaand worden. Ze hebben dit opgelost met DyMoS, een eenvoudige tool die fungeert als een volumeknop, die de obsessie van de AI met de startfoto net genoeg verlaagt om de beweging te laten gebeuren, en dit alles zonder het model of de originele afbeelding te veranderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →