← Nieuwste papers
💻 computer science

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder introduceert een nieuw Diffusion Transformer-framework dat voor het eerst gecontroleerde bewegingsoverdracht mogelijk maakt voor meerdere objecten in video's door middel van een stabiele bewegingsprior en een verliesfunctie die objecten koppelt aan hun bijbehorende tekstbeschrijvingen.

Oorspronkelijke auteurs: Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

Gepubliceerd 2026-04-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een videospelletje speelt waarin je de bewegingen van een acteur kunt "stelen" en op een ander personage kunt plakken. Als die acteur loopt, moet het nieuwe personage ook lopen. Als die acteur springt, moet het nieuwe personage ook springen.

Dit is precies wat MotionGrounder doet, maar dan voor video's gemaakt door kunstmatige intelligentie.

Hier is een uitleg in gewone taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Eén-Acteur" Regel

Tot nu toe konden slimme computers (AI) bewegingen alleen van één persoon of object overnemen.

  • De vergelijking: Stel je voor dat je een danseres hebt die een solo-dans doet. De AI kon die dans perfect namaken op een andere danseres. Maar zodra je een hele groep dansers wilde hebben die allemaal verschillende dingen doen (de ene loopt, de andere rent, de derde springt), raakte de AI in de war. Het was alsof je probeerde een orkest te dirigeren met één fluitje: alles werd één groot, rommelig geluid. De AI wist niet welke beweging bij welk dier of persoon hoorde.

2. De Oplossing: MotionGrounder

De onderzoekers van dit paper hebben MotionGrounder bedacht. Dit is een nieuwe manier om video's te maken die meerdere objecten tegelijk kan aansturen, terwijl ze precies weten wie wie is.

Ze gebruiken twee slimme trucjes:

Truc 1: De "Onzichtbare Draadjes" (Flow-based Motion Signal)

Stel je voor dat je een poppenspeler bent. Je hebt een pop (het object in de video) en je wilt dat hij beweegt zoals een echte persoon.

  • Hoe het werkt: De AI kijkt naar de originele video en trekt onzichtbare draadjes (zoals optische stroming) tussen de frames. Deze draadjes vertellen de AI precies: "Deze vlek beweegt naar links, die vlek naar rechts."
  • Het voordeel: Vroeger waren deze draadjes vaak slordig en verwarden ze de achtergrond met de voorgrond. MotionGrounder maakt deze draadjes strak en stabiel, zodat de beweging soepel overgaat, zelfs als de achtergrond heel anders is.

Truc 2: De "Naamkaartjes" (Object-Caption Alignment)

Dit is het echte magische deel. Stel je voor dat je een regisseur bent met een cast van acteurs: een wolf, een beer en een konijn. Je zegt tegen de AI: "De wolf loopt naar links, de beer rent naar rechts."

  • Het probleem: Zonder hulp zou de AI misschien denken: "Oh, de wolf rent naar rechts!" en de beer naar links.
  • De oplossing: MotionGrounder plakt een naamkaartje op elk object in de video. Het zegt tegen de AI: "Kijk, dit is de wolf (en dit is zijn plekje in de video). Dit is de beer."
  • De vergelijking: Het is alsof je een regisseur bent die niet alleen zegt "Acteurs, beweeg!", maar ook precies aangeeft: "Jij, met de naamkaartje 'Wolf', doe dit. Jij, met het kaartje 'Beer', doe dat." Hierdoor weet de AI precies wie wat moet doen, zelfs als er drie dieren tegelijk in beeld zijn.

3. Wat kan het nu doen?

Met MotionGrounder kun je dingen doen die voorheen onmogelijk waren:

  • Voorbeeld 1: Je hebt een video van een soldaat die naar een tank loopt in de woestijn. Je kunt de AI vragen: "Maak een video van een robot-hond en een robot-kind die op een neon-platform lopen."
    • De robot-hond loopt precies zoals de soldaat liep.
    • De robot-kind beweegt precies zoals de tank bewoog.
    • En ze blijven op hun eigen plekken staan, ze raken niet door elkaar heen.
  • Voorbeeld 2: Een wolf, een beer en een konijn die in een weiland spelen. De AI zorgt dat de wolf de bewegingen van de wolf uit de originele video doet, en niet die van de beer.

4. Waarom is dit belangrijk?

Vroeger was het alsof je een film maakte met één acteur en je probeerde die acteur te vervangen door een hele groep, maar iedereen deed hetzelfde of raakte in de war.
Met MotionGrounder kun je nu gecontroleerde chaos creëren. Je kunt complexe scènes maken met veel verschillende dingen die allemaal hun eigen, specifieke bewegingen doen, precies zoals jij dat in je hoofd ziet.

Kort samengevat:
MotionGrounder is als een super-direkte regisseur die twee dingen doet:

  1. Hij houdt de bewegingen van de originele video strak vast (zodat het niet rammelt).
  2. Hij plakt naamkaartjes op elk object, zodat de AI precies weet welk dier of persoon welke beweging moet doen.

Hierdoor kunnen we nu video's maken waar meerdere personages tegelijk iets anders doen, en dat allemaal zonder dat de AI eerst jarenlang moet leren (het werkt direct, "zero-shot").

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →