← Nieuwste papers
💻 computer science

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

CoInteract is een end-to-end framework voor het synthetiseren van realistische video's van mens-objectinteracties dat, via een mensbewuste mix-and-expert-architectuur en ruimtelijk gestructureerde co-generatie, structurele stabiliteit en fysiek plausibele contacten verbetert ten opzichte van bestaande methoden.

Oorspronkelijke auteurs: Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een digitale film wilt maken waarin een persoon een product (zoals een tas of een apparaat) vastpakt, beweegt en ermee interacteert, allemaal gestuurd door een stemopname. Dit klinkt als magie, maar voor computers is dit een enorme uitdaging.

Deze paper introduceert CoInteract, een slimme nieuwe manier om deze video's te maken. Hier is hoe het werkt, vertaald naar alledaagse taal:

Het Grote Probleem: De "Magische" Computer

Tot nu toe waren computers goed in het maken van mooie video's, maar ze waren vaak slecht in fysica.

  • De "Geest" in de muur: Vaak zag je dat de hand van een persoon door een product heen ging, alsof het spookte.
  • De "Vervormde" Hand: De vingers van de persoon werden soms een oneffen brij of verdwenen helemaal.

Computers keken alleen naar de kleuren (pixels) en wisten niet echt hoe een hand eruitzag of hoe zwaar een tas is. Ze hadden geen "gevoel" voor de ruimte.

De Oplossing: CoInteract

CoInteract is als een regisseur die niet alleen naar het script kijkt, maar ook een architect en een anatomist in de crew heeft. Het werkt met twee slimme trucjes:

1. De "Speciale Teamleden" (Human-Aware MoE)

Stel je een groot kantoor voor waar één grote computer (de "basis") al het werk doet. Soms maakt die basis fouten bij complexe dingen, zoals handen en gezichten.
CoInteract voegt speciale experts toe aan dit team:

  • Er is een Hand-expert: Die kijkt alleen naar de vingers en zorgt dat ze eruitzien als vingers, niet als een klont.
  • Er is een Gezichts-expert: Die zorgt dat de ogen en mond perfect blijven.
  • Er is een Basis-expert: Die doet de rest van het werk (de kleding, de achtergrond).

Een slimme "manager" (de router) kijkt naar het beeld en stuurt de stukjes van de video die handen of gezichten zijn, direct naar de juiste expert. De rest gaat naar de basis. Zo krijg je scherpe handen zonder dat de hele computer trager wordt.

2. De "Twee-Spoor Training" (Spatially-Structured Co-Generation)

Dit is de meest creatieve truc. Stel je voor dat je een schilderij leert maken.

  • Spoor 1 (De Kleuren): De computer leert de video maken zoals hij eruit moet zien (de tas, de kleding, de achtergrond).
  • Spoor 2 (De Skelet-Tekening): Tegelijkertijd leert de computer een schets te maken. In deze schets is de tas nog steeds een tas, maar de persoon is alleen een zwart silhouet. Er zijn geen kleuren, alleen de vorm en de positie.

Waarom doen ze dit?
Tijdens het leren (training) kijkt de computer naar beide sporen tegelijk. De "schets" dwingt de computer om te begrijpen: "Oh, de hand moet voor de tas zijn, niet erdoorheen." Het dwingt de computer om de fysieke regels van de wereld te begrijpen, niet alleen de kleuren.

Het Geniale Detail:
Wanneer de computer klaar is met leren en de video daadwerkelijk moet maken (tijdens het gebruik), gooien ze het tweede spoor (de schets) weg.

  • De computer heeft de kennis van de schets al in zijn hoofd opgeslagen.
  • Je krijgt dus een prachtige, fysisch correcte video, maar de computer hoeft niet twee keer te rekenen. Het is alsof je een fiets rijdt: je hebt de balans geleerd, maar je hoeft niet meer naar het trainingswiel te kijken om te fietsen.

Samenvattend

CoInteract is als een slimme filmregisseur die:

  1. Speciale experts huurt voor moeilijke onderdelen (handen/gezichten).
  2. Tijdens het leren een skelet-tekening gebruikt om de computer te leren hoe objecten in de ruimte passen (zodat handen niet door muren gaan).
  3. Tijdens het maken alleen de mooie video levert, zonder dat het langzamer gaat.

Het resultaat? Video's waarin mensen producten vasthouden alsof ze echt bestaan, zonder dat hun handen door de tas heen glimmen of vervormen. Perfect voor online winkels, reclames en virtuele assistenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →