← Nieuwste papers
💻 computer science

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Vorch-IR is een verenigd multimodaal framework gebouwd op LTX2 dat flexibele identiteitsvervanging van één of twee personen met optionele achtergrondbewerking mogelijk maakt in langdurige video's door gezamenlijk te conditioneren op sturende video's, referentieafbeeldingen en tekstuele instructies, terwijl het schaarste aan data overwint door een automatische synthese-pipeline en zich uitbreidt naar minutenlange generaties via een temporele overlappende inferentiestrategie.

Oorspronkelijke auteurs: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

Gepubliceerd 2026-08-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een afstandsbediening voor de werkelijkheid vasthoudt, maar in plaats van van kanaal te wisselen, wil je de acteurs in een film vervangen terwijl het script, de camerastandpunten en de dansbewegingen precies hetzelfde blijven. Dit is de droom van "video identity replacement", een hot topic in de wereld van kunstmatige intelligentie. Lange tijd kon AI nieuwe video's vanaf nul genereren, maar het bewerken van een bestaande video was alsoals proberen het gezicht van een personage in een live-action film te veranderen zonder de belichting of de beweging te verpesten. Vroege pogingen vereisten dat de AI een gedetailleerde kaart kreeg van waar de persoon stond, een schets van het skelet van hun pose, of een masker om hun gezicht te bedekken. Het was alsof je een chef-kok vroeg om een maaltijd te koken, maar alleen als je hem een vooraf uitgesneden lijst met ingrediënten en een diagram van de keuken gaf. Deze methoden waren rigide en moeilijk te gebruiken. De grote vraag die onderzoekers nu stellen is: Kunnen we een AI leren om een simpele zin te begrijpen zoals "Vervang de danser links door deze foto" en het gewoon te snappen, zonder dat er een complexe kaart of een skelet voor nodig is?

Maak kennis met Vorch-IR, een nieuw AI-systeem dat fungeert als een superintelligente, magische filmeditor. Zie het als een regisseur die geen script supervisor of stuntcoördinator nodig heeft. Je geeft Vorch-IR drie dingen: de originele video (de "driving" video), een paar foto's van de nieuwe mensen die je wilt invoegen (de "references"), en een simpel tekstberichtje dat de AI vertelt wie waar moet komen. De magie is dat de foto's niet hoeven te matchen met de pose of positie van de video. Als de video een persoon laat dansen met de armen omhoog, en jouw foto laat die persoon zitten, dan begrijpt Vorch-IR hoe de zittende persoon toch moet dansen. Het handelt single personen af, twee mensen die samen dansen, en zelfs het vervangen van de achtergrondscène, allemaal met één enkel model.

De onderzoekers achter Vorch-IR hebben dit systeem gebouwd op een krachtige videogenerator genaamd LTX2. Ze hebben de AI geleerd om tegelijkertijd naar de video, de foto's en de tekstinstructies te kijken. In plaats van rigide kaarten te gebruiken, gebruikt de AI een "vision-language" brein (een type AI dat zowel plaatjes als woorden begrijpt) om de connectie te begrijpen. Het is alsof de AI jouw briefje leest, naar de foto kijkt en zegt: "Ah, je wilt dat deze persoon de plaats inneemt van de persoon aan de linkerkant," en vervolgens gebruikt het zijn interne "self-attention" om het nieuwe gezicht perfect op het bewegende lichaam te blenden.

Een van de grootste hindernissen in dit veld is data. Om een AI te leren gezichten te vervangen, heb je duizenden voorbeelden van "voor" en "na" video's nodig. Omdat deze niet bestaan in de echte wereld, heeft het team een robot-pipeline gebouwd om ze te maken. Ze namen echte video's, gebruikten andere AI-tools om de gezichten in het eerste frame te vervangen, en gebruikten vervolgens een bewegingsgestuurde robot om de rest van de video het nieuwe gezicht te laten volgen. Vervolgens filterden ze de slechte pogingen eruit (zoals wanneer de AI per ongeluk de danser drie armen gaf) om een perfect trainingsset te creëren. Hierdoor konden ze één model trainen om alles te doen: het vervangen van één persoon, het vervangen van twee personen, en zelfs het veranderen van de achtergrond, allemaal zonder aparte tools voor elke taak nodig te hebben.

Maar wat betreft het maken van een hele film? De meeste AI-videogeneratoren raken in de war of worden wazig na een paar seconden. Vorch-IR gebruikt een slimme truc genaamd "temporal overlapping inference". Stel je voor dat je een lange muurschildering probeert te schilderen. In plaats van een klein vierkantje te schilderen, het te laten drogen en dan het volgende te schilderen (wat de kleuren anders kan maken), schildert Vorch-IR overlappende secties tegelijkertijd en blendt deze naadloos samen. Hierdoor kan het video's genereren die een volle minuut lang zijn zonder dat de gezichten van de personages gaan afwijken of de beweging vreemd wordt, zonder dat er een video clip voor clip gegenereerd hoeft te worden.

Het team heeft Vorch-IR getest tegen andere top AI-modellen. In head-to-head vergelijkingen suggereerde Vorch-IR dat het beter was in het behouden van het uiterlijk van het nieuwe gezicht (identity preservation) en het consistent houden van de achtergrond, terwijl de beweging nog steeds vloeiend bleef. In menselijke tests gaven mensen de voorkeur aan de resultaten van Vorch-IR boven andere methoden, vooral wanneer het ging om het echt en fysiek plausibel maken van het nieuwe personage. Het paper suggereert dat hoewel sommige oudere modellen misschien iets beter zijn in specifieke zaken zoals perfecte pose-matching in zeer specifieke scenario's, Vorch-IR een veel flexibelere en verenigde manier biedt om video's te bewerken, waarmee bewezen wordt dat je geen complexe kaarten nodig hebt om geweldige resultaten te behalen. Het is een stap naar een toekomst waar het bewerken van een video zo eenvoudig is als het typen van een zin.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →