← Nieuwste papers
💻 computer science

VicEdit: Learning to Edit Videos from Visual In-Context Examples

Het artikel introduceert VicEdit, een verenigd framework dat videobewerking vooruit helpt door gebruik te maken van een nieuwe grootschalige dataset (Vicedit-400K) en innovatieve technieken zoals Modality-Adaptive Semantic Distillation en Dual-Context Injection om visuele in-context voorbeelden effectief te integreren met tekstuele instructies voor superieure bewerkingsprestaties.

Oorspronkelijke auteurs: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

Gepubliceerd 2026-08-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Jarenlang was de droom van videobewerking simpelweg een computer vertellen wat hij moest doen. Als je de kleur van een auto in een filmscène wilde veranderen of een bewolkte lucht wilde vervangen door een zonsondergang, kon je een zin typen zoals "maak de lucht oranje", en de software zou zijn best doen. Deze aanpak, bekend als instructiegebaseerde bewerking, heeft opmerkelijke vooruitgang geboien. Het vertrouwt op krachtige kunstmatige intelligentiemodellen die taal begrijpen en afbeeldingen en video's vanaf nul kunnen genereren. Echter, een fundamenteel probleem blijft bestaan: woorden zijn vaak te vaag om de specifieke look en feel van een scène vast te leggen. Een tekstuele beschrijving kan "rode auto" zeggen, maar kan niet gemakkelijk de exacte tint rood overbrengen, de manier waarop het licht op het metaal valt, of de specifieke beweging van het voertuig. Wanneer een computer deze details probeert te raden op basis van alleen een zin, ziet het resultaat er vaak fout uit, met kleuren die verschuiven, objecten die op de verkeerde plek verschijnen, of bewegingen die stijf en onnatuurlijk aanvoelen.

Om dit op te lossen, zijn onderzoekers begonnen met het verkennen van een andere manier om computers te onderwijzen: hen voorbeelden laten zien in plaats van ze alleen maar te vertellen. Dit concept, in-context learning genoemd, is vergelijkbaar met hoe een menselijke leerling een ambacht leert. In plaats van een handleiding te lezen over hoe je een muur moet schilderen, kijkt de leerling toe hoe een meesterschilder een specifieke penseelstreek aanbrengt op een specifiek oppervlak. Door het verband tussen de originele muur en het eindresultaat te observeren, leert de leerling de precieze techniek. In de wereld van videobewerking betekent dit het computer voorzien van visuele referenties — zoals een enkele afbeelding, een paar afbeeldingen die een voor-en-na-situatie laten zien, of zelfs een korte videoclip van de gewenste verandering. De uitdaging was dat geen enkel systeem al deze verschillende soorten visuele aanwijzingen tegelijkertijd kon afhandelen, en er was geen grote collectie voorbeelden om het systeem effectief te leren hoe het deze te gebruiken.

Een team van onderzoekers heeft nu deze kloof overbrugd met een nieuw systeem genaamd VicEdit. Hun werk vertegenwoordigt een significante verschuiving van het uitsluitend vertrouwen op tekstuele beschrijvingen naar het gebruik van visuele voorbeelden als de primaire gids voor bewerking. Om dit systeem te bouwen, heeft het team eerst een enorme bibliotheek van trainingsdata gecreëerd. Ze genereerden 400.000 hoogwaardige voorbeelden, een dataset die ze VicEdit-400K noemden. Deze collectie is uniek omdat deze tien verschillende soorten bewerkingstaken beslaat, van het veranderen van de stijl van een hele scène tot het toevoegen of verwijderen van specifieke objecten. Cruciaal is dat elk voorbeeld in deze bibliotheek gekoppeld is aan de juiste soort visuele referentie: een enkele afbeelding voor stijlveranderingen, een paar afbeeldingen voor ruimtelijke veranderingen, of een paar video's voor complexe beweging. Deze enorme bibliotheek stelde hen in staat om de computer te leren hoe hij visuele aanwijzingen met een precisie kan interpreteren die tekst alleen nooit zou kunnen bieden.

De kern van hun nieuwe systeem is een methode die de computer in staat stelt zijn begrip aan te passen op basis van het type visuele aanwijzing dat hij ontvangt. Wanneer de computer een enkele afbeelding ziet, leert hij zich te concentreren op texturen en kleuren. Wanneer hij een paar afbeeldingen ziet, leert hij te begrijpen hoe objecten van de ene naar de andere positie bewegen. Wanneer hij een paar video's ziet, leert hij de stroom van tijd en beweging te volgen. De onderzoekers ontwierpen een proces dat deze specifieke lessen uit de visuele voorbeelden extraheert en combineert met de geschreven instructies. Dit zorgt ervoor dat de computer niet alleen blindelings de tekst volgt, maar de visuele voorbeelden gebruikt om de veranderingen in de realiteit te verankeren. Bijvoorbeeld, als een gebruiker vraagt om een waterfles te veranderen in een gloeiende sterrenstelsel, levert de tekst het idee, maar een visueel voorbeeld van een gloeiend sterrenstelsel zorgt ervoor dat de computer precies weet hoe dat eruitziet, wat voorkomt dat er een generiek of vertekend resultaat ontstaat.

De resultaten van deze aanpak zijn opvallend. Bij tests tegenover bestaande methoden produceerde het nieuwe systeem consistent hogere kwaliteit video's die trouwer waren aan de intentie van de gebruiker. In taken waarbij andere systemen moeite hadden om objecten op de juiste plek te houden of de juiste stijl te behouden, slaagde deze nieuwe methode erin. Het kon naadloos een nieuw object in een scène mengen, de achtergrond veranderen zonder de voorgrond te vervormen, of complexe artistieke stijlen toepassen die er natuurlijk en samenhangend uitzagen. Het systeem bewees dat door de computer te laten zien wat hij moet doen, in plaats van het hem alleen te vertellen, de kwaliteit van de bewerking drastisch verbetert. Dit werk vestigt een nieuwe standaard voor videobewerking, door aan te tonen dat visuele voorbeelden een krachtig en noodzakelijk hulpmiddel zijn voor het begeleiden van kunstmatige intelligentie. De onderzoekers hebben hun dataset en systeem beschikbaar gesteld voor anderen om te gebruiken, wat de deur opent naar meer precieze en creatieve videobewerkingsinstrumenten in de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →