CoT-Edit: Let CoT Guide Instruction Video Editing
CoT-Edit introduceert een plan-gestuurd bewerkingsframework dat een met Chain-of-Thought verrijkt multimodaal groot taalmodel benut om precieze ruimtelijke priors en attribuutrijke instructies te genereren, waardoor tekstgestuurde videobewerking in complexe scènes mogelijk wordt met verbeterde objectlokalisatie, fysieke consistentie en temporele coherentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren om een homevideo te bewerken. Je wilt niet urenlang complexe software leren; je wilt gewoon kunnen zeggen: "Laat de hond vliegen als een superheld," en dat het ook echt gebeurt. Dit is de droom van instructiegebaseerde videobewerking, een vakgebied waarin computers proberen jouw natuurlijke taalcommando's te begrijpen en de pixels in een video aan te passen om eraan te voldoen. Maar hier zit de crux: computers zijn berucht slecht in "gezond verstand". Als je een robot vertelt om "een UFO die in een cirkel vliegt toe te voegen," plakt hij misschien gewoon een afbeelding van een UFO op de lucht, waarbij hij de zwaartekracht negeert, of hij verandert per ongeluk de verkeerde hond in een kat als er twee honden in de scène zijn. Het is alsof je een chef-kok een recept geeft waarin staat "voeg wat kruiden toe" zonder te vertellen welke kruiden of hoeveel — het resultaat is vaak een bende. Om dit op te lossen, proberen onderzoekers de kloof te overbruggen tussen vage menselijke woorden en precieze, fysieke acties in een video, om ervoor te zorgen dat als een bal wordt gegooid, deze de wetten van de fysica volgt, en als je naar een specifiek object wijst, de computer precies weet welk object je bedoelt.
Maak kennis met CoT-Edit, een nieuwe methode die werkt als een briljante, stapsgewijze projectmanager voor videobewerking. In plaats van alleen een instructie te roepen en te hopen dat de computer het goed doet, dwingt CoT-Edit de AI om "na te denken voordat hij handelt". De auteurs stellen een driestappenframework voor genaamd Plan–Guide–Edit. Eerst kijkt de Planner (een superintelligent AI-brein) naar de video en jouw tekstcommando. Hij raadt niet zomaar wat; hij gebruikt een techniek genaamd Chain-of-Thought (CoT) om de taak op te splitsen. Hij voert gestructureerde redeneerstappen uit om de scène te analyseren: "Wat doet de hond? Waar is hij? Als ik een UFO toevoeg, waar moet deze dan heen vliegen om er echt uit te zien?" Vervolgens genereert hij een reeks genormaliseerde bounding boxes om de objecten te markeren en schrijft hij een meer gedetailleerde, "verrijkte" instructie die ook fysieke regels bevat, zoals "de UFO moet een gebogen pad volgen."
Vervolgens neemt de Guide deze bounding boxes en zet ze om in werkelijke maskers — denk aan digitale sjablonen of uitsnedes die de computer precies vertellen waar hij moet werken. Omdat de computer nu een duidelijke kaart heeft (de boxen) in plaats van alleen een vaag idee, hoeft hij niet te raden welke hond hij moet veranderen of waar het nieuwe object moet landen. Ten slotte gebruikt de Editor (de kunstenaar) deze sjablonen en de gedetailleerde instructies om de nieuwe inhoud in de video te schilderen. Het is het verschil tussen een schilder die de opdracht krijgt "schilder een vogel" en een schilder die een specifieke omtrek van een vogel krijgt, een lijst met kleuren, en een regel die zegt "de vogel moet op de tak zitten, en niet in de lucht zweven."
Het artikel concludeert dat deze "eerst denken"-aanpak aanzienlijk beter werkt dan eerdere methoden. In tests was CoT-Edit veel beter in het kiezen van het juiste object wanneer er veel vergelijkbare objecten waren (zoals het kiezen van de gele hond boven de bruine hond) en in het laten bewegen van nieuwe objecten op fysiek realistische wijzen (zoals een bal die correct stuitert). De onderzoekers hebben hun systeem in twee fasen getraind: eerst leerden ze de maskermaker en de editor afzonderlijk met een mix van publieke datasets; daarna trainden ze hen samen op ongeveer 100.000 hoogwaardige video-bewerkingsparen. Toen ze het testten, presteerde CoT-Edit beter dan andere topmethoden in bijna elke categorie, inclusief hoe vloeiend de beweging eruitzag en hoe goed het de instructies van de gebruiker volgde. De auteurs suggereren dat door expliciet te plannen wat de "waar" en de "hoe" is voordat de "wat" volgt, ze video-edits kunnen creëren die niet alleen visueel indrukwekkend zijn, maar ook logisch zijn voor het menselijk oog.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.