Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
Dit artikel introduceert Goku, een grootschalige dataset van 2 miljoen instructie-uitgelijnde video-bewerkingsparen die complexe multi-task en structurele manipulaties beslaat, samen met het Goku-Edit model en de Goku-Bench benchmark, om de instructiegebaseerde videobewerkingsmogelijkheden verder te brengen dan eenvoudige uiterlijke veranderingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een magische video-editor hebt die alles in een film kan veranderen door simpelweg een zin te typen zoals: "Laat de hond sneller rennen en maak de lucht paars." Een lange tijd waren deze magische tools als onhandige leerlingen: ze konden een shirtkleur aanpassen of een rondligend object verwijderen, maar als je een personage door een kamer wilde laten bewegen of de camerahoek wilde veranderen, raakten ze in de war, bevroren ze of maakten ze er een puinhoop van.
Het paper introduceert Goku, een enorm nieuw project dat is ontworpen om deze magische editors te trainen om echte meesters te worden. Hier is de uitsplitsing van wat ze hebben gedaan, eenvoudig uitgelegd:
1. Het Probleem: De "Eendelige Wonder"-datasets
Voorheen was de trainingsdata voor deze AI-video-editors als een bibliotheek vol boeken over slechts één onderwerp: het veranderen van de kleur van een auto. Als je wilde leren hoe je een auto bestuurt (een onderwerp beweegt) of het decor verandert ( camerabeweging), had de bibliotheek geen boeken over die onderwerpen. De AI-modellen zaten vast omdat ze alleen eenvoudige "kleurplaat-taken" konden uitvoeren.
2. De Oplossing: De "Goku"-bibliotheek
De onderzoekers hebben Goku gebouwd, een enorme dataset met 2 miljoen videopaartjes. Denk aan het bouwen van een gigantische, high-tech trainingsgym voor AI.
- Wat zit erin? In tegen tegenstelling tot eerdere bibliotheken, bevat deze complexe uitdagingen. Het bevat video's waarin de camera ronddraait, waarin een persoon van de ene naar de andere kant van de kamer beweegt, en waarin meerdere veranderingen tegelijkertijd plaatsvinden (bijv. "Vervang het shirt EN voeg een hoed toe").
- Hoe hebben ze het gemaakt? Ze hebben deze video's niet gewoon gefilmd; ze hebben een robotfabriek gebouwd om ze te creëren. Ze gebruikten geavanceerde AI om complexe verzoeken op te splitsen in kleine, beheersbare stappen. Om bijvoorbeeld een hond te laten rennen, leerden ze de AI eerst hoe ze een hond in een enkele afbeelding konden laten rennen, en vervolgens hoe ze die afbeelding vloeiend in een video konden laten bewegen.
- De Kwaliteitscontrole: Om ervoor te zorgen dat de video's geen rommel waren, installeerden ze een "triple-check" beveiligingssysteem. Elke video werd drie keer gecontroleerd door een super slimme AI (Gemini) om te controleren of de instructies werden opgevolgd, of de beweging er echt uitzag en of de video niet glitchte. Ze gooiden ongeveer 88% van de pogingen weg om alleen de beste 2 miljoen over te houden.
3. De Nieuwe Tool: Goku-Edit
Met deze nieuwe bibliotheek bouwden ze een nieuwe video-editor genaamd Goku-Edit.
- De Hersenen: In plaats van alleen tekst te lezen, gebruikt deze editor een "Multimodale Large Language Model" (MLLM). Denk aan het geven van een brein aan de editor waardoor deze het verhaal en de instructies daadwerkelijk kan begrijpen, in plaats van alleen trefwoorden te matchen.
- De Tweehandige Aanpak: De grootste innovatie is dat de editor twee "handen" heeft die samenwerken:
- Hand A (De Architect): Deze hand tekent een ruwe kaart (een masker) van waar de veranderingen moeten plaatsvinden. Deze focust op structuur en beweging.
- Hand B (De Schilder): Deze hand focust op de details, kleuren en texturen.
- Waarom dit belangrijk is: Door het "waar" te scheiden van het "wat", raakt de editor niet in de war. Hij weet precies waar hij de hond moet bewegen zonder per ongeluk de vacht van de hond blauw te schilderen.
- De "Spatial CFG": Dit is een chique term voor een vangnet. Het zorgt ervoor dat wanneer de editor een verandering maakt, deze niet per ongeluk over de rand gaat en de rest van de video verpest. Het houdt de veranderingen strak en precies.
4. De Test: Goku-Bench
Om te bewijzen dat hun nieuwe editor de beste is, creëerden ze een nieuwe test genaamd Goku-Bench.
- In plaats van eenvoudige tests, gaven ze de AI 1.000 moeilijke uitdagingen, zoals "Beweeg de camera naar links terwijl de kat springt."
- Ze gebruikten 7 nieuwe manieren om de resultaten te beoordelen, waarbij ze keken naar zaken als "Viel de fysica logisch?" en "Bewoog de camera vloeiend?".
- Het Resultaat: Goku-Edit versloeg alle andere open-source modellen en verbeterde het vermogen om instructies op te volgen met wel 8%. Het was bijzonder goed in het verplaatsen van objecten en het afhandelen van complexe, meerstaps verzoeken waarbij andere modellen faalden.
Samenvatting
Kortom, het paper zegt: "We hebben een enorme, hoogwaardige trainingsbibliotheek gebouwd (Goku) die AI leert hoe het complexe video-bewerkingen kan doen, en niet alleen eenvoudige kleurveranderingen. We hebben een nieuwe editor gebouwd (Goku-Edit) die een tweeledig systeem gebruikt om structuur en details apart te begrijpen, en we hebben bewezen dat het beter werkt dan alles wat er nu is via een nieuwe, moeilijkere test (Goku-Bench)."
Ze hebben niet beweerd dat deze technologie klaar is voor ziekenhuizen of specifieke klinische toepassingen; ze richtten zich volledig op het slimmer, flexibeler en in staat maken van AI voor complexe creatieve verzoeken bij video-bewerking.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.