Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
Het artikel introduceert Video2GUI, een geautomatiseerd raamwerk dat een grootschalige dataset van 12 miljoen GUI-interactietrajecten synthetiseert uit niet-gelabelde internetvideo's om data-schaarste te overwinnen en de generalisatieprestaties van multimodale GUI-agenten aanzienlijk te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot wilt leren hoe je een computer, een telefoon of een website bedient. Om dit te doen, moet je het miljoenen voorbeelden laten zien van mensen die op knoppen klikken, tekst typen en door pagina's scrollen.
Het probleem is dat het vinden van deze voorbeelden ongelooflijk moeilijk is. Meestal moeten onderzoekers mensen inhuren om elke enkele klik handmatig op te nemen en te labelen, wat traag, duur is en hen beperkt tot slechts een paar soorten apps. Het is alsof je een taal probeert te leren door slechts een paar pagina's van een woordenboek te lezen.
Video2GUI is een nieuw systeem dat dit oplost door het hele internet om te vormen tot een gigantische, gratis klaslokaal. Hier is hoe het werkt, met behulp van enkele eenvoudige metaforen:
1. De Grote Filter (Het Vinden van de Juiste Video's)
Het internet zit vol met video's, maar de meeste zijn nutteloos voor het leren van een robot (zoals kookprogramma's of katvideo's). De onderzoekers begonnen met 500 miljoen YouTube-video's.
- De Ruwe Zeef: Eerst gebruikten ze een slimme AI om de titels en beschrijvingen te scannen. Dit is alsof een bibliothecaris snel de ruglees van boeken controleert om te zien of ze over "computers" gaan, voordat ze ze zelfs maar openen. Dit verminderde de stapel tot 20 miljoen.
- De Fijne Zeef: Vervolgens gebruikten ze een geavanceerdere AI om daadwerkelijk de eerste minuut van die video's te "bekijken". Het controleerde: Is het scherm helder? Legt de stem de stappen goed uit? Laat het daadwerkelijk zien hoe software wordt gebruikt? Dit is alsof een strenge leraar de video's beoordeelt om ervoor te zorgen dat het hoogwaardige tutorials zijn.
- Het Resultaat: Ze eindigden met 4,2 miljoen hoogwaardige tutorialvideo's.
2. De Vertaler (Video Omzetten in Instructies)
Nu hadden ze de video's, maar een robot kan niet zomaar een video "bekijken" en het begrijpen zoals een mens dat doet. De video moet worden vertaald naar een gestructureerde lijst met instructies.
- Het Proces: Ze gebruikten een krachtige AI (zoals een super-slimme vertaler) om de video's te bekijken en te ontleden. Het identificeerde het doel (bijvoorbeeld "Schoenen kopen"), de ondernomen stappen en het exacte moment waarop elke klik plaatsvond.
- De Magie: De AI raakte niet zomaar; het keek naar de videoframes om de exacte coördinaten van de knoppen die werden aangeklikt te vinden. Het veranderde een 10 minuten durende video van iemand die online winkelt in een precieze, stap-voor-stap kaart: "Op 0:05, klik op de zoekbalk. Op 0:10, typ 'sneakers'."
3. De Bibliotheek (WildGUI)
Al deze vertaalde instructies werden verzameld in een enorme nieuwe bibliotheek genaamd WildGUI.
- De Schaal: Deze bibliotheek bevat 12 miljoen interactiepaden (trajecten) die meer dan 1.500 verschillende apps en websites bestrijken.
- De Variatie: Het omvat alles van Windows-desktops tot Android-telefoons en Mac-computers. Het is alsof je een bibliotheek hebt die elke mogelijke manier bevat waarop een mens ooit een computer heeft gebruikt, allemaal georganiseerd en klaar voor een robot om te bestuderen.
4. De Training (Het Leren van de Robot)
De onderzoekers namen twee bestaande AI-modellen (Qwen2.5-VL en Mimo-VL) en "voerden" ze met deze nieuwe bibliotheek.
- Het Resultaat: Na het bestuderen van deze enorme dataset werden de robots aanzienlijk beter. Ze verbeterden met 5% tot 20% op verschillende tests.
- Het Bewijs: Ze konden nu knoppen vinden, op de juiste dingen klikken en complexe websites veel beter navigeren dan daarvoor, en waren gelijk aan of beter dan de beste robots die momenteel bestaan.
De Conclusie
Het paper beweert dat ze door het automatiseren van het proces van het omzetten van internetvideo's in trainingsdata, een enorme, diverse dataset hebben gecreëerd die AI-agenten veel slimmer maakt in het gebruik van computers. Ze hebben geen nieuw type robot uitgevonden; ze hebben de bestaande gewoon een veel beter, groter en diverser schoolboek gegeven om uit te studeren.
Ze hebben deze dataset en de tools die zijn gebruikt om deze te bouwen vrijgegeven, zodat andere onderzoekers ze kunnen gebruiken om in de toekomst nog betere AI-agenten te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.