ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
Dit paper introduceert ClawGUI, een open-source framework dat de training, evaluatie en implementatie van GUI-agenten op diverse apparaten en platforms verenigt, waardoor een nieuwe staat van de kunst wordt bereikt met de ClawGUI-2B-modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot wilt bouwen die je telefoon of computer voor je kan bedienen. Hij moet kunnen tikken, swipen en klikken, net als jij, maar dan voor je. Dit noemen we een "GUI-agent" (een agent die werkt via grafische schermen).
Het probleem is dat tot nu toe het bouwen van zo'n robot een enorme chaos was. Het was alsof je een auto bouwt, maar de motor, de wielen en het stuur uit drie verschillende fabrieken kwamen die niet met elkaar praten. Je kon de motor trainen, maar dan bleek hij niet te passen op de wielen, en als je hem eindelijk op de weg zette, bleek hij niet te werken op echte wegen.
ClawGUI is de oplossing van onderzoekers van de Zhejiang Universiteit. Het is een alles-in-één gereedschapskist die de hele reis van een robot-agent regelt: van het leren, het testen, tot het daadwerkelijk gebruiken in het echte leven.
Hier is hoe het werkt, vertaald in alledaagse termen:
1. De Opleidingsschool: ClawGUI-RL (Het Leren)
Vroeger leerden robots alleen in een virtuele, veilige "zandbak" (emulators). Maar als je een robot leert autorijden, wil je niet dat hij alleen in een computerspel rijdt; je wilt dat hij ook op een echte weg kan rijden.
- Het probleem: Virtuele zandbakken zijn vaak onstabiel (ze crashen) en echte telefoons geven geen signalen terug over of een taak gelukt is.
- De ClawGUI-oplossing: ClawGUI-RL is een slimme opleidingsmanager. Het kan robots tegelijkertijd laten oefenen op tientallen virtuele telefoons én op echte, fysieke telefoons.
- De slimme truc (De "Dense Reward"): Stel je voor dat een robot een puzzel moet oplossen. Als hij pas aan het einde van de puzzel een beloning krijgt (een "goed gedaan!"), weet hij niet welke stap hij goed deed. ClawGUI gebruikt een Process Reward Model. Dit is als een streng maar eerlijke leraar die na elke stap zegt: "Nee, die knop was niet nodig" of "Ja, dat was een goede stap". Hierdoor leert de robot veel sneller en slimmer dan met alleen een eindresultaat.
2. De Examenschool: ClawGUI-Eval (Het Testen)
In de wetenschap is het testen van robots vaak een rommel. De ene onderzoekster zegt: "Mijn robot is 90% goed!" en de ander zegt: "De mijne is 95%!" Maar ze gebruiken vaak verschillende regels, verschillende schermresoluties of andere manieren om te meten. Het is alsof je twee studenten vergelijkt, maar de ene doet wiskunde in het Nederlands en de ander in het Frans. Je kunt ze niet vergelijken.
- De ClawGUI-oplossing: ClawGUI-Eval is de super-strenge examencommissie. Het zorgt ervoor dat elke robot op precies dezelfde manier wordt getoetst, met dezelfde regels, op dezelfde 6 verschillende "examens" (benchmarks).
- Het resultaat: Ze hebben bewezen dat hun methode 95,8% van de tijd exact dezelfde resultaten oplevert als de officiële examens. Dit betekent dat we eindelijk kunnen zeggen: "Deze robot is echt beter dan die andere," zonder twijfel.
3. De Werkplek: ClawGUI-Agent (Het Gebruik)
Vaak blijven slimme robots in het laboratorium hangen. Ze zijn getraind, maar niemand kan ze gebruiken. Of ze werken alleen via ingewikkelde commando's (zoals voor programmeurs), wat voor gewone mensen onbegrijpelijk is.
- De ClawGUI-oplossing: ClawGUI-Agent brengt de robot naar jou toe. Je kunt tegen je robot praken via apps die je al gebruikt, zoals WhatsApp, Telegram of Slack.
- De hybride kracht: De robot is slim genoeg om te weten wanneer hij een snelle "commando" moet gebruiken (zoals een snelle bestelling plaatsen via een app) en wanneer hij moet "kijken en klikken" (zoals door een menu navigeren waar geen commando voor bestaat).
- Het geheugen: De robot onthoudt wie je bent. Als je vaak "bestel mijn favoriete pizza" zegt, onthoudt hij dat. Hij bouwt een persoonlijk geheugen op, zodat hij zich aanpast aan jouw gewoontes, net als een goede assistent.
Wat hebben ze bewezen?
Ze hebben een eigen robot gemaakt, ClawGUI-2B.
- Deze robot is getraind binnen hun eigen systeem.
- Hij scoort 17,1% op een moeilijke test (MobileWorld), terwijl een vergelijkbare robot zonder dit systeem maar 11,1% haalde.
- Belangrijker nog: Deze kleine, slim getrainde robot doet het beter dan veel gigantische, dure modellen die niet zo goed getraind zijn.
De Grootste Les
De kernboodschap van dit papier is: Het probleem ligt niet in de "hersenen" van de robot (het model), maar in de "infrastructuur" (de omgeving).
Als je een goede leraar, een eerlijk examen en een echte werkplek hebt, kan zelfs een klein robotje enorme prestaties leveren. ClawGUI is die infrastructuur. Het maakt het mogelijk dat we binnenkort allemaal een persoonlijke robot-assistent hebben die écht werkt op onze eigen telefoons, die onthoudt wat we willen, en die we gewoon via een chatbericht kunnen aansturen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.