Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction
Dit artikel introduceert VAGEN, een framework dat een met tools versterkte verifier-agent gebruikt met een progressief, surface-to-latent verificatiemechanisme om de beperkingen van bestaande passieve en over-probing beloningsmodelleringsmethoden te overwinnen, waardoor de nauwkeurigheid en efficiëntie van GUI-agent evaluatie op benchmarks zoals OSWorld-Verified en AndroidWorld aanzienlijk wordt verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert om een computer te gebruiken. Je wilt de robot leren hoe hij apps moet openen, op knoppen moet klikken en taken moet voltooien, zoals het kopen van een boek of het organiseren van bestanden. Om de robot te onderwijzen, heb je een manier nodig om aan te geven of hij een goede job heeft gedaan of dat hij een fout heeft gemaakt. Dit is de wereld van Reinforcement Learning, waarbij een AI leert door dingen te proberen en "beloningen" te krijgen voor succes. Maar hier komt het lastige deel bij: hoe weet je of de robot de taak daadwerkelijk heeft voltooid? Heeft hij echt het boek gekocht, of heeft hij alleen op een knop geklikt die leek op een koopknop? Dit is het probleem van Reward Modeling. Als de robot denkt dat hij geslaagd is terwijl dat niet zo is, zal hij dezelfde fout blijven maken. Als hij denkt dat hij gefaald heeft terwijl hij eigenlijk geslaagd is, raakt hij in de war en stopt hij met proberen. Het goed krijgen van deze "score" is het verschil tussen een onhandige robot en een behulpzame assistent.
Lama tijd probeerden wetenschappers twee belangrijke manieren om de robot te beoordelen. De eerste was als een strenge leraar met een checklist: "Is het bestand verschenen? Ja. Is het venster gesloten? Ja." Dit werkt voor eenvoudige taken, maar loopt vast wanneer de taak creatief of open einde is. De tweede manier was om een superintelligente AI (een Large Language Model) te vragen naar een video van het werk van de robot te kijken en te raden of hij geslaagd is. Dit is schaalbaar, maar de AI is passief; hij kan alleen kijken naar wat hij op het scherm ziet. Hij kan niet in de "hersenen" van de computer kijken om te zien of een bestand op de achtergrond daadwerkelijk is opgeslagen. Het is alsoam met een leraar die een wiskundetoets beoordeelt door alleen naar het definitieve antwoordblad van de leerling te kijken, zonder te controleren of de leerling het werk daadwerkelijk heeft gedaan of dat het een gelukkige gok was.
Dit artikel introduceert een nieuwe, slimmere manier om computergebruikende robots te beoordelen. De auteurs, Chaoqun Cui en collega's, stellen een systeem voor genaamd VAGEN. In plaats van alleen een video te bekijken of een checklist te controleren, gebruikt VAGEN een "Verifier Agent"—een tweede AI-detective die actief kan onderzoeken. Denk aan een detective die niet alleen het alibi van de verdachte (de video van de robot) leest, maar ook de macht heeft om de plaats delict te betreden, de verborgen bestanden te controleren en tests uit te voeren om te zien of het verhaal klopt. De auteurs ontdekten dat deze actieve, onderzoekende aanpak veel beter is in het opsporen van de waarheid, vooral wanneer de acties van de robot aanwijzingen achterlaten die niet zichtbaar zijn op het scherm. Ze toonden aan dat deze methode niet alleen nauwkeuriger is, maar ook efficiënter, wat bewijst dat je soms je handen vuil moet maken om te weten of een klus echt is geklaard.
De Detective in de Digitale Wereld
Dus, hoe werkt deze nieuwe detective, VAGEN, eigenlijk? De auteurs realiseerden zich dat het controleren of een robot een taak heeft voltooid vaak makkelijker is dan het uitvoeren van de taak zelf. Het is het verschil tussen het bakken van een cake en controleren of de cake klaar is. De bakker (de "Actor" robot) moet ingrediënten mengen, de oven in de gaten houden en de cake decoreren. De rechter (de "Verifier") hoeft alleen maar met een prikker in de cake te steken of de keuken te ruiken om te weten of hij klaar is. De auteurs noemen dit de "easy to verify, hard to solve" eigenschap.
Om dit mogelijk te maken, gebruikt VAGEN een Progressive Verification Mechanism. Stel je voor dat de verifier een detective is die een mysterie oplost, en zij hebben een specifieke strategie om geen tijd te verspillen. Ze springen niet direct over tot het afbreken van deuren; ze beginnen met de makkelijkste aanwijzingen en worden pas agressiever indien nodig.
Fase 1: Een Snelle Blik (Statische Beoordeling)
Eerst kijkt de verifier naar het laatste plaatje van het computerscherm en een samenvatting van wat de robot heeft gedaan. Het vraat: "Ziet dit eruit als een overwinning?" Als het scherm duidelijk een "Bestelling bevestigd"-bericht toont, zegt de detective: "Zaak gesloten!" en gaat verder. Dit is snel en goedkoop.
Fase 2: De Tape Terugspoelen (Visuele Retrospectie)
Als het laatste plaatje verwarrend is—misschien is het scherm leeg, of is het bericht verborgen—geeft de detective niet op. In plaats daarvan spoelt hij de video terug. Hij kijkt naar screenshots van eerdere stappen om aanwijzingen te vinden. Misschien heeft de robot vijf minuten geleden op de juiste knop geklikt, zelfs als het laatste scherm rommelig is. Dit is als het controleren van camerabeelden om te zien of de verdachte daadwerkelijk het gebouw is binnengegaan.
Fase 3: Inbreken (Proactieve Probing)
Soms zijn de aanwijzingen helemaal niet op het scherm te vinden. Misschien moest de robot een bestand opslaan op een harde schijf, maar toont het scherm alleen een algemeen "Gereed"-bericht. Het scherm liegt, of het verbergt op zijn minst de waarheid. Dit is waar VAGEN echt cool wordt. De verifier-agent heeft speciale tools om actief te interageren met de computer. Het kan code uitvoeren, het bestandssysteem controleren, of zelfs zelf op knoppen klikken om te testen of het bestand er echt is. Het is alsoast de detective die eindelijk een huiszoekingsbevel krijgt om het huis van de verdachte te doorzoeken. Ze vertrouwen niet alleen op het verhaal; ze gaan de kelder controleren.
Het artikel laat zien dat deze "surface-to-latent" benadering (van de oppervlakte van het scherm naar de verborgen diepten van het systeem gaan) een game-changer is. De auteurs testten VAGEN op twee grote sets taken: OSWorld-Verified (desktopcomputers) en AndroidWorld (mobiele telefoons).
De Resultaten: Slimmer en Sneller
Toen de auteurs de cijfers doornamen, deed VAGEN het niet alleen goed; het verpletterde de concurrentie. Op de desktop benchmark, terwijl andere methoden moeite hadden om boven de 80% nauwkeurigheid uit te komen, bereikte VAGEN een nauwkeurigheid van 92,9% wanneer beoordeeld door menselijke experts. Nog indrukwekkender is dat het dit deed zonder de noodzaak om elke enkele screenshot te controleren of eindeloze tests uit te voeren. Het was slim genoeg om vroegtijdig te stoppen wanneer het het antwoord vond.
Het artikel benadrukt ook een cruciale bevinding: Actieve interactie is noodzakelijk, maar niet altijd de eerste stap. Eerdere methoden die zwaar vertrouwden op "probing" (het systeem controleren) waren vaak traag en inefficiënt omdat ze de video-informatie eerst niet bekeken. Ze waren als detectives die onmiddellijk de deur intrappen zonder zelfs eerst naar de voordeur te kijken. VAGEN gebruikt echter de video-informatie om de eigenlijke onderzoek te leiden. Het breekt pas in het systeem als de video niet genoeg is. Deze balans maakte het veel efficiënter, waarbij minder computerbronnen (zoals "stappen" of "tokens") werden gebruikt om een beter antwoord te krijgen.
De auteurs testten ook of ze de verifier nog beter konden maken door de verifier dezelfde taak meerdere keren te laten controleren (een strategie genaamd "scaling"). Ze vonden dat zelfs wanneer ze de verifier beperkten tot alleen het "lezen" van gegevens en niet het veranderen van iets, het nog slimmer werd. Dit suggereert dat de belangrijkste taak van de verifier het onderzoeken is, niet het verstoren van de computer.
Waarom Dit Belangrijk Is
De grote les hier is dat we niet hoeven te kiezen tussen een luie observator en een bemoeizuchtige detective. We kunnen beide hebben. Door de passieve observatie van de video van de robot te combineren met de actieve kracht om de verborgen staten van de computer te controleren, creëert VAGEN een beloningssysteem dat zowel betrouwbaar als efficiënt is.
De auteurs stellen dat dit de toekomst is van het trainen van AI-agents. Als we robots willen die ons echt kunnen helpen met onze computers en telefoons, hebben we een manier nodig om hen te beoordelen die niet wordt gefopt door een mooi plaatje. VAGEN suggereert dat door onze AI-beoordelaars de instrumenten te geven om dieper te graven, we onze robots veel competenter kunnen maken. Het artikel beweert niet dat het alle problemen in de wereld heeft opgelost, maar het toont wel een duidelijke weg vooruit: stop met alleen naar de show kijken, en begin de backstage te controleren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.