Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
Dit artikel behandelt de slechte betrouwbaarheid van computergebruiksagenten bij complexe, zeldzame interacties door de CUActSpot-benchmark en een op een renderer gebaseerde pijplijn voor datasynthese te introduceren, waardoor samen een model met 4 miljard parameters diverse open-source modellen van grotere omvang overtreft op verschillende GUI-modaliteiten.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robotbutler leert om met je computer om te gaan. Je wilt dat hij op knoppen klikt, e-mails typt en bestanden ordent, precies zoals jij dat doet. Al lang trainen onderzoekers deze robots voornamelijk op eenvoudige klikopdrachten, zoals het indrukken van een "Verzenden"-knop of het aanklikken van een link. Het is alsof je de robot alleen leert hoe hij op een deurbel moet drukken.
Maar echt computergebruik is veel complexer. Soms moet je een bestand sleepen van de ene map naar de andere, een cirkel trekken rond een foto om deze uit te knippen, of een specifiek tekstgedeelte selecteren om het te verwijderen. Het artikel stelt dat huidige robotbutlers falen bij deze "long-tail"-taken omdat ze er niet genoeg geoefend hebben. Ze zijn als een student die alleen heeft gestudeerd voor een meerkeuzetoets, maar plotseling wordt gevraagd om een essay te schrijven.
Hieronder volgt een uiteenzetting van wat de auteurs deden om dit op te lossen, met behulp van eenvoudige analogieën:
1. Het Probleem: De "Alleen-Klik"-Valstrik
De auteurs onderzochten waarom geavanceerde AI-modellen (zoals GPT-5.4) falen bij het proberen computers te gebruiken. Ze ontdekten dat hoewel de robots goed zijn in eenvoudige klikken, ze in de war raken wanneer ze complexe dingen moeten doen, zoals een cel in een spreadsheet slepen of een vorm tekenen.
- De Analogie: Stel je een rijexamen voor waarbij je alleen maar hebt geoefend met het draaien van de sleutel in het contact. Als je plotseling moet inparkeren of moet invoegen op een snelweg, zal je een ongeluk krijgen. De huidige AI-modellen zijn uitstekend in het draaien van de sleutel (klikken), maar vreselijk in het inparkeren (slepen en tekenen).
2. De Oplossing Deel 1: Een Nieuw "Rijexamen" (CUActSpot)
Om dit op te lossen, bouwde het team een nieuwe benchmark genaamd CUActSpot. Denk hierbij aan een nieuw, moeilijker rijexamen voor robots.
- Wat is er anders? In plaats van de robot alleen te vragen "druk op de rode knop", vraagt deze test hem om:
- Een bestand naar een prullenbak te slepen.
- Een lijn te tekenen om twee vormen met elkaar te verbinden.
- Een specifiek woord in een document te selecteren.
- Iemand uit een foto te knippen.
- De Vijf Werelden: De test bestrijkt vijf verschillende "werelden" op je scherm: standaardapps (GUI), tekstdocumenten, spreadsheets (Tabellen), tekenkanvassen en natuurlijke foto's.
- De Regels: Ze creëerden strenge regels om de robots te beoordelen. Als de robot probeert een bestand te slepen maar per ongeluk klikt op een "Verboden" gebied (zoals een pop-upadvertentie), faalt hij direct. Dit zorgt ervoor dat de robot precies is, niet alleen geluk heeft.
3. De Oplossing Deel 2: De "Magische Fabriek" (Datasyntese)
Het grootste probleem was dat er niet genoeg voorbeelden waren van deze complexe acties om de robots te leren. Je kunt niet gewoon wachten tot mensen miljoenen uren aan het slepen en tekenen opnemen; dat duurt te lang.
- De Analogie: In plaats van te wachten tot echte bestuurders oefenen, bouwde het team een videosimulatie.
- Hoe het werkt: Ze schreven code om automatisch miljoenen nep-computerschermen te genereren.
- Ze maakten nep-spreadsheets met willekeurige getallen.
- Ze tekenden nep-vormen op een canvas.
- Ze namen echte foto's en markeerden specifieke delen ervan.
- De "Leraar" (LLM): Ze gebruikten een slimme AI (een LLM) om naar deze nep-schermen te kijken en instructies te schrijven zoals: "Sleep de groene pijl naar de bovenkant van de gele cirkel." De AI berekende ook de exacte coördinaten waarnaar de robot moest bewegen.
- Het Resultaat: Ze genereerden 50 miljoen oefenvoorbeelden. Dit is alsof je de robot een miljoen uur rijoefening geeft in een simulator voordat hij ooit een echte auto aanraakt.
4. De Ontdekking: Variatie is Beter dan Volume
Het team voerde experimenten uit om te zien wat een robot slimmer maakt. Ze ontdekten iets verrassends:
- De Oude Manier: Gewoon de robot meer van hetzelfde geven (bijvoorbeeld 10 miljoen voorbeelden van op knoppen klikken) hielp niet veel.
- De Nieuwe Manier (Variatie-Schaling): De robot verschillende soorten taken geven (klikken, slepen, tekenen, tabellen, tekst) maakte hem veel slimmer.
- De Analogie: Het is als een kok. Als je alleen oefent met het snijden van uien, word je goed in uien. Maar als je oefent met het snijden van uien, het snijden van tomaten, het grillen van biefstuk en het bakken van brood, word je een meesterkok die elk recept aankan. De robot leerde dat de vaardigheid om de muis te bewegen belangrijker is dan het specifieke object dat hij beweegt.
5. Het Resultaat: De Nieuwe Robot (Phi-Ground-Any-4B)
Met behulp van deze nieuwe "rijtest" en de "magische fabriek" van data trainden ze een nieuw model genaamd Phi-Ground-Any-4B.
- De Prestatie: Dit model is relatief klein (slechts 4 miljard parameters), maar presteert beter dan veel grotere, open-source modellen (sommigen met meer dan 32 miljard parameters) bij deze complexe taken.
- De Haken: Het model is nog steeds een beetje zwak bij de oude stijl van tests (die zich alleen richten op het klikken op standaardknoppen), maar het is een kampioen bij de nieuwe, complexe taken die echt belangrijk zijn voor computergebruik in de echte wereld.
Samenvatting
Het artikel zegt: "Stop met robots alleen te leren hoe ze moeten klikken. Echt computergebruik omvat slepen, tekenen en bewerken. We hebben een nieuwe test gebouwd om deze vaardigheden te meten, een fabriek gecreëerd om miljoenen oefenvoorbeelden te genereren, en bewezen dat het leren van robots een breed scala aan acties hen veel beter maakt in het gebruik van computers dan hen alleen te leren klikken."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.