← Nieuwste papers
🤖 machine learning

Grounding Computer Use Agents on Human Demonstrations

Oorspronkelijke auteurs: Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reih
Gepubliceerd 2026-06-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reihaneh Rabbany, Perouz Taslakian, Christopher Pal, Spandana Gella, Sai Rajeswar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar visueel onhandige robot probeert te leren hoe hij een computer moet gebruiken. Je kunt de robot verbale instructies geven zoals: "Klik op de groene knop om het bestand op te slaan," maar de robot heeft geen idee waar die knop zich bevindt. Hij zou de verkeerde groene zaak kunnen aanklikken, of de knop volledig kunnen missen omdat deze te klein is of op iets anders lijkt. Dit probleem wordt "grounding" genoemd — het verbinden van je woorden aan de exacte plek op het scherm die de robot moet aanraken.

Dit artikel introduceert een nieuwe oplossing om robots hier beter, sneller en met minder verspilde inspanning bij te leren.

Het Probleem: De Robot is Verdwaald in een Zee van Iconen

Desktopcomputers zijn rommelig. Ze hebben enorme, hoogresolutie schermen vol met piepkleine iconen, menu's en knoppen die bijna identiek lijken. Eerdere pogingen om robots hiermee te leren gebruikten enorme hoeveelheden data, maar veel daarvan was "ruisachtig" of gegenereerd door computers in plaats van door echte mensen. Het was alsof je iemand probeerde te leren autorijden door ze een miljoen wazige, door computers gegenereerde foto's van auto's te laten zien; ze zouden misschien de theorie leren, maar ze zouden in de echte wereld crashen.

De Oplossing: GROUNDCUA (De "Expert Tutor" Dataset)

De auteurs hebben een nieuwe, enorme dataset gemaakt genaamd GROUNDCUA. Zie dit niet als een stapel willekeurige foto's, maar als een bibliotheek van expert-demonstraties.

  • Echte Mensen, Echte Taken: Ze huurden getrainde experts in om daadwerkelijk 87 verschillende desktopapplicaties (zoals tekenprogramma's, spreadsheets en programmeersoftware) te gebruiken om echte taken uit te voeren.
  • De "Röntgenvisie": Terwijl deze experts werkten, maakte het systeem screenshots en labelde cruciaal elk zichtbaar element op het scherm. Als een expert op een klein "opslaan"-icoontje klikte, noteerde het systeem precies waar het was, hoe het eruitzag en wat de expert aan het doen was.
  • De Schaal: Ze verzamelden 56.000 screenshots met meer dan 3,5 miljoen gelabelde elementen. Dit is alsof je een robot een tekstboek geeft waarin elk object in elke afbeelding door een menselijke leraar is benoemd en uitgelegd.

Het Nieuwe Model: GROUNDNEXT (De "Sterkste Leerling")

Met behulp van deze hoogwaardige dataset bouwde het team een nieuwe familie van AI-modellen genaamd GROUNDNEXT.

  • Tweestaps-training:
    1. Supervised Fine-Tuning (SFT): Eerst leerden ze het model met 700.000 van de beste voorbeelden. Stel je een student voor die een perfect tekstboek bestudeert dat door experts is geschreven.
    2. Reinforcement Learning (RL): Vervolgens lieten ze het model oefenen. Wanneer het model het goed raadde, kreeg het een "goed gedaan"-beloning; wanneer het het fout raadde, kreeg het een "probeer het opnieuw"-signaal. Dit verfijnde de vaardigheden verder.

De Resultaten: Kleine Omvang, Groot Brein

Hier is het verrassende deel: Het team trainde hun modellen met minder dan een tiende van de data die andere topmodellen gebruikten.

  • Efficiëntie: Hun model met 3 miljard parameters (een relatief klein "brein") presteerde net zo goed als, of zelfs beter dan, veel grotere modellen die getraind zijn op miljoenen rommelige datapunten.
  • De Overwinning van de "Underdog": In tests waarbij de AI moest optreden als een computergebruiker (klikken, typen, slepen), versloeg hun kleine model enorme concurrenten, inclusief enkele van grote techbedrijven. Het is alsof een student die een paar perfecte boeken heeft bestudeerd, een student verslaat die een miljoen willekeurige tijdschriften heeft gelezen.
  • Generalisatie: Hoewel ze het model alleen op desktopcomputers hebben getraind, werd het verrassend goed in het begrijpen van mobiele telefoons en websites, wat aantoont dat het de principes van computergebruik heeft geleerd, en niet alleen specifieke schermen heeft uit het hoofd geleerd.

Waarom Dit Belangrijk Is

Het artikel betoogt dat kwaliteit wint van kwantiteit. In plaats van steeds meer data op het probleem af te gooien, hebben ze aangetoond dat als je beschikt over hoogwaardige, door mensen geverifieerde data, je veel betrouwbaardere computergebruikende agenten kunt bouwen met veel minder middelen.

Ze brengen zowel de dataset (GROUNDCUA) als de modellen (GROUNDNEXT) uit naar het publiek, in de hoop andere onderzoekers te helpen bij het bouwen van betere, betrouwbaardere robots die ons daadwerkelijk kunnen helpen bij het gebruiken van onze computers zonder verdwaald te raken tussen de iconen.

Kortom: Ze hebben een robot leren hoe hij een computer gebruikt door hem duizenden perfecte, door mensen gedemonstreerde voorbeelden te tonen, waarmee ze bewezen dat een beetje hoogwaardig onderwijs een heel eind komt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →