← Nieuwste papers
💬 NLP

Scaling Agents for Computer Use

Het artikel introduceert Behavior Judge (BJudge), een framework dat de betrouwbaarheid van computergebruikende agenten verbetert door te evalueren en te selecteren tussen meerdere executie-rollouts met behulp van gedragsnarratieven, waarmee het een staat van de kunst prestatie op OSWorld bereikt die menselijke capaciteiten overtreft.

Oorspronkelijke auteurs: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om jouw was te doen, het avondeten te koken en jouw rekeningen te betalen door naar een computerscherm te kijken. Dit is wat "Computer-Use Agents" (CUAs) zouden moeten doen. Het zijn AI-programma's die knoppen kunnen aanklikken, tekst kunnen typen en software kunnen navigeren net zoals een mens dat doet.

Er is echter een groot probleem: deze robots zijn fragiel. Als ze één kleine fout maken in het begin — zoals op het verkeerde venster klikken of een pop-up missen — dan sneeuwt die fout een sneeuwbal in. Tegen de tijd dat ze bij stap 50 zijn, zijn ze de weg volledig kwijt. Het is alsof je een kaartenhuis probeert te bouwen in een winderige kamer; één klein wiebelmoment en het hele ding stort in.

De Oude Manier: "Eén en Klaar"

Voorheen probeerden onderzoekers dit op te lossen door de robot te vertellen om "dieper na te denken" voordat hij een enkele beweging maakt. Ze vroegen de AI om vijf verschillende ideeën te generen voor de volgende klik en kozen de beste uit. Maar dit is alsof je één persoon vraagt om vijf verschillende routes naar de supermarkt te bedenken, de beste te kiezen, en dan ook daadwerkelijk te gaan lopen. Als die ene persoon bij de eerste kruising in de war raakt, mislukt de hele reis.

Het Nieuwe Idee: "De Race" (Wide Scaling)

De auteurs van dit paper stellen een andere strategie voor genaamd Wide Scaling. In plaats van te vertrouwen op één robot die het goed moet doen, sturen ze tegelijkertijd tien verschillende robots uit om dezelfde taak uit te voeren.

Denk aan een race met tien hardlopers. Zelfs als Loper #3 struikelt en Loper #7 verdwaalt, vindt Loper #5 misschien een kortere route en wint de race. Het doel is om tien verschillende pogingen parallel te laten lopen en vervolgens de winnaar te kiezen.

De Bottleneck: Hoe Kies Je de Winnaar?

Hier komt het lastige deel: hoe weet je welke van de tien robots daadwerkelijk geslaagd is?

  • Het Probleem: Het bekijken van tien uur durende video's van een robot die een taak uitvoert, is overweldigend. Het grootste deel van de video is saai of irrelevant (zoals de robot die naar een leeg scherm staart). Bovendien hebben veel taken meer dan één "juiste" manier om te voltooien. Een simpel script kan niet gemakkelijk bepalen of een robot geslaagd is of gefaald is door alleen naar de ruwe schermopnames te kijken.
  • De Analogie: Stel je voor dat je een kookwedstrijstrijd beoordeelt door tien video's van drie uur te bekijken waarin chefs aan het koken zijn. Je zou moe worden en de belangrijke momenten missen. Je hebt een manier nodig om de actie samen te vatten.

De Oplossing: "Behavior Judge" (BJudge)

De auteurs introduceren een nieuw systeem genaamd Behavior Judge (BJudge). Zo werkt het, stap voor stap:

  1. De Race: Ze laten de taak tien keer gelijktijdig uitvoeren met verschillende AI-modellen.
  2. De Vertaler (Behavior Narrative Generator): In plaats van de rechter de ruwe video van het scherm te tonen, fungeert dit systeem als een vertaler. Het kijkt naar elke poging van de robot en schrijft een kort, helder verhaal (een "narratief") van wat er is gebeurd.
    • In plaats van: "De robot bewoog de muis naar pixel 400, 200, klikte, het scherm ververste, een nieuw venster opende..."
    • Schrijft het: "De robot klikte op 'Opslaan' en het document werd succesvol opgeslagen in de map."
    • Het filtert de ruis eruit en focust alleen op de oorzaak en gevolg: "Ik deed X, en Y gebeurde."
  3. De Rechter (Comparative Evaluator): Nu, in plaats van tien uur aan video te bekijken, leest de rechter tien korte verhalen. Hij vergelijkt ze zij aan zij. "Verhaal A zegt dat het bestand is opgeslagen. Verhaal B zegt dat het bestand is verwijderd. Verhaal A wint."

De Resultaten

Toen ze dit testten op een benchmark genaamd OSWorld (een verzameling real-world computer-taken):

  • De Oude Beste: De vorige beste methode voltooide ongeveer 63,4% van de taken correct.
  • Menselijk Niveau: Mensen voltooien ongeveer 72,36% correct.
  • De Nieuwe Methode (BJudge): Hun systeem bereikte 72,6%.

Ze hebben niet alleen de vorige robots verslagen; ze hebben zelfs mensen verslagen.

Waarom Dit Belangrijk Is

Het paper laat zien dat de sleutel tot het betrouwbaar maken van AI-agenten niet alleen ligt in het individueel slimmer maken van de AI; het gaat erom dat je er veel tegelijkert uitslaat en een slim systeem hebt om het beste resultaat te kiezen.

Ze hebben dit ook getest op verschillende besturingssystemen (Windows en Android) en ontdekten dat het daar ook goed werkte, wat bewijst dat deze "race en judge"-strategie een universele manier is om computergebruikende AI robuuster te maken.

Kortom: Om de "fragiele" natuur van AI-computers te repareren, moet je niet alleen één perfecte robot maken. Maak er tien, laat ze racen, vertaal hun rommelige pogingen naar eenvoudige verhalen, en laat een slimme rechter de winnaar kiezen. Deze eenvoudige verandering maakte het mogelijk om menselijke prestaties op complexe digitale taken te overtreffen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →