← Nieuwste papers
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

Dit artikel introduceert OSWorld-Human, een handmatig geannoteerde benchmark die aantoont dat huidige computergebruiksagenten kampen met prohibitieve latentie en inefficiëntie, voornamelijk door overmatige modeloproepen voor planning en reflectie, wat resulteert in het feit dat ze 2,7 tot 4,3 keer meer stappen nodig hebben dan mensen om taken te voltooien.

Oorspronkelijke auteurs: Reyna Abhyankar, Qi Qi, Yiying Zhang

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Reyna Abhyankar, Qi Qi, Yiying Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar ongelooflijk trage persoonlijke assistent inhuurt om een eenvoudige taak op je computer te verrichten, zoals het wijzigen van het lettertype in een document. Je verwacht dat dit 30 seconden duurt. In plaats daarvan doet je assistent er 12 minuten over. Waarom?

Dit paper, OSWorld-Human, onderzoekt precies dat probleem. Het kijkt naar "Computer-Use Agents" (AI-programma's die je muis en toetsenbord bedienen) en vraagt zich af: "Waarom zijn ze zo traag, en hoe kunnen we ze sneller maken?"

Hieronder volgt een uiteenzetting van hun bevindingen, met behulp van eenvoudige analogieën.

1. Het Probleem: De "Te Denker" Assistent

De onderzoekers ontdekten dat deze AI-agenten wel steeds beter worden in het klaar krijgen van de klus (nauwkeurigheid), maar verschrikkelijk zijn in hoe snel ze dat doen (efficiëntie).

  • De Mens versus de Robot: Een menselijke expert kan regelafstand in een document in minder dan 30 seconden aanpassen. De AI-agent doet er 12 minuten over.
  • De Bottleneck: De vertraging komt niet doordat de AI langzaam op de muis klikt. Het komt doordat de AI constant stopt om na te denken.
    • De Analogie: Stel je voor dat je naar de supermarkt rijdt. Een menselijke bestuurder rijdt gewoon door. Deze AI-bestuurder stopt bij elk kruispunt om een superintelligent consultant aan de telefoon te bellen met de vraag: "Is dit de juiste afslag? Moet ik linksaf slaan? Heb ik linksaf goed geslagen? Wat met de volgende afslag?"
    • De Realiteit: De AI belt een enorme "hersenen" (een Large Language Model) om de volgende zet te plannen, te oordelen of de zet werkte, en te reflecteren op wat er gebeurde. Deze telefoontjes kosten de meeste tijd. Sterker nog, alleen de stappen "plannen" en "oordelen" nemen ongeveer 75% tot 96% van de totale tijd in beslag!

2. Het Onderzoek: De Stappen Uit elkaar Haan

De onderzoekers observeerden twee populaire AI-agenten (Agent S2 en GTA1) terwijl ze probeerden 39 verschillende computertaken op te lossen. Ze hielden elke seconde van het proces bij.

  • De "Denk"-Belasting: Elke keer dat de AI een stap zet, moet het een groot bericht naar zijn hersenen sturen. Naarmate de taak langer wordt, wordt het bericht groter, omdat het de geschiedenis van alles wat het eerder deed moet bevatten.
    • Analogie: Het is alsof je een dagboek schrijft. Op dag 1 schrijf je één zin. Op dag 50 moet je het hele boek vanaf dag 1 herschrijven om slechts één nieuwe zin toe te voegen. Hierdoor duren de latere stappen 3 keer langer dan de vroege stappen.
  • De "Valse Afslag"-Lus: Soms weet de AI wel wat ze moet doen (bijvoorbeeld: "Klik op de Open-knop"), maar kan ze niet vinden waar ze op het scherm moet klikken. Ze klikt op de verkeerde plek, beseft dat het fout is, en probeert het opnieuw.
    • De Kosten: Dit "vastlopen" gebeurt vaak. In één geval probeerde een AI een map te openen en bleef 27 minuten vastzitten in een lus, waardoor $8,47 aan computerkosten werd verspild, alleen omdat het de juiste plek op het scherm niet kon vinden.

3. De Oplossing: De "Menselijke Benchmark" (OSWorld-Human)

Om te bewijzen hoe inefficiënt deze robots zijn, creëerden de onderzoekers een nieuwe benchmark genaamd OSWorld-Human.

  • Wat is het? Ze gingen handmatig alle 369 taken door en schreven de kortste, meest logische route op die een mens zou nemen om ze te voltooien.
  • De "Groepering"-Truc: Ze merkten op dat mensen vaak meerdere dingen in één keer doen zonder te stoppen om na te denken.
    • Analogie: Een mens ziet een tekstvak, typt een naam en drukt in één vloeiende beweging op "Enter". De AI stopt echter na het zien van het vak, belt zijn hersenen om typen te plannen, stopt opnieuw om het indrukken van "Enter" te plannen, en belt zijn hersenen opnieuw.
    • De Bevinding: De onderzoekers ontdekten dat veel acties "gegroeperd" konden worden. Als de AI drie klikken in één "gedachte" zou kunnen doen, zou het enorme hoeveelheden tijd besparen.

4. Het Oordeel: De Robots Verspillen Stappen

De onderzoekers testten 16 verschillende AI-agenten tegen hun nieuwe "Menselijke Benchmark".

  • Het Resultaat: Zelfs de beste AI-agenten deden 2,7 tot 4,3 keer meer stappen dan een mens nodig had om dezelfde taak te voltooien.
  • De Score: Ze creëerden een nieuwe score genaamd de Weighted Efficiency Score (WES).
    • Als een AI de klus klust maar er 4 keer langer over doet dan nodig, daalt zijn score drastisch.
    • De top-AI op de ranglijst, die er geweldig uitzag op oude tests, scoorde slechts 15,6% op deze nieuwe efficiëntietest. Dit betekent dat het veel onnodig werk verricht.

Samenvatting

Het paper concludeert dat huidige AI-computeragenten lijken op briljante maar onhandige studenten. Ze weten het antwoord, maar ze besteden zoveel tijd aan het opsteken van hun hand, wachten op de leraar en het herlezen van hun aantekeningen dat ze de toets nooit op tijd afmaken.

Om dit op te lossen, stelt het paper drie hoofdzaken voor:

  1. Stop met te veel nadenken: Verminder het aantal keren dat de AI zijn "hersenen" belt om te plannen en te oordelen.
  2. Groeper acties: Laat de AI meerdere stappen (zoals typen en op Enter drukken) in één gedachte uitvoeren.
  3. Word beter in het vinden van dingen: Verbeter het vermogen van de AI om precies te zien waar ze moet klikken, zodat het niet vastloopt in lussen.

Het doel is niet alleen om AI slimmer te maken, maar om het sneller en praktischer te maken voor gebruik in de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →