← Nieuwste papers
💻 computer science

How Benchmarks Mis-Score Computer-Use Agents

Dit artikel bekritiseert de betrouwbaarheid van huidige benchmarks voor computergebruik-agenten door systematische gebreken in taakconstructie, observatie en score te identificeren die leiden tot foutieve mislukkingsoordelen, en stelt een diagnostisch kader en ontwerpregels voor om de evaluatienauwkeurigheid te verbeteren.

Oorspronkelijke auteurs: Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

Gepubliceerd 2026-07-31
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een kookwedstrijd met hoge inzet kijkt op tv. De jury hoort de gerechten te proeven en te beslissen wie er wint. Maar wat als de jury een kapotte smaaktest gebruikt? Wat als het recept dat ze volgen geschreven is in verdwijnende inkt, of de oven die ze gebruiken eigenlijk een speelgoedoven is die niet warm wordt? In de wereld van kunstmatige intelligentie, specifiek bij "Computer-Use Agents" (slimme bots die kunnen klikken, typen en browsen op het web net als mensen), hebben we een vergelijkbaar probleem. Deze bots worden getest om te zien of ze echte taken kunnen uitvoeren, zoals belastingaangifte doen of vluchten boeken. Echter, de "scorekaarten" die we gebruiken om ze te beoordelen zijn vaak gebrekkig. Ze geven misschien een onvoldoende cijfer aan een bot die eigenlijk een geweldig werk heeft geleverd, of ze missen het feit dat de bot gefaald heeft omdat de test zelf kapot was. Dit artikel is als een detectiveverhaal waarin de auteurs onderzoeken waarom deze scorekaarten tegen ons liegen.

Het artikel, getiteld "How Benchmarks Mis-Score Computer-Use Agents", betoogt dat de manier waarop we deze AI-bots momenteel testen diepgaand gebrekkig is. De auteurs ontdekten dat wanneer een bot een "FAIL"-score krijgt, er een verrassend grote kans is dat de score eigenlijk fout is. In hun onderzoek naar 150 specifieke voorbeelden waarbij bots als falend werden gemarkeerd, ontdekten zij dat 15,3% van die "FAIL"-oordelen fouten waren.

Zo kwamen de fouten tot stand:

  • De Jury was Te Picky (10,7%): Soms deed de bot het juiste, maar was de geautomatiseerde controleur te rigide. Het was alsof een jury een chef afkeurde omdat hij een iets ander mes gebruikte dan op de receptenkaart stond, terwijl het eten perfect smaakte.
  • De Test was Kapot (4,7%): Soms kon de bot de taak niet voltooien omdat de testomgeving kapot was. Het was alsof je een chef vraagt een taart te bakken in een oven waar de stroom niet op staat. De bot faalde, maar niet omdat hij slecht kon koken; de keuken was kapot.

De auteurs keken ook naar de bots die daadwerkelijk gefaald hadden. Ze ontdekten dat de belangrijkste redenen meestal niet waren dat de bot op de verkeerde knop klikte (wat lijkt op een onhandige hand). In plaats daarvan faalden de bots vooral omdat ze vast kwamen te zitten in een lus van slechte planning of omdat ze niet doorhadden dat hun acties niet werkten (zoals een chef die blijft roeren in een pan die al leeg is).

Het artikel suggereert dat we niet simpelweg naar één enkel getal kunnen kijken, zoals een "slaagpercentage", om te weten of een AI goed is. Dat getal verbergt te veel geheimen. In plaats daarvan moeten we betere tests bouwen die moeilijker te breken zijn, die slimmere jury's gebruiken die verschillende manieren begrijpen om een probleem op te lossen, en volledige video-opnames van de tests leveren zodat we precies kunnen zien waar het misging. Het doel is om te stoppen met het geven van een onvoldoende aan bots voor zaken die niet hun schuld zijn, en om ons te helpen begrijpen wat ze daadwerkelijk moeten leren om echt nuttige helpers te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →