← Nieuwste papers
🤖 AI

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

Dit artikel introduceert OmegaUse-OfficeVal, een nieuwe benchmark bestaande uit 100 langlopende kantoorpakket-taken met een economische grondslag (menselijke arbeidstijd en taakprijs) om LLM-agenten te evalueren, waarbij wordt onthuld dat hoewel huidige modellen aanzienlijk goedkoper en sneller zijn dan mensen, ze nog steeds tekortschieten in het bereiken van menselijk niveau van kwaliteit bij taakvoltooiing.

Oorspronkelijke auteurs: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

Gepubliceerd 2026-07-30
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je computer niet alleen wacht tot je op knoppen klikt, maar ook daadwerkelijk het werk voor je doet. Dit is de droom van "AI-agenten"—slimme programma's die je instructies kunnen lezen, je bestanden kunnen openen en een klus kunnen klaren, net als een digitale stagiair. Een tijdje waren deze agenten geweldig in korte, eenvoudige trucjes, zoals het schrijven van een enkele e-mail of het samenvatten van een kort artikel. Maar de echte test van hun kracht is of ze een hele dag aan kantoorwerk kunnen afhandelen: een slordig rapport nemen, het herformatteren, grafieken toevoegen en het perfect opslaan, zonder in de war te raken of het bestand te beschadigen. De grote vraag die onderzoekers stellen is: kunnen deze digitale werkers het werk daadwerkelijk aan, en is het het geld waard in vergelijking met het inhuren van een echt mens?

Maak kennis met OmegaUse-OfficeVal, een nieuwe "rapportcijferlijst" ontworpen door onderzoekers van Baidu om precies dit te testen. Ze hebben niet zomaar nep, makkelijke taken bedacht; ze bouwden een benchmark met 100 echte kantooruitdagingen, zoals het repareren van een kapotte spreadsheet of het omzetten van een ruwe opzet naar een gepolijste presentatie. Wat deze test bijzonder maakt, is dat ze aan elke taak een "prijskaartje" hebben gehangen. Ze maten exact hoe lang een mens erover deed en schatten in hoeveel het zou kosten om iemand te betalen om het te doen. Vervolgens lieten ze verschillende van de slimste AI-modellen ter wereld dezelfde puzzels oplossen. De resultaten? De AI-agenten zijn ongelooflijk snel en goedkoop—ze voltooien taken vaak in minuten voor slechts centen—maar ze maken nog steeds te veel fouten om blindelings vertrouwd te worden met het eindproduct. Hoewel ze beter worden, hebben ze het niveau van een betrouwbare menselijke junior medewerker nog niet bereikt.

De Opstelling: Een Digitaal Hindernisparcours

Om te begrijpen wat de onderzoekers hebben gedaan, kun je het kantoor zien als een enorme, rommelige werkplaats. In het verleden was het testen van AI alsof je het vroeg om een paar blokken op te stapelen. Als het er één liet vallen, was het mislukt. Maar echt kantoorwerk is meer als het vanaf nul maken van een complexe taart: je moet ingrediënten verzamelen (bestanden), een recept volgen (instructies), en als je de frosting verbrandt, is de hele taart verpest.

De onderzoekers creëerden een dataset genaamd OmegaUse-OfficeVal met 100 van deze "taartbak"-taken. Dit waren geen simpele "schrijf een gedicht"-verzoeken. Het waren lange, meerstaps-taken waarbij Word-documenten, PowerPoint-dia's en Excel-spreadsheets betrokken waren. Sommige taken duurden gemiddeld 2,32 uur voor een mens om te voltooien. Dat is een lange tijd voor een computer om de concentratie vast te houden!

Wat deze benchmark uniek maakt, is de "economische gronding". De onderzoekers vroegen niet alleen: "Heeft de AI de taak voltooid?" Ze vroegen: "Welke waarde heeft het gecreëerd?" Om dit te doen, volgden ze twee zaken voor elke taak:

  1. Menselijke Arbeidstijd: Hoe lang een echt persoon erover deed.
  2. Taakprijs-proxy: Een ruwe schatting van wat die taak zou kosten als je een freelancer zou inhuren (variërend van ongeveer $3,65 tot $29,22 per taak).

Dit stelde hen in staat om de AI niet alleen te vergelijken op snelheid, maar ook op de vraag of het daadwerkelijk geld bespaarde of dat het gewoon goedkope fouten maakte.

De Test: AI versus de Menselijke Stagiair

De onderzoekers zetten verschillende top-AI-modellen af tegen een "menselijke baseline". Deze baseline was geen CEO of een genie; het was een bekwame junior medewerker of stagiair. De mensen kregen dezelfde instructies en bestanden als de AI en kregen de opdracht het werk te doen.

Om de resultaten te beoordelen, lieten de onderzoekers niet simpelweg een mens naar het definitieve bestand kijken en zeggen: "Ziet er goed uit!" Dat is te traag en te subjectief. In plaats daarvan schreven ze code-gebaseerde verifiers. Stel je een robotinspecteur voor die automatisch het definitieve bestand controleert. Het opent het document, controleert of de voorpagina aanwezig is, telt of de grafieken de juiste grootte hebben en controleert of er niet per ongeluk tekst is verwijderd. Als het bestand kapot is of een essentieel onderdeel mist, geeft de robot een nul. Dit maakte het testen eerlijk, snel en reproduceerbaar.

De Resultaten: Snel en Goedkoop, Maar Niet Perfect

Toen de stofwolken optrokken, vertelden de resultaten een duidelijk verhaal.

De Menselijke Baseline:
De menselijke werkers scoorden gemiddeld een 27,79 op een mogelijke perfecte score. Ze waren betrouwbaar. Ze beschadigden de bestanden zelden en kregen de meeste details goed. Echter, ze kostten tijd en geld. Gemiddeld kostte een menselijke taak ongeveer $6,86 en duurde het 2,32 uur.

De AI-agenten:
De AI-modellen waren een ander verhaal. Ze waren razendsnel en ongelooflijk goedkoop.

  • Snelheid: De snelste AI (DeepSeek-V4-Pro) voltooide een taak in slechts 0,184 uur (ongeveer 11 minuten).
  • Kosten: De goedkoopste AI (Qwen3.7-Plus) kostte slechts $0,2152 per taak. Dat is minder dan een kopje koffie!

Maar hier komt de crux: Ze waren niet erg goed in het werk.
Het beste AI-model (GLM-5.2) scoorde slechts 17,91. Dat is aanzienlijk lager dan de menselijke score van 27,79. Hoewel de AI sneller en goedkoper was, maakte het meer fouten. Het vergat vaak een inhoudsopgave toe te voegen, maakte de opmaak fout of creëerde een bestand dat niet geopend kon worden.

De onderzoekers ontdekten dat de AI het meest moeite had met de moeilijkste, langere taken. Wanneer een taak vereiste dat een mens er lang aan moest werken (langer dan 2 uur), daalde de prestatie van de AI nog verder. Het lijkt erop dat hoewel AI geweldig is in snelle, eenvoudige klussen, het de weg kwijtraakt wanneer de "long-horizon" planning ingewikkelder wordt.

Het Oordeel: Nog Niet Klaar voor de Praktijk (Nog Niet)

De studie suggereert dat we ons in een "dal" bevinden van AI-kantoorwerk. De technologie is onmiskenbaar nuttig omdat het zo goedkoop en snel is. Als je een ruwe opzet of een snelle samenvatting nodig hebt, is een AI een fantastisch hulpmiddel. Maar als je een gepolijst, professioneel document nodig hebt dat klaar is om naar een klant te worden gestuurd, is de AI er nog niet helemaal.

De auteurs sloten expliciet de gedachte uit dat AI het kantoorwerk al heeft opgelost. Ze toonden aan dat hoewel de AI "substantieel goedkoper en sneller" is, het "nog niet het niveau van menselijke leveringskwaliteit heeft benaderd". De kloof tussen een menselijke werker en een AI-agent is nog steeds groot als het gaat om de uiteindelijke kwaliteit van het product.

De auteur zijn echter optimistisch over de toekomst. Door deze rigoureuze test met echte economische gegevens te creëren, hebben de onderzoekers een routekaart gebouwd. Ze weten precies waar de AI faalt (lange taken, complexe opmaak) en kunnen nu aan het werk om die specifieke problemen op te lossen. Voor nu lijkt de beste strategie een partnerschap te zijn: laat de AI het zware werk en de snelle concepten doen, maar houd een mens in de loop om het eindproduct te controleren en de fouten te herstellen. De droom van "vibe working"—waarbij AI simpelweg het hele werk afhandelt—is nog een werk in uitvoering, maar de reis is officieel begonnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →