← Nieuwste papers
🤖 machine learning

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Dit artikel introduceert Workspace-Bench, een grootschalige benchmark met realistische bestandsafhankelijkheden en diverse taken om de werkruimteleercapaciteiten van AI-agenten te evalueren, en onthult dat huidige modellen significant achterblijven bij menselijke prestaties in het hanteren van complexe redenering en besluitvorming over meerdere bestanden heen.

Oorspronkelijke auteurs: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen
Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotassistent inhuurt om je bij je werk te helpen. Je geeft hem een map vol bestanden: spreadsheets, e-mails, PDF's, code en oude concepten. Je doel is dat de robot de juiste stukjes informatie vindt, uitzoekt hoe ze met elkaar verbonden zijn, en een rapport schrijft.

Workspace-Bench is een enorme, realistische test die is ontworpen om te zien of hedendaagse AI-robots deze taak daadwerkelijk kunnen uitvoeren zonder verdwaald te raken, in de war te raken of feiten te verzinnen.

Hieronder volgt een uiteenzetting van de bevindingen uit het paper, gebruikmakend van eenvoudige analogieën:

1. Het Probleem: De "Schone Kamer" versus de "Opruimloze Werkplek"

De meeste eerdere tests voor AI waren als het geven van een enkel, perfect schoolboek aan een student en het stellen van een vraag. De AI hoefde alleen de pagina te lezen en het antwoord te geven.

  • De Realiteit: Echt werk is als een rommelig bureau. Je hebt 20.000 bestanden verspreid over 74 verschillende formaten (Excel, code, PDF's, e-mails). Sommige bestanden zijn oude concepten, sommige zijn definitieve versies en sommige zijn gewoon notities.
  • De Test: De onderzoekers bouwden 5 verschillende "digitale kantoren" (voor een Logistiek Manager, een Onderzoeker, een Ontwikkelaar, enzovoort). Elk kantoor is een enorme, rommelige digitale ruimte met duizenden bestanden. Vervolgens gaven ze de AI 388 verschillende taken, zoals "Schrijf een strategierapport op basis van de verkoopgegevens van vorig jaar en de e-mails van deze week."

2. De Grote Onthulling: AI Raakt Nog Steeds Verdwaald

De onderzoekers testten 28 verschillende combinaties van AI-heren (modellen) en AI-"lichamen" (softwarekaders die de AI in staat stellen hulpmiddelen te gebruiken).

  • De Score: De beste AI-combinatie kreeg slechts ongeveer 69% van de details goed. De gemiddelde AI scoorde minder dan 50%.
  • De Menselijke Vergelijking: Toen echte mensen dezelfde test deden (met hulp van hulpmiddelen), scoorden ze 81%.
  • De Analogie: Stel je een race voor waarbij de menselijke lopers in 10 minuten finishen, maar de snelste robot 20 minuten nodig heeft en toch over zijn eigen voeten struikelt. Het paper stelt dat huidige AI "ver weg van betrouwbaar" is voor echt kantoorwerk.

3. Waarom Mislukken Ze? (De Drie Hoofdknelpunten)

Het paper vond drie specifieke redenen waarom de AI worstelt:

  • Het "Tijdsreizen"-Probleem (Lineage Tracing):
    Echte werkplekken hebben bestanden met namen als rapport_v1, rapport_gecontroleerd en rapport_definitief. De AI pakt vaak de verkeerde versie (zoals het gebruik van een oud concept in plaats van de definitieve versie). Het begrijpt de "stamboom" van bestanden niet.
  • Het "Vertaal"-Probleem (Heterogene Begrip):
    De AI is uitstekend in het lezen van tekst, maar worstelt met het verbinden van een grafiek in een PowerPoint-presentatie aan de ruwe cijfers in een Excel-sheet, of met het begrijpen van een codebestand naast een vergadertranscript. Het behandelt verschillende bestandstypen als aparte talen die het niet met elkaar kan vertalen.
  • Het "Draad in de Hooiberg"-Probleem:
    Wanneer de taak moeilijk wordt (waarbij de AI verbanden moet vinden tussen 6 of meer verschillende bestanden), daalt de prestatie van de AI scherp. Het raakt overweldigd door de pure hoeveelheid data en mist de cruciale koppelingen.

4. De "Kosten" van Proberen

Het paper merkte iets interessants op over hoe de AI probeert problemen op te lossen:

  • Het "Spinning Wheels"-Effect: Sommige AI-configuraties probeerden het echt hard, praatten met zichzelf voor 60+ stappen en gebruikten een enorme hoeveelheid computerkracht (tokens). Maar ondanks al die inspanning kregen ze het antwoord toch verkeerd.
  • Het "Slim & Snel"-Effect: De best presterende AI (OpenClaw + Opus-4.7) loste problemen snel op, met minder stappen en minder computerkracht, en kreeg het juiste antwoord. Dit suggereert dat de kwaliteit van het redeneren belangrijker is dan gewoon harder proberen.

5. De Toekomst: Vijf Stadia van Groei

De auteurs stellen zich voor dat AI leert werken in kantoren in vijf stadia, zoals het beklimmen van een ladder:

  1. L0 (De Passieve Adviseur): De AI geeft alleen advies; de mens doet het werk.
  2. L1 (De Passieve Uitvoerder): De mens zegt: "Open bestand A en kopieer naar bestand B." De AI doet het, maar begrijpt niet waarom.
  3. L2 (De Afhankelijkheids-Redenaar): De AI begint te begrijpen dat Bestand A afhankelijk is van Bestand B. (Huidige AI worstelt om hier voorbij te komen).
  4. L3 (De Proactieve Ontdekker): De AI kan rondkijken in het hele kantoor, de bestanden die het nodig heeft zelf vinden en het probleem oplossen. (Dit is de "Capaciteitssingulariteit" die het paper zegt dat we nog niet hebben bereikt).
  5. L4 (De Zelf-ontwikkelende Partner): De AI leert van elke taak, onthoudt je gewoontes en wordt na verloop van tijd beter in jouw specifieke baan.

Samenvatting

Workspace-Bench is een realiteitscheck. Het toont aan dat terwijl AI steeds beter wordt in praten en schrijven, het nog steeds zeer slecht is in navigeren door de rommelige, onderling verbonden en versiebeheerde wereld van een echt menselijk kantoor. Totdat AI betrouwbaar bestandsgeschiedenissen kan traceren en verschillende soorten documenten met elkaar kan verbinden, zal het een menselijke "piloot" nodig hebben om het op koers te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →