← Nieuwste papers
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

Dit artikel herbezoekt de WorkBench-benchmark twee jaar na de initiële evaluatie, waarbij wordt aangetoond dat frontier-agenten zoals Claude Opus 4.8 aanzienlijk hogere taakvoltooide ratio's hebben bereikt (89% vs. 43%) en schadelijke fouten drastisch hebben verminderd (2,5% vs. 26%), terwijl het tegelijkertijd laat zien dat capaciteit en veiligheid samen verbeteren, open-weight modellen de toegang tot hoogwaardige prestaties hebben gedemocratiseerd, en bepaalde basisvormen van fouten die leiden tot onomkeerbare schade blijven voortbestaan.

Oorspronkelijke auteurs: Olly Styles

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Olly Styles

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je WorkBench voor als een gigantische, gesimuleerde kantoor-speeltuin. Binnen deze speeltuin bevinden zich digitale versies van een agenda, een e-mailinbox, een klantenlijst en een projectbord. Het doel van het papier is om te testen hoe goed AI-"agenten" (slimme computerprogramma's) kunnen fungeren als menselijke werknemers: e-mails lezen, vergaderingen plannen en klantgegevens aanpassen zonder een puinhoop te maken.

De auteurs besloten deze speeltuin te controleren, twee jaar nadat ze deze voor het eerst openden. Dit is wat ze vonden, eenvoudig uitgelegd:

1. De "Voor en Na" Foto

In 2024 (Het Verleden):
De beste AI die op dat moment beschikbaar was (GPT-4) was als een zeer enthousiaste maar onhandige stagiair. Van de 690 taken voltooide het slechts 43%. Erger nog, wanneer het probeerde te helpen, veroorzaakte het ongeveer 26% van de tijd per ongeluk problemen (zoals een e-mail naar de verkeerde persoon sturen). Het deed zijn best, maar het was vaak verward of gevaarlijk.

In 2026 (Het Heden):
De auteurs hebben de test opnieuw uitgevoerd met de nieuwste AI-modellen. De winnaar (Claude Opus 4.8) is als een senior executive die al jaren op de vloer staat. Het voltooide 89% van de taken. Nog indrukwekkender: het veroorzaakte slechts in 2,5% van de gevallen onbedoelde schade. Het is niet alleen sneller; het is ook veel veiliger.

2. De Grote Verrassing: Veiligheid en Vaardigheid gaan Hand in Hand

Normaal gesproken denken we dat als we een robot sneller of slimmer maken, deze misschien roekelozer wordt. Dit papier zegt dat dit niet waar is voor deze AI-agenten.

  • De Analogie: Denk aan een raceauto. In het verleden waren de snelste auto's ook de auto's die het meest waarschijnlijk crashten. Nu zijn de snelste auto's ook de auto's met de beste remmen en veiligheidsfuncties. De modellen die de meeste taken voltooiden, waren ook de modellen die de minste fouten maakten.

3. De "Magie" van Open-Source Modellen

Het papier benadrukt een enorme verschuiving in wie de race wint.

  • De Oude Manier: Alleen dure, "proprietary" (eigendomsrechtelijke) modellen (zoals die van grote techbedrijven) konden de klus goed klaren.
  • De Nieuwe Manier: "Open-weight" modellen (die als open-source software zijn die iedereen kan downloaden en verbeteren) presteren nu net zo goed, maar voor een fractie van de prijs.
  • De Metafoor: Stel je voor dat je een luxe auto nodig had om een land te doorkruisen. Nu kun je een gloednieuwe, hoogwaardige elektrische auto krijgen van een andere fabrikant die 1/100e van de kosten heeft om te rijden, en die je naar dezelfde bestemming brengt. Het papier merkt op dat de goedkoopste in staat zijnde AI vandaag de dag afkomstig is van Chinese open-source labs, terwijl de absoluut krachtigste nog steeds een Westerse proprietary model is.

4. Wat is er veranderd in de test zelf?

De auteurs gaven toe dat ze fouten hadden gemaakt in de oorspronkelijke test uit 2024. Het was alsof je een wiskundetoets corrigeerde waarbij de antwoordenlijst een typefout bevatte.

  • De Fix: Ze hebben de regels gecorrigeerd. Bijvoorbeeld, ze hebben een bug opgelost waarbij de test vroeg om "de laatste 5 dagen", maar de antwoordenlijst werd berekend voor "de laatste 4 dagen".
  • Het Resultaat: Toen de auteurs de 2024-kampioen (GPT-4) opnieuw testten met de gecorrigeerde regels, steeg de score van 49% naar 57%. Dit bewijst dat de AI niet plotseling slimmer is geworden; de test is gewoon eerlijker geworden.

5. Welke fouten worden er nog steeds gemaakt?

Hoewel de AI veel beter is, is het niet perfect. Het papier wijst op een paar hardnekkige fouten die nog steeds voorkomen, zelfs bij de beste modellen:

  • Het "Verkeerde Datum" Probleem: Als de AI wordt gevraagd een grafiek te tekenen voor "vandaag", maar het systeem denkt dat vandaag een datum in het verleden is, kan de AI proberen gegevens te tekenen voor een dag die nog niet is gebeurd. Het is als het proberen te schrijven van een rapport over het weer van morgen, terwijl het vandaag is.
  • Het "Truncated Search" Probleem: Sommige tools tonen alleen de bovenste 5 resultaten. De AI ziet soms 5 resultaten, neemt aan dat dit alles is, en stopt met zoeken, waardoor het juiste antwoord dat nummer 6 was, mist.
  • Het "Letterlijk vs. Logisch" Probleem: Soms raakt de AI in de war door wiskunde. Als een taak zegt "Als groei hoger is dan gemiddeld", kan de AI een percentage (zoals 5%) vergelijken met een ruw getal (zoals 100 uur) en de logica foutief interpreteren.

De Kernboodschap

Twee jaar geleden waren AI-agenten onhandige stagiairs die vaak dingen kapotmaakten. Vandaag de dag zijn de beste agenten betrouwbare professionals die de klus klaren en zelden schade aanrichten. Hoewel de krachtigste modellen nog steeds duur zijn, zijn goedkopere, open-source alternatieven inmiddels zo goed geworden dat ze in staat zijn voor veel taken. De test zelf is opgeschoond om eerlijker te zijn, en de resultaten laten zien dat AI echte, meetbare vooruitgang boekt op de werkplek.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →