← Nieuwste papers
💬 NLP

APEX-Agents

Deze paper introduceert APEX-Agents, een open-source benchmark met 480 realistische, langdurige taken voor AI-agenten in zakelijke omgevingen, waarbij Gemini 3 Flash (Thinking=High) de hoogste score behaalde.

Oorspronkelijke auteurs: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
Gepubliceerd 2026-02-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, digitale werkplek hebt gebouwd. In deze werkplek zitten geen echte mensen, maar slimme computerprogramma's die we AI-agenten noemen. De vraag die de auteurs van dit onderzoek willen beantwoorden is: Kunnen deze digitale werknemers echt complexe, echte werk taken uitvoeren, of zijn ze alleen maar goed in het oplossen van simpele raadsels?

Om dit uit te vinden, hebben ze APEX–Agents bedacht. Hier is een uitleg in simpele taal, met een paar handige vergelijkingen.

1. De "Proefkeuken" voor AI-werknemers

Stel je voor dat je een nieuwe kok wilt testen. Je kunt hem niet vragen om een ei te bakken; dat is te makkelijk. Je moet hem vragen om een compleet diner te bereiden voor een drukke klant, terwijl hij tegelijkertijd moet zoeken in de koelkast, de oven moet regelen en rekening moet houden met allergieën.

APEX–Agents is precies zo'n proefkeuken, maar dan voor kantoorwerk.

  • De Werkplek: Ze hebben 33 verschillende "wereldjes" gecreëerd (zoals een virtueel kantoor van een advocatenkantoor, een investeringsbank of een consultancy-bureau).
  • De Documenten: In deze wereldjes liggen duizenden bestanden: spreadsheets, e-mails, PDF's en presentaties.
  • De Taken: De taken zijn niet "schrijf een gedicht". Het zijn dingen als: "Kijk naar de financiële cijfers van dit bedrijf, vergelijk ze met de markt, maak een nieuwe presentatie en stuur een e-mail naar de klant met de conclusie."

Deze taken zijn bedacht door echte experts (advocaten, bankiers, consultants) die jarenlang ervaring hebben. Ze hebben de AI-agenten in deze wereldjes gegooid om te zien of ze het werk kunnen doen.

2. De Wedstrijd: Wie is de beste?

Ze hebben 8 verschillende AI-modellen (de "werknemers") de opdracht gegeven om deze taken te doen. Ze hebben ze 8 keer per taak laten proberen, net als een atleet die 8 keer een sprintje loopt om te zien of hij consistent is.

De resultaten:

  • De winnaar: Gemini 3 Flash deed het het beste, maar... het slaagde maar in 24% van de taken.
  • De rest: Andere bekende namen zoals GPT-5.2 en Claude Opus 4.5 deden het iets minder goed (rond de 18-23%).
  • De open-source modellen: De modellen die gratis beschikbaar zijn, deden het veel slechter (minder dan 5%).

De les: Zelfs de slimste AI's halen nog niet eens de helft van de taken perfect. Ze zijn slim, maar in de echte, rommelige werkelijkheid maken ze nog veel fouten.

3. Waar gaan ze vaak stuk?

Stel je voor dat je een robot stuurt om een huis te schilderen.

  • De "Doom Loop": Soms blijft de robot vastzitten in een cirkel. Hij probeert iets, faalt, probeert het weer, faalt, en blijft dit doen tot hij uitgeput raakt (in de paper noemen ze dit "timeout"). De robot Kimi K2 Thinking zat hier vaak in vast.
  • Verkeerde gereedschappen: Soms gebruikt de robot de verkeerde tool. In plaats van een spreadsheet te openen om cijfers te checken, opent hij een mapje met oude foto's.
  • Onzekerheid: Als je een robot 8 keer dezelfde taak geeft, lukt het hem soms wel en soms niet. Het is alsof hij vandaag een topdag heeft en morgen helemaal niets kan. Ze zijn nog niet betrouwbaar genoeg om ze alleen te laten werken.

4. Waarom is dit belangrijk?

Vroeger testten we AI's met simpele vragen: "Wat is de hoofdstad van Frankrijk?" of "Schrijf een korte tekst." Dat is als een rijstafeltest: iedereen kan dat.

Maar in het echte leven moet je als professional vaak:

  1. Veel verschillende bronnen raadplegen.
  2. Langere tijd nadenken over een probleem.
  3. Verschillende programma's met elkaar verbinden.

APEX–Agents is de eerste keer dat we AI's testen op dit niveau van "echte" complexiteit. Het is alsof we stoppen met kijken of de robot kan lopen, en nu kijken of hij een marathon kan lopen terwijl hij een zware rugzak draagt.

5. De conclusie

De boodschap van dit onderzoek is: We zijn nog niet zover.
AI's zijn indrukwekkend, maar ze zijn nog geen vervanging voor een ervaren professional. Ze kunnen helpen met stukjes werk, maar als je ze alleen laat werken op een complexe taak, zullen ze vaak vastlopen of fouten maken.

Het goede nieuws is dat de onderzoekers alles wat ze hebben gebouwd (de testomgeving, de taken en de bestanden) gratis openbaar hebben gemaakt. Zo kunnen andere wetenschappers en bedrijven meehelpen om deze digitale werknemers sneller, slimmer en betrouwbaarder te maken.

Kortom: We hebben een perfecte testbaan gebouwd om te zien hoe goed AI's echt zijn. De resultaten tonen aan dat ze nog veel moeten leren voordat ze onze kantoren volledig kunnen overnemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →