← Nieuwste papers
💬 NLP

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models

Dit paper introduceert OccuBench, een benchmark die AI-agenten evalueert op 100 real-world professionele taken via taalwereldmodellen, en onthult dat geen enkel model alle industrieën domineert, impliciete fouten het moeilijkst zijn, grotere modellen beter presteren, en dat de kwaliteit van de simulatie cruciaal is voor betrouwbare evaluaties.

Oorspronkelijke auteurs: Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

Gepubliceerd 2026-04-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

OCCUBENCH: De "Proefkeuken" voor AI-Agents in de echte wereld

Stel je voor dat je een nieuwe kok wilt aannemen voor je restaurant. Je hebt hem niet alleen getest op het koken van een simpele boterham (dat is wat de huidige tests doen), maar je wilt weten of hij ook een complex diner kan bereiden, of hij kan omgaan met een kapotte oven, en of hij een recept kan volgen terwijl de lichten uitvallen.

Dat is precies wat dit nieuwe onderzoek, OCCUBENCH, doet, maar dan voor AI-agents (slimme computerprogramma's die taken uitvoeren in plaats van alleen tekst schrijven).

Hier is een simpele uitleg van wat ze hebben gedaan, waarom het belangrijk is, en wat ze hebben ontdekt, vertaald naar alledaagse taal.

1. Het Probleem: De "Proefkeuken" bestond niet

Tot nu toe konden we AI's alleen testen in veilige, simpele omgevingen, zoals het bladeren door een website of het schrijven van code.

  • De realiteit: AI's moeten straks echte beroepen doen: een arts helpen bij het triageren van patiënten, een reactorbeveiliger zijn, of douaneformulieren verwerken.
  • Het probleem: Je kunt deze taken niet zomaar testen. Je kunt geen echte ziekenhuisafdeling of kerncentrale openstellen voor een computer om mee te spelen. Dat is te gevaarlijk of er is geen publieke toegang toe.
  • Het gevolg: We wisten niet of AI's deze zware beroepen echt aankunnen. Het was alsof je een piloot testte op een speelgoedvliegtuigje in een kamer, terwijl hij straks een passagiersvliegtuig moet vliegen.

2. De Oplossing: De "Toverkeuken" (Language World Models)

De onderzoekers hebben een slimme truc bedacht. In plaats van een echte omgeving te bouwen (wat te duur en moeilijk is), hebben ze een Toverkeuken gemaakt.

  • Hoe werkt het? Ze gebruiken een zeer slim AI-model (een "Language World Model") dat de rol van de omgeving speelt.
  • De analogie: Stel je voor dat je een rollenspel speelt. Jij bent de speler, en de AI is de Spelleider (de Dungeon Master). De Spelleider kent alle regels van de wereld. Als jij zegt: "Ik wil een kamer boeken", denkt de Spelleider na over de regels van het hotel en zegt: "Oké, kamer 205 is vol, maar 206 is vrij."
  • Het resultaat: Ze hebben zo 100 verschillende beroepsscenario's gemaakt, van "Brandweer-coördinator" tot "Visserij-manager". De AI die getest wordt, denkt dat hij in de echte wereld zit, maar hij is eigenlijk aan het spelen met een zeer slimme Spelleider.

3. De Test: Niet alleen slimmer, maar ook veerkrachtig

Ze hebben 15 van de slimste AI-modellen ter wereld getest in deze 100 beroepen. Ze keken naar twee dingen:

  1. Kunnen ze de taak doen? (De "slimme kok" test).
  2. Kunnen ze omgaan met rotzooi? (De "veerkracht" test).

In de echte wereld gaan dingen mis. Soms is de internetverbinding weg, soms ontbreken er gegevens, en soms geven systemen een vaag foutje zonder te zeggen wat er aan de hand is.

  • Heldere fouten (E1): De computer zegt: "Fout 500! Ik kan niet werken!" (Dit is makkelijk op te lossen: probeer het nog eens).
  • Stille fouten (E2): De computer geeft je een lijstje, maar mist halverwege de helft van de namen, zonder dat hij het zegt. Het ziet eruit alsof het klopt, maar het is onvolledig. Dit bleek de grootste uitdaging. De meeste AI's dachten: "Oké, dit is alles wat er is," en maakten een fout. Ze misten het signaal dat er iets mis was.

4. De Belangrijkste Ontdekkingen

Wat hebben ze geleerd van deze grote proef?

  • Geen enkele AI is de beste in alles:
    Net als mensen hebben AI's verschillende talenten. Een model dat fantastisch is in wiskunde en wetenschap (zoals Gemini), kan juist moeite hebben met logistiek of transport. Een ander model (Claude) is geweldig in transport, maar minder goed in handel. Er is geen "super-AI" die alles perfect doet.
  • Stille fouten zijn gevaarlijker dan harde fouten:
    AI's reageren goed als er een rode knop oplicht ("Fout!"). Maar als de data gewoon "minder goed" is zonder waarschuwing, haken ze vaak af of maken ze slordige fouten. Ze moeten leren om te zeggen: "Wacht even, dit voelt niet compleet."
  • Groter en slimmer is beter:
    Net als bij mensen: een groter model (meer hersenen) en een model dat meer tijd neemt om na te denken ("redeneren"), doet het altijd beter. Hoe meer tijd je een AI geeft om na te denken, hoe beter hij de taak uitvoert.
  • De "Spelleider" moet ook slim zijn:
    Dit was een verrassende ontdekking. Om een AI goed te testen, moet de "Spelleider" (de simulator) ook heel slim zijn. Als je een domme Spelleider gebruikt, kan het lijken alsof de AI faalt, terwijl de AI het juist goed deed en de Spelleider de regels verdraaide. Een sterke AI is niet per se een goede Spelleider.

Conclusie: Waarom is dit belangrijk?

Vroeger testten we AI's alsof ze in een zwembad met water zaten. Nu hebben we ze eindelijk in de "ruwe zee" gegooid, met golven, stormen en onvoorspelbaar weer.

OCCUBENCH laat zien dat we nog een lange weg te gaan hebben voordat AI's veilig en betrouwbaar complexe beroepen kunnen overnemen. Ze zijn slim, maar ze moeten nog leren omgaan met de onvolkomenheden van de echte wereld. En als we ze willen testen, moeten we zorgen dat onze testomgevingen net zo realistisch (en soms net zo onbetrouwbaar) zijn als de echte wereld.

Kortom: AI's zijn niet langer alleen maar chatbots; ze zijn nu echte werknemers in opleiding, en deze test is hun eerste sollicitatiegesprek voor een zwaar beroep.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →