← Nieuwste papers
🤖 AI

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

Dit artikel introduceert EuroExec, een benchmark van 413 reële Europese executieve taken die door menselijke experts zijn geëvalueerd, wat onthult dat zelfs de sterkste frontier large language models aanzienlijk tekortschieten aan professionele menselijke standaarden, waarbij ze slechts 56,9% van de taken oplossen en consistent worden overtroffen door door experts geschreven referenties.

Oorspronkelijke auteurs: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

Gepubliceerd 2026-08-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe assistent inhuurt om een enorm, complex bedrijf te helpen runnen. Je hebt niet alleen iemand nodig die feiten uit een tekstboek kan opzeggen; je hebt een strateeg nodig die naar een rommelig, echt probleem kan kijken, de lokale regels kan begrijpen en een briljant plan kan schrijven dat ook daadwerkelijk werkt. Dit is de wereld van "Large Language Models" (LLM's)—superintelligente computerprogramma's die getraind zijn op enorme hoeveelheden tekst en die verhalen kunnen schrijven, vragen kunnen beantwoorden en puzzels kunnen oplossen. Een tijdje lang hebben we deze AI-assistenten getest met eenvoudige meerkeuzequizzen, zoals het vragen aan hen om het juiste antwoord te kiezen uit een lijst van vier. Maar in de echte wereld komen problemen zelden met een lijst met keuzemogelijkheden. Ze zijn open, rommelig en vereisen diep oordeelsvermogen. De grote vraag die iedereen bezighoudt is: kunnen deze AI-"genieën" daadwerkelijk omgaan met de beslissingen met hoge inzet en open eind die echte bestuurders elke dag nemen, of zijn ze gewoon heel goed in het maken van toetsen?

Een team onderzoekers van Sovrano AI besloot dit uit te zoeken door een gloednieuwe, ultra-moeilijke uitdaging te creëren genaamd EuroExec. In plaats van een simpele quiz, bouwden zij een enorme examen bestaat uit 413 complexe, langvormige vragen gebaseerd op echte zakelijke scenario's in Europa. Ze vroegen de AI niet alleen om te gokken; ze huurden 47 echte menselijke experts in—mensen met decennia aan ervaring in finance, marketing, business en productmanagement—om de vragen te schrijven en de antwoorden te beoordelen. Deze experts stelden een strikte checklist met vereisten op voor elk antwoord, waarbij ze fungeerden als een rigoureuze baas die het werk van een junior werknemer controleert. Vervolgens vroegen ze zes van de meest geavanceerde AI-modellen ter wereld om deze problemen op te lossen en vergeleken ze de prestaties van de AI met die van de menselijke experts.

De resultaten waren een flinke reality check. Zelfs de slimste AI-modellen ter wereld hadden moeite om het tempo van de professionals bij te houden. Het allerbeste AI-model slaagde er slechts in om ongeveer 56,9% van de taken te "oplossen", wat betekent dat het bijna de helft van de vragen niet voldeed aan de professionele standaard. In contrast hiermee losten de menselijke experts, wanneer zij gevraagd werden hun eigen ideale antwoorden te schrijven, de problemen op met een bijna perfect percentage van 92,4%. Wanneer de onderzoekers de menselijke experts vroegen om de antwoorden blind te rangschikken, gaven zij de voorkeur aan de door mensen geschreven reacties boven de antwoorden van de AI in 74% van de gevallen.

De studie keek ook naar hoe de AI faalde. Ho hoewel de modellen redelijk waren in het schrijven van goed gestructureerde teksten en het helder communiceren, schoten ze tekort als het aankwam op werkelijke redenering en logica. Ze misten vaak de specifieke lokale regels van Europese markten of faalden in het creëren van realistische, uitvoerbare plannen. Interessant genoeg probeerden de onderzoekers andere AI-programma's te gebruiken om de antwoorden automatisch te beoordelen, in de hoop tijd en geld te besparen. Echter, deze "AI-rechters" waren onbetrouwbaar; ze hadden de neiging om de prestaties van de beste modellen te overschatten en misten de subtiele nuances die menselijke experts wel oppikten.

Uiteindelijk suggereert het paper dat hoewel AI ongelooflijk goed wordt in het genereren van tekst, het nog niet klaar is om menselijke experts te vervangen in besluitvorming op hoog niveau. Het "Solve Rate" van de beste AI kwam nauwelijks boven de 50% bij de makkelijkste vragen, en zelfs de meest capabele modellen waren ver verwijderd van de professionele standaard die vereist is voor directiewerk. De onderzoekers concluderen dat voor dit soort complexe, real-world taken, menselijk oordeelsvermogen nog steeds de gouden standaard is, en dat we nog niet kunnen vertrouwen op automatische metingen of AI-rechters om ons te vertellen of een computer echt "denkt" als een expert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →