AutomationBench
Dit paper introduceert AutomationBench, een uitdagend benchmark voor het evalueren van AI-agenten op hun vermogen om complexe, cross-applicatie workflows via REST-API's te orchestreren door endpoints zelfstandig te ontdekken en bedrijfsregels na te leven, waarbij zelfs de meest geavanceerde modellen momenteel onder de 10% scoren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een super-assistent hebt die niet alleen kan typen, maar ook echt werk kan doen: e-mails sturen, afspraken inplannen, klanten in een systeem zetten en facturen maken. Dat klinkt geweldig, toch? Maar tot nu toe zijn die slimme computers (AI-agenten) nog een beetje als een beginnende stagiair: ze kunnen één ding goed, maar als je ze vraagt om een hele keten van verschillende taken te regelen, raken ze in de war.
Dit paper introduceert AutomationBench, een nieuwe "proef" om te zien hoe goed die AI-assistenten echt zijn. Hier is hoe het werkt, vertaald naar alledaagse taal:
1. Het Probleem: De "Zapier"-Dilemma
In het echte bedrijfsleven draait alles om het verbinden van verschillende systemen. Een verkoper moet misschien een klant uit zijn e-mail halen, die in een CRM-systeem zetten, een afspraak in de agenda maken en een bericht sturen op Slack.
- Huidige tests: Bestaande tests kijken vaak alleen of een AI een website kan "klikken" of één tool kan gebruiken. Dat is als testen of een kok een ei kan bakken, maar niet of hij een heel diner kan bereiden.
- De nieuwe test: AutomationBench kijkt of de AI een diner kan bereiden waarbij hij zelf moet ontdekken welke ingrediënten (API's) hij waar moet vinden, en zich moet houden aan de receptregels (bedrijfsbeleid).
2. De Opdracht: Een Ontdekkingsreis zonder Kaart
Stel je voor dat je een assistent krijgt met de opdracht: "Regel die vergadering."
Maar er is een addertje:
- Geen handleiding: De assistent krijgt geen lijstje met knoppen. Hij moet zelf zoeken in een enorme bibliotheek van duizenden "deuren" (API's) om de juiste te vinden.
- Valse sporen: De bibliotheek zit vol met nep-boeken en verkeerde deuren. De assistent moet slim genoeg zijn om niet in de val te lopen.
- De regels: Er is een onzichtbare "chef" (het bedrijfsbeleid) die zegt: "Als de klant VIP is, gebruik dan de gouden deur, niet de zilveren." De assistent moet die regels lezen en volgen, zelfs als het tegen zijn eigen intuïtie ingaat.
3. De Beoordeling: Het Resultaat telt, niet de Weg
Dit is het slimste deel van de test. De jury kijkt niet naar hoe de assistent het deed.
- Het maakt niet uit of hij 5 stappen deed of 50.
- Het maakt niet uit of hij eerst de e-mail checkte of eerst de agenda.
- Alleen het eindresultaat telt: Staat de afspraak in de agenda? Is de klant in het systeem? Is het bericht op Slack?
Als het eindresultaat klopt, is hij geslaagd. Als er één ding verkeerd staat, is hij gezakt. Dit is precies hoe bedrijven ook kijken: "Is het werk gedaan?"
4. De Uitslag: De AI's hebben het zwaar
De resultaten zijn eerlijk gezegd een beetje schokkend, maar ook heel leerzaam.
- Zelfs de slimste AI's ter wereld (de "top-sterren" zoals Opus en Gemini) halen minder dan 10% van de taken goed.
- Dat klinkt laag, maar het zegt iets belangrijks: het is ontzettend moeilijk om een AI te bouwen die echt onafhankelijk complexe taken kan regelen zonder hulp.
- De AI's maken vaak dezelfde fouten als een mens die haast heeft:
- Ze denken dat ze het hebben gedaan, terwijl ze het niet hebben (ze zijn te zelfverzekerd).
- Ze zoeken niet grondig genoeg en geven snel op.
- Ze vergeten een detail in een lange lijst.
5. Waarom is dit belangrijk?
Dit paper is als een spiegel voor de AI-wereld. Het laat zien dat we nog niet klaar zijn voor de "zelfrijdende kantoormedewerker".
- Het helpt onderzoekers om te zien waar de zwakke plekken zitten (bijvoorbeeld: ze zijn goed in één ding, maar slecht in het verbinden van dingen).
- Het dwingt bedrijven om realistisch te zijn: we kunnen AI nu al gebruiken voor simpele taken, maar voor het regelen van hele complexe workflows moeten we nog even wachten tot de AI "slimmer" wordt.
Kortom: AutomationBench is een strenge, eerlijke test die laat zien dat onze digitale assistenten nog niet klaar zijn om de baas te spelen in ons kantoor. Ze moeten nog veel leren voordat ze echt onafhankelijk kunnen werken zonder dat we constant moeten controleren of ze het goed doen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.