SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?
Het artikel introduceert SaaS-Bench, een uitgebreide benchmark die bestaat uit 106 realistische taken over 23 professionele SaaS-systemen, en waaruit blijkt dat huidige computergebruikende agenten aanzienlijk moeite hebben met complexe workflows met een lange horizon, met een succespercentage van minder dan 4% van begin tot eind als gevolg van beperkingen in planning, statusvolging en foutherstel.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een nieuwe assistent inhuurt om je meest complexe werkdag te beheren. Je wilt niet alleen dat ze e-mails beantwoorden; je wilt dat ze inloggen op je bank, je projectmanagementsoftware, je medische dossiers en je ontwerptools om het werk daadwerkelijk te doen.
Dit artikel introduceert een nieuwe "eindexamen" genaamd SaaS-Bench om te testen hoe goed AI-assistenten (zogenaamde Computer-Using Agents) werkelijk zijn in dit soort echte banen.
Hier is de uiteenzetting van wat ze deden en wat ze vonden, met behulp van eenvoudige analogieën.
1. Het Probleem: De "Videospellen" vs. De "Echte Baan"
Tot nu toe waren de meeste tests voor AI-assistenten als het spelen van een videospel. De levels waren kort, de regels waren simpel, en als je vastliep, resette het spel gewoon.
- De Oude Manier: "Klik op de rode knop, typ dan 'Hallo'." (Eenvoudig, kort, geïsoleerd).
- De Echte Wereld: "Ga naar het HR-systeem om een werknemer te ontslaan, ga dan naar het boekhoudsysteem om hun laatste loonstrook te berekenen, ga dan naar de CRM om hun klanten opnieuw toe te wijzen, en zorg ervoor dat de data perfect overeenkomen." (Moeilijk, lang, rommelig).
De auteurs realiseerden zich dat het slagen voor de "videospelletjes"-tests niet betekende dat een AI een echte baan kon aan. Dus bouwden ze een nieuwe test op basis van 23 echte, inzetbare softwaresystemen (zoals echte medische dossiersystemen, boekhoudtools en projectmanagers) die professionals daadwerkelijk gebruiken.
2. Het Examen: SaaS-Bench
Zie SaaS-Bench als een enorm meerdaags obstakelbaan.
- De Baan: Het bevat 106 verschillende taken verspreid over zes verschillende "wijken" van werk (zoals Gezondheidszorg, Financiën en Software Engineering).
- De Regels: De AI moet deze systemen navigeren met een webbrowser, net zoals een mens dat zou doen. Het kan niet valsspelen door in de databasecode te kijken; het moet op knoppen klikken en schermen lezen.
- De Moeilijkheidsgraad: Dit zijn geen taken van 5 minuten. De gemiddelde taak duurt meer dan 100 stappen (klikken, typen en scrollen). Het is alsof je iemand vraagt om een cake te bakken, een recept ervoor te schrijven, het recept naar een vriend te mailen en vervolgens de bon voor de bloem in te dienen, allemaal in één keer.
3. De Resultaten: De AI Raakte Verdwaald
De onderzoekers testten de slimste beschikbare AI-modellen (zoals de "topstudenten" van de AI-wereld) op dit examen. De resultaten waren nuchter:
- De Score: Zelfs het beste AI-model voltooide minder dan 4% van de taken volledig van begin tot eind.
- De "Bijna"-Valstrik: De AI was eigenlijk goed in het begin van de taken. Het kon 80% van de weg afleggen. Het kon het eerste formulier invullen, op de juiste knoppen klikken en het eerste document maken.
- De Crash: Maar dan maakte het een klein foutje (zoals het verkeerde datum invoeren), merkte het de fout niet op, en ging dan verder op het verkeerde pad. Tegen de tijd dat het bij het einde aankwam, was het hele resultaat verkeerd.
De Analogie: Stel je een GPS voor die geweldig is in het zeggen van "sla linksaf" en "rij 5 mijl". Maar als je per ongeluk een afslag mist, zegt de GPS niet: "Je bent verdwaald, laten we opnieuw berekenen." In plaats daarvan zegt het zelfverzekerd dat je nog 50 mijl rechtdoor moet rijden totdat je benzine op is. De AI is zelfverzekerd, maar vaak verkeerd.
4. Waarom Mislukten Ze? (De Vier Grote Hindernissen)
Het artikel identificeert vier hoofdredenen waarom de AI worstelde, met behulp van enkele geweldige metaforen:
- Het "Kaartenhuis"-Effect (Fragiliteit): Bij deze lange taken hangt elke stap af van de vorige. Als je stap 10 verpest, zijn stap 11 tot en met 100 verpest. De AI is zo goed in stap 10 dat het denkt het geweldig doet, maar die ene kleine fout doet de hele structuur instorten.
- Het "Stille Vergif" (Fouten die zich opstapelen): Soms maakt de AI een fout die er aan de oppervlakte correct uitziet.
- Voorbeeld: De AI maakt een klant genaamd "Elena" in plaats van "Arcturus Digital". Het scherm toont "Elena (Arcturus)", dus denkt de AI: "Geweldig, ik heb het gedaan!" Maar omdat de naam technisch gezien verkeerd is, wordt elke daaropvolgende financiële transactie aan de verkeerde persoon gekoppeld. De AI beseft nooit dat het de bron heeft vergiftigd.
- De "Zelfzekere Leugenaar" (Zelfbedrog): De AI heeft een "geheugen" waarin het zichzelf vertelt wat het heeft gedaan. Soms ziet het een fout, probeert het die te herstellen, maar vergeet dan te controleren of de oplossing werkte. Het schrijft vervolgens een rapport met de tekst: "Ik heb het opgelost!" terwijl het scherm nog steeds de fout toont. Het is als een student die beseft dat een rekenfout heeft gemaakt, probeert het weg te wissen, maar vervolgens het antwoord toch opschrijft en zegt: "Ik ben klaar."
- Het "Muntworp"-Principe (Onbetrouwbaarheid): Als je dezelfde AI drie keer dezelfde taak laat uitvoeren, kan het een perfecte score behalen bij de eerste poging, volledig falen bij de tweede en het redelijk doen bij de derde. Het is niet consistent. Dit betekent dat je niet kunt vertrouwen dat het vandaag een baan betrouwbaar uitvoert, zelfs als het het gisteren wel deed.
5. De Conclusie
Het artikel vraagt: "Kunnen AI-agenten echte software gebruiken om professioneel werk op te lossen?"
Het antwoord is: Nog niet.
Hoewel deze AI-modellen ongelooflijk slim zijn in het praten en begrijpen van taal, zijn ze momenteel verschrikkelijk slecht in lange, complexe, echte uitvoering. Ze raken verdwaald in de details, ze controleren hun werk niet dubbel, en ze kunnen zich niet herstellen wanneer ze een fout maken.
De auteurs bouwden deze test (SaaS-Bench) niet om te zeggen dat AI nutteloos is, maar om ons precies te laten zien waar het misgaat zodat we het kunnen repareren. Totdat de AI een workflow van 100 stappen kan hanteren zonder verward te raken of zelfverzekerd te zijn over het verkeerde antwoord, is het niet klaar om je professionele baan over te nemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.