WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
Dit artikel introduceert WorkstreamBench, een nieuw benchmark voor het evalueren van LLM-agenten op end-to-end financiële spreadsheettaken met behulp van een multidimensionale taxonomie van Nauwkeurigheid, Formule en Opmaak, waaruit blijkt dat hoewel toonaangevende modellen zoals Claude professioneel ogende output produceren, huidige agenten nog steeds moeite hebben om de complexiteit en kwaliteitsnormen die nodig zijn voor real-world financiële workflows betrouwbaar te hanteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een nieuwe assistent inhuurt om een complex financieel model voor je bedrijf te bouwen. Je wilt niet alleen dat ze één rekenopgave oplossen; je wilt dat ze een volledig, professioneel spreadsheet van scratch opzetten dat je aan je baas, je investeerders en je auditors kunt overhandigen.
Dit paper, WorkstreamBench, is in feite een "eindexamen" voor AI-agenten (slimme computerprogramma's) om te zien of ze die baan daadwerkelijk kunnen uitvoeren.
Hier is de uiteenzetting van wat de auteurs hebben gedaan, met gebruikmaking van eenvoudige analogieën:
1. Het Probleem: De "Lego-blok" versus het "Kasteel"
Vorige tests voor AI waren als een bouwer vragen om "één Lego-blok op een ander te leggen" of "het rode blok te vinden". Dit zijn simpele, geïsoleerde taken (zoals een vraag beantwoorden of één getal wijzigen).
Maar in de echte wereld van de financiën verplaatsen professionals niet zomaar één blok. Ze bouwen complete kastelen. Ze hebben een spreadsheet nodig die:
- Drie verschillende rapporten (Winst- en Verliesrekening, Balans, Kasstroom) met elkaar verbindt, zodat als je één getal wijzigt, alles automatisch wordt bijgewerkt.
- "Wat-zoals"-scenario's verwerkt (bijvoorbeeld: "Wat gebeurt er als de omzet met 10% daalt?").
- Professioneel oogt, makkelijk te lezen is en eenvoudig voor een mens later te bewerken is.
De auteurs beseften dat bestaande tests te makkelijk waren. Ze testten niet of een AI het hele kasteel kon bouwen, maar alleen of het een paar blokken kon plaatsen.
2. De Oplossing: Een nieuwe "Gym" voor AI
De auteurs creëerden WorkstreamBench, een nieuwe testomgeving vol met realistische financiële uitdagingen afkomstig uit professionele wedstrijden en opleidingscursussen.
In plaats van alleen te controleren of het eindgetal klopt (zoals een wiskundeleraar die een antwoordensleutel controleert), creëerden ze een driedelig beoordelingskader om de kwaliteit van het werk van de AI te beoordelen, vergelijkbaar met hoe een menselijke baas een rapport zou beoordelen:
- Nauwkeurigheid (De Wiskunde): Is het eindgetal correct? Heeft de AI daadwerkelijk het gevraagde scenario-onderzoek uitgevoerd?
- Formule (De Logica): Is de "motor" onder de motorkap goed gebouwd?
- Analogie: Stel je een auto voor. Een slechte bouwer plakt de motoronderdelen misschien met superlijm vast (hardcoded getallen). Als je de motor later moet aanpassen, moet je de auto uit elkaar halen. Een goede bouwer gebruikt bouten en schroeven (dynamische formules) zodat de auto makkelijk te repareren en upgraden is. De AI moet bouten gebruiken, geen lijm.
- Ze controleren ook of de logica leesbaar is. Een gigantische, verwarrende formule is als een verward bol garen; een stap-voor-stap formule is als een duidelijke handleiding.
- Opmaak (De Presentatie): Ziet het er professioneel uit?
- Zijn de getallen uitgelijnd? Zijn negatieve getallen tussen haakjes (een financieel standaard) in plaats van met een minteken? Is het lettertype consistent? Als een spreadsheet er rommelig uitziet, kan een menselijke baas het zelfs afkeuren als de wiskunde klopt.
3. De Test: Wie deed het examen?
De auteurs testten veel van de slimste AI-agenten die vandaag beschikbaar zijn, waaronder versies van Claude, ChatGPT, Gemini en anderen. Sommige waren "Web"-versies (chatten in een browser) en sommige waren "Excel"-versies (plugins die binnen de spreadsheetsoftware leven).
4. De Resultaten: Het "Eerlijke" Rapport
De resultaten waren een mix van "veelbelovend" en "nog niet klaar voor de prime time".
- De Leider: De Claude Web-agent presteerde het beste. Het bouwde de meest professioneel ogende spreadsheets die het makkelijkst voor mensen te lezen en te bewerken waren.
- De Kloof: Zelfs de beste AI scoorde slechts ongeveer 69 van de 100.
- De Strijd: Naarmate de taken moeilijker werden (vereisten langere ketens van berekeningen), daalde de prestatie van de AI scherp.
- Analogie: Het is als een student die een simpele som perfect kan oplossen, maar in de war raakt en fouten maakt als wordt gevraagd een complex algebraïsch woordprobleem op te lossen.
- Veelgemaakte Fouten:
- Hardcoding: In plaats van een formule te schrijven die een getal berekent, typte de AI soms gewoon het getal in. Dit is als het schrijven van "100" op een cheque in plaats van "100" in het vakje te schrijven en de bank het te laten berekenen. Als de invoer verandert, wordt het antwoord van de AI onjuist.
- Rommelige Opmaak: De AI vergat vaak getallen uit te lijnen of gebruikte de verkeerde kleuren, waardoor de spreadsheet er onprofessioneel uitzag.
- Opgeven: Bij zeer moeilijke taken lieten sommige AI's hele secties van de spreadsheet leeg of verzonnen ze gewoon getallen.
5. Het Vonnis
Het paper concludeert dat hoewel AI-agenten goed worden in simpele taken, ze nog niet klaar zijn om betrouwbaar professionele financiële modellen op hun eigen te bouwen.
Ze zijn als een zeer getalenteerde stagiair die de wiskunde wel kan doen, maar nog steeds een menselijke toezichthouder nodig heeft om de opmaak te controleren, de logische fouten te herstellen en ervoor te zorgen dat het eindproduct iets is dat een klant daadwerkelijk zou vertrouwen. De technologie is er, maar het heeft nog meer werk nodig voordat het een menselijke financieel analist kan vervangen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.