GAUGE: Grading Agent-Built Financial Models Without a Golden Answer
Het artikel introduceert GAUGE, een nieuwe benchmark die door AI gebouwde financiële modellen evalueert tegen de achtergrond van geobserveerde praktijken van analisten in plaats van tegen één enkel "gouden" antwoord, waarbij wordt onthuld dat hoewel huidige agenten uitblinken in mechanische modelconstructie, ze nog steeds aanzienlijk achterlopen op menselijke professionals wat betreft waarderingsoordeel.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een juryleden bent bij een kookprogramma. Meestal hebben de juryleden één "perfect" receptenkaart. Als het gerecht van een deelnemer zelfs maar een klein beetje anders smaakt dan die kaart, verliezen ze punten. Maar wat als er eigenlijk tien verschillende manieren zijn om een heerlijke lasagne te maken? Wat als het "perfecte" recept slechts de mening van één persoon is, en de versie van de deelnemer even smakelijk is maar andere kruiden gebruikt? Dit is het probleem waar wetenschappers tegenaan lopen bij het testen van AI op complexe taken zoals financiële modellering. Financiële modellering is als het bouwen van een gedetailleerde voorspellingsmachine voor de toekomst van een bedrijf; het mengt harde feiten (zoals de verkopen uit het verleden) met onderbouwde gissingen (zoals hoe snel het bedrijf zal groeien). Decennialang hebben we AI getest door de gissingen te vergelijken met het antwoord van één enkele expert. Maar als experts het ook niet eens zijn over de beste gissing, voelt het onrechtvaardig om de AI te straffen omdat deze een ander, doch redelijk antwoord heeft. Deze paper vraagt: Hoe beoordelen we AI wanneer er niet één "juist" antwoord is?
De onderzoekers achter deze studie, getiteld GAUGE, besloten te stoppen met de suggestie dat er slechts één perfect financieel model bestaat. Ze bouwden een nieuwe testomgeving om te zien of AI-agenten deze complexe financiële "voorspellingsmachines" kunnen bouwen en, belangrijker nog, of ze de oordelen kunnen vellen die menselijke experts maken.
Eerst testten ze de oude manier van beoordelen. Ze namen 108 paren financiële modellen die door verschillende menselijke experts voor dezelfde bedrijven waren gebouwd. Toen ze één model van een expert beoordeelden tegenover dat van een andere expert met de oude "één perfect antwoord"-regel, waren de resultaten schokkend. De mediaan score was slechts 0,33 uit 1,0. Sterker nog, 92,6% van de paren scoorde onder de 0,70. Dit betekent dat zelfs professionele mensen, die allemaal experts zijn, vaak zo sterk van mening verschillen dat als je de een als de "waarheid" zou beschouwen, je de ander zou doen zakken. Het blijkt dat in de financiële wereld "anders zijn" niet betekent dat je "fout bent".
Om dit op te lossen, creëerden het team GAUGE (Grading Agent-Built Financial Models Without a Golden Answer). In plaats van een enkele receptenkaart, creëerden ze een "veiligheidsenvelop" gebaseerd op wat echte experts daadwerkelijk doen. Stel je een doelwit voor waarbij de roos niet een enkel punt is, maar een brede ring. Als de gok van een AI ergens binnen die ring van "redelijk expertgedrag" landt, krijgt het krediet. Het systeem controleert twee zaken:
- De Mechanica: Klopte de wiskunde? Liep de spreadsheet sluitend op? (Zoals controleren of de oven daadwerkelijk aan stond).
- Het Oordeel: Viel de gok van de AI binnen het bereik van wat echte experts als verdedigbaar beschouwen? (Zoals controleren of de kruiding binnen de reikwijdte van de smaak van een goede chef valt).
Ze testten 24 verschillende AI-agenten op dit nieuwe systeem, samen met een groep van 55 mensen variërend van financiële studenten tot senior analisten. Dit is wat ze vonden:
- AI wordt goed in de wiskunde, maar slecht in het gevoel. De AI-agenten waren uitstekend in de mechanische onderdelen. De beste AI slaagde voor 93% van de mechanische controles (het controleren of de spreadsheetformules correct waren). Echter, wanneer het aankwam op de oordelende onderdelen (het doen van de werkelijke voorspellingen), slaagde de beste AI slechts voor 78%.
- De "kloof" is echt. Gemiddeld genomen waren de AI-agenten 26 punten beter in het bouwen van het model dan in het maken van de waarderingsoordelen. Ze kunnen de auto bouwen, maar ze zijn nog niet goed in het besturen ervan.
- Mensen winnen nog steeds. De beste AI scoorde 53,4. Dit was beter dan de gemiddelde financiële student (43,2), maar slechter dan elke enkele senior analist (die gemiddeld 88,3 scoorden) en de meeste junior analisten. De AI is slim genoeg om het huiswerk te doen, maar nog niet slim genoeg om de baas te zijn.
De studie suggereert dat hoewel AI zeer bekwaam wordt in het construeren van complexe financiële modellen, het moeilijkste deel—het maken van de genuanceerde, verdedigbare oordelen die experts gebruiken om de waarde van een bedrijf te bepalen—een aanzienlijke uitdaging blijft. De auteurs vonden niet alleen een score; ze bewezen dat de oude manier van beoordelen (zoeken naar één perfect antwoord) zowel onrechtvaardig was voor mensen als voor machines, en ze boden een nieuwe manier om vooruitgang te meten die recht doet aan de rommelige realiteit van deskundige onenigheid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.