FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management
Het artikel introduceert FinSkillBench, een uitgebreide benchmark voor het evalueren van AI-agenten in beleggingsbeheer op het gebied van portefeuilleconstructie, risicobeheer en fundamentele analyse, waarbij wordt aangetoond dat toegang tot gecureerde procedurele vaardigheden de prestaties aanzienlijk verbetert, terwijl zelf gegenereerde vaardigheden minimaal voordeel bieden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de hooggestoken wereld van vermogensbeheer hangt succes van meer dan alleen het hebben van een goed idee over welke aandelen te kopen. Het vereist een rigoureus, stapsgewijs proces van het verzamelen van nauwkeurige gegevens, het uitvoeren van complexe berekeningen en het naleven van strikte regels die bepalen hoe geld kan worden verplaatst. Stel je een financieel analist voor die naar een portefeuille van dertig verschillende bedrijven moet kijken, moet berekenen hoe zij zouden kunnen reageren op een plotselinge marktcrasch, en vervolgens de belangen moet reorganiseren om binnen de wettelijke limieten te blijven, alles terwijl hij alleen gebruikmaakt van de informatie die op een specifieke dag in het verleden beschikbaar was. Dit is de dagelijkse realiteit voor menselijke professionals, maar het is een nieuw front voor kunstmatige intelligentie. Hoewel moderne AI-systemen uitstekend zijn in het schrijven van teksten en het beantwoorden van algemene vragen, worstelen ze vaak wanneer ze wordt gevraagd om precies deze soort gedisciplineerde taken uit te voeren. Ze begrijpen misschien het concept van risico, maar ze falen vaak in het uitvoeren van de specifieke wiskundige stappen die nodig zijn om het nauwkeurig te meten of het volgen van de gedetailleerde instructies die nodig zijn om een portefeuille zonder fouten te herbalanceren.
Een team van onderzoekers heeft een nieuwe manier ontwikkeld om te testen of AI-agenten dit soort werk werkelijk kunnen aan kunnen. Ze bouwden een gespecialiseerde testomgeving genaamd FinSkillBench, die AI-systemen presenteert met 2.603 verschillende investeringsscenario's. Deze scenario's dekken drie hoofdegebieden: het opbouwen van een aandelenportefeuille, het beheren van de risico's die verbonden zijn aan die aandelen, en het analyseren van de financiële gezondheid van individuele bedrijven. De onderzoekers vroegen de AI niet alleen om het antwoord te raden; ze gaven het een specifieke datum, een set ruwe gegevens en een duidelijk doel, en controleerden vervolgens het resultaat tegen een bekende, correcte oplossing die is gegenereerd door standaard financiële software. Het doel was om te zien of de AI kon handelen als een professionele analist, door de juiste gegevens op het juiste moment op te halen en de juiste instrumenten te gebruiken om de klus te klaren.
De studie testte drie verschillende manieren om de AI te helpen. In het eerste scenario moest de AI de problemen volledig zelfstandig oplossen, zonder hulp. In het tweede scenario voorzagen de onderzoekers de AI van een "gecureerde" set hulpmiddelen en geschreven gidsen. Dit waren niet zomaar willekeurige documenten; het waren zorgvuldig voorbereide instructies en computercodes die de AI precies lieten zien hoe ze de noodzakelijke berekeningen moest uitvoeren en hoe ze de beschikbare instrumenten correct moest gebruiken. In het derde scenario werd de AI gevraagd om haar eigen instructies en hulpmiddelen te schrijven voordat ze de taak probeerde te voltooien, wat in feíz neerkomt op het proberen zichzelf ter plekke te leren hoe het werk gedaan moet worden.
De resultaten waren duidelijk en beslissend. Wanneer de AI de vooraf gemaakte, door mensen geschreven gidsen en hulpmiddelen kreeg, verbeterde de prestatie dramatisch. Over alle tests heen steeg de gemiddelde score voor deze AI-agenten van ongeveer 37 procent naar 53 procent. De verbetering was het meest significant bij de taken die zware rekenkracht vereisten, zoals het bouwen van een optimale portefeuille of het identificeren van verborgen risico's. In deze gebieden was de AI met de gecureerde hulpmiddelen in staat om problemen op te lossen die zij voorheen helemaal niet kon oplossen. De onderzoekers ontdekten dat het hebben van toegang tot deze betrouwbare, stapsgewijze procedures even belangrijk was als de keuze van het AI-model zelf. Een krachtig AI-model zonder de juiste hulpmiddelen faalde vaak, terwijl een bekwaam model met de juiste hulpmiddelen slaagde.
In contrast hiermee werkte het idee van de AI die zichzelf ter plekke onderwijst niet. Wanneer de agenten werden gedwongen om hun eigen gidsen en hulpmiddelen te schrijven voordat ze de problemen oplosten, veranderde hun prestatie nauwelijks. Ze besteedden veel tijd en rekenkracht aan het schrijven van deze instructies, maar de instructies die ze creëerden waren vaak gebrekkig of incompleet. De studie toonde aan dat een AI in één enkele poging niet betrouwbaar de complexe, precieze procedures kan uitvinden die nodig zijn voor financiële analyse. Het is niet genoeg dat de AI weet hoe ze code moet schrijven; ze moet code krijgen die al getest en geverifieerd is. De onderzoekers voerden dezelfde tests ook uit met een ander AI-systeem om er zeker van te zijn dat hun bevindingen niet slechts een toevalstreffer waren van één specifieke opstelling. Het tweede systeem vertoonde hetzelfde patroon: vooraf gemaakte hulpmiddelen hielpen, en zelfgemaakte hulpmiddelen niet.
Dit werk suggereert dat voor AI nuttig te zijn in serieuze velden zoals de financiële sector, we niet kunnen vertrouwen op de modellen om de regels van het spel gaande in de uitvoering te ontdekken. In plaats daarvan moeten we systemen bouwen waarbij de AI toegang heeft tot vertrouwde, door mensen geverifieerde methoden voor het zware werk. De studie concludeert dat de toekomst van AI in vermogensbeheer niet ligt in alleen maar slimmere modellen, maar in beter ontworpen systemen die die modellen combineren met betrouwbare, herbruikbare vaardigheden. De onderzoekers hebben hun tests en hulpmiddelen beschikbaar gesteld aan anderen, in de hoop het veld vooruit te helpen door de focus te leggen op hoe AI-agenten kunnen worden uitgerust met de juiste middelen om reële problemen op te lossen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.