← Nieuwste papers
🤖 AI

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

Dit artikel introduceert FinProBench, een benchmark voor het evalueren van financiële AI-agenten, en Role-Grounded Rubric Construction (RGRC), een pipeline die evaluatiecriteria afleidt uit professionele leverables om impliciete standaarden effectief te vatten en significant beter te presteren dan op prompts gebaseerde methoden bij rol-gespecialiseerde financiële taken.

Oorspronkelijke auteurs: Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

Gepubliceerd 2026-08-06
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een professional moet zijn, zoals een arts, een advocaat of een financieel analist. In de wereld van kunstmatige intelligentie hebben we deze superintelligente "agenten" die kunnen chatten, code kunnen schrijven en puzzels kunnen oplossen. Maar hoe weten we of ze ook echt een goed werk leveren, of dat ze alleen maar doen alsof? Dit is de grote vraag in het vakgebied van AI-evaluatie. Lange tijd hebben we AI getest door het eenvoudige vragen te stellen met goede of foute antwoorden, zoals een meerkeuzequiz. Maar echt professioneel werk is geen quiz; het is een rommelig, complex project, zoals het schrijven van een rapport van 50 pagina's of het bouwen van een financieel model. Om dit soort werk te beoordelen, hebben we een "rubriek" nodig—een gedetailleerd beoordelingsformulier dat ons precies vertelt wat een stuk werk uitstekend maakt versus slechts oké. Het probleem is dat de meeste van deze beoordelingsformulieren worden gemaakt door te gokken wat de AI zou moeten doen, of door naar de eigen antwoorden van de AI te kijken, wat is alsof je een leerling vraagt om het eigen huiswerk te nakijken. We hebben een manier nodig om deze beoordelingsformulieren te bouwen op basis van wat echte mensen daadwerkelijk doen in hun banen.

Dit artikel introduceert een nieuwe manier om financiële AI-agenten te testen, genaamd FinProBench, samen met een slimme methode om de beoordelingsformulieren te bouwen, bekend als Role-Grounded Rubric Construction (RGRC). Denk aan RGRC als een detective die niet naar de verdachten (de AI) kijkt om de regels te achterhalen, maar in plaats daarvan de plaats van het misdrijf bestudeert (echte, professionele werkdocumenten) om te zien hoe de experts het daadwerkelijk aanpakten. De onderzoekers verzamelden meer dan 1.700 echte documenten—zoals investeringsrapporten en compliance-controles—geschreven door echte financiële professionals. Ze gebruikten deze echte voorbeelden om de AI te leren hoe hij het werk van andere AI moet beoordelen.

Hier is de wending die ze ontdekten: het hangt af van de baan. Voor veelvoorkomende, alledaagse financiële taken die al goed bekend zijn (zoals het schrijven van een standaard marktrapport), werkt het simpelweg vragen aan de AI om "een goed werk te leveren" (met behulp van een prompt) bijna even goed als hun nieuwe, fancy methode. Echter, voor gespecialiseerde, lastige rollen waar de regels verborgen of zeer specifiek zijn (zoals een niche verzekeringsactuaris), faalt de simpele "vraag beleefd"-aanpak jammerlijk. In die gevallen is de RGRC-methode, die leert van echte menselijke resultaten, een gamechanger; het vangt 99,1% van de noodzakelijke standaarden, vergeleken met slechts 78% voor de simpele methode.

Toen ze de AI-agenten tegen de test zetten tegenover echte menselijke experts met behulp van deze nieuwe, hoogwaardige beoordelingsformulieren, wonnen de mensen nog steeds gemiddeld, met een score van 73,7 op 100, terwijl de beste AI-agenten rond de 70 schommelden. Maar het was geen totale nederlaag. De AI-systemen hadden hun eigen superkrachten: sommige waren beter in het diep in de wiskunde duiken, terwijl andere geweldig waren in de opmaak. De mensen waren echter de meest consistente allrounders, waarbij ze de structuur, de nauwkeurigheid van de gegevens en de nalevingsregels perfect onder de knie hadden. Het artikel suggereert dat hoewel AI erg goed wordt, het nog steeds moet leren van de "tacit" (onuitgesproken) geheimen van echte professionals om complexe banen echt te beheersen. Het beste deel? Omdat ze voor elke rol een "meester-beoordelingsformulier" bouwden, konden ze dit voor veel verschillende taken hergebruiken, wat een enorme hoeveelheid tijd bespaart—ongeveer 6,7 keer sneller dan het maken van een nieuw beoordelingsformulier vanaf nul voor elke afzonderlijke opdracht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →