← Nieuwste papers
💬 NLP

FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models

Dit artikel introduceert FINESSE-Bench, een hiërarchische benchmarksuite die bestaat uit 3.993 vragen verdeeld over acht gespecialiseerde taken – waaronder certificeringsexamens, tradingtoepassingen en een Russische olympiade – om de ontwikkeling van kennis op het gebied van financiën en technische redeneervermogens in grote taalmodellen grondig te evalueren.

Oorspronkelijke auteurs: Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

Gepubliceerd 2026-05-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe financieel adviseur wilt aannemen. Je hebt een stapel cv's en een lijst met standaardvragen voor sollicitatiegesprekken. Maar hier zit het probleem: alleen omdat iemand een meerkeuzetoets over basis economie perfect kan maken, betekent dat niet dat ze daadwerkelijk een complex beleggingsportfolio kunnen beheren of een plotselinge marktcrisis kunnen doorstaan.

Dit is precies het probleem dat de auteurs van dit artikel hebben geïdentificeerd bij de huidige "tests" voor Kunstmatige Intelligentie (KI) in de financiën. Zij hebben een nieuwe, veel strengere testset ontwikkeld, genaamd FINESSE-Bench, om te zien of KI-modellen echt klaar zijn voor de echte wereld of alleen maar goed zijn in het memoriseren van antwoorden uit de leerboeken.

Hier is een eenvoudige uiteenzetting van wat ze deden en wat ze ontdekten:

1. Het Probleem: De "Gemakkelijke Toets" Valstrik

Beschouw bestaande KI-tests (zoals FinQA of TAT-QA) als een rijbewijstoets. Ze stellen simpele vragen zoals: "Wat betekent een stopbord?" of "Hoe lees je een snelheidsmeter?"

  • Het Probleem: Veel KI-modellen slagen met vlag en wimpel voor deze tests. Maar het halen van een rijbewijs betekent niet dat je een blizzard op een ijzige bergweg aankan.
  • Het Gat: Huidige tests richten zich voornamelijk op het lezen van financiële rapporten en het uitvoeren van eenvoudige rekenkundige bewerkingen. Ze testen niet of de KI complexe scenario's met hoge risico's aankan, zoals het handelen in aandelen, risicobeheer of het analyseren van technische grafieken. Ze missen ook een duidelijke "moeilijkheidsladder"; ze laten niet zien of de KI in de war raakt als de vragen moeilijker worden.

2. De Oplossing: FINESSE-Bench (De "Echte Wereld Obstacle Course")

De auteurs bouwden een nieuwe benchmark-set genaamd FINESSE-Bench. In plaats van een eenvoudige toets, stel je dit voor als een meervoudig niveau obstacle course dat is ontworpen om de daadwerkelijke reis naar het worden van een financieel expert na te bootsen.

Het heeft 8 verschillende stations (datasets) met bijna 4.000 vragen:

  • De "School" Niveaus (CFA-achtig): Deze zijn gebaseerd op echte professionele certificeringen (zoals de CFA).
    • Niveau 1: Basis financiële geletterdheid (zoals middelbareschool economie).
    • Niveau 2: Intermediair, complexe casestudies (zoals college financiën).
    • Niveau 3: Expert-niveau strategie en ethiek (zoals een senior portfolio manager).
  • De "Specialist" Niveaus:
    • Technische Analyse: Het lezen van grafieken en marktpatronen (zoals een handelaar die naar een radarscherm kijkt).
    • Derivatenhandel: Complexe opties en futures-wiskunde (zoals het oplossen van een hoog niveau natuurkundepuzzel).
    • Russische Olympiade: Moeilijke wiskunde- en logica-problemen in het Russisch (om te testen of de KI ook in andere talen werkt).

3. Hoe Ze de KI Beoordeelden

Ze keken niet alleen naar juiste of onjuiste antwoorden. Ze gebruikten een "Judge AI" (een andere slimme KI) om open antwoorden te beoordelen, vergelijkbaar met hoe een menselijke leraar een opstel zou beoordelen. Ze controleerden:

  • Kreeg het model de basisfeiten goed?
  • Daalde de prestatie wanneer de vragen moeilijker werden?
  • Kon het omgaan met verschillende soorten vragen (meerkeuze, rekenproblemen, korte opstellen)?

4. De Grote Ontdekkingen

Toen ze de tests uitvoerden, waren de resultaten verhelderend:

  • De "Transfer Gap": Veel KI-modellen die 90% scoorden op de oude, gemakkelijke "rijbewijstoetsen", vielen aanzienlijk terug toen ze de FINESSE-Bench "obstacle course" deden. Sommige modellen die op standaardtests leken op financiële genieën, hadden moeite met echte handelstaken. Het is als een student die een A haalt in wiskunde, maar bevriest wanneer er op het moment zelf een hypotheek moet worden berekend.
  • De Moeilijkheidsladder Werkt: Ze zagen een duidelijk patroon: naarmate de vragen moeilijker werden (van Niveau 1 naar Niveau 3), presteerde bijna elk KI-model slechter. Dit bewees dat FINESSE-Bench daadwerkelijk kan meten hoe slim een model is, en niet alleen of het enkele feiten kent.
  • Niet Alle Modellen Zijn Gelijk: Sommige modellen waren "specialisten" (goed in één ding, slecht in andere), terwijl anderen "allrounders" waren (goed in alles). Bijvoorbeeld, één model was misschien het beste in het lezen van rapporten, maar slecht in handelen, terwijl een ander consequent goed was in alle gebieden.

5. Waarom Dit Belangrijk Is

Het artikel concludeert dat we niet zomaar kunnen vertrouwen op de oude, gemakkelijke tests om te beslissen welke KI klaar is voor de financiën.

  • Oude Tests: Vertellen je of de KI het leerboek heeft gelezen.
  • FINESSE-Bench: Vertelt je of de KI het werk daadwerkelijk kan doen.

Het is het verschil tussen de regels van schaken kennen en daadwerkelijk een grootmeester kunnen verslaan. FINESSE-Bench is de grootmeestermatch die ons laat zien welke KI-modellen echt klaar zijn voor de financiële wereld en welke alleen maar bluffen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →