← Nieuwste papers
💬 NLP

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

Het artikel introduceert BizFinBench.v2, een uitgebreide tweetalige benchmark die gebruikmaakt van authentieke gebruikersgegevens uit de Chinese en Amerikaanse aandelenmarkten om grote taalmodellen te evalueren, waarbij wordt onthuld dat de huidige state-of-the-art modellen ondanks de superieure prestaties van DeepSeek-R1 nog steeds tekortschieten in de praktijk van zakelijke vereisten.

Oorspronkelijke auteurs: Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren hoe hij een aandelenhandelaar moet zijn. Jarenlang hebben we deze robots getest in een enorme, stille klaslokaal vol met nep oefentoetsen. De robots halen de toetsen met gemak, ze krijgen A+-cijfers, dus we gaan ervan uit dat ze klaar zijn om echt geld te beheren. Maar in de echte wereld is de aandelenmarkt geen stille klaslokaal; het is een chaotische, lawaaierige en razendsnelle achtbaan waar de regels elke seconde veranderen.

Dat is het grote probleem waar de auteurs van dit artikel, BizFinBench.v2, zich mee bezighouden. Ze stellen dat de oude "klaslokale toetsen" ons voorliegen. Ze zijn gebouwd op verzonnen data die niet overeenkomt met de rommelige realiteit van de werkelijke financiële wereld. Daarom hebben de auteurs een gloednieuwe, echte sportschool gebouwd om deze robots te testen.

De Nieuwe Sportschool: Echte Data, Echte Inzet

In plaats van nepvragen gebruikt deze nieuwe benchmark 28.860 werkelijke vragen die echte mensen stelden op echte financiële apps in zowel de Chinese als de Amerikaanse aandelenmarkten. Het is alsoals het vervangen van een tekstboekquiz door een live, hoogwaardig pokerspel waarbij de fiches echt zijn.

De sportschool heeft twee hoofdzones:

  1. De Offline Zone: Dit is waar de robots moeilijke vragen beantwoorden over zaken als "Waarom crashte dit aandeel?" of "Analyseer dit bedrijfsrapport." Er zijn 8 verschillende soorten taken in deze zone, variërend van het opsporen van vreemde datafouten tot het voorspellen van hoe een gebruiker over de markt denkt.
  2. De Online Zone: Dit is het enge gedeelte. Hier moeten de robots real-time beslissingen nemen. Ze moeten aandelenkoersen voorspellen terwijl ze gebeuren en een fictieve portefeuille met geld beheren, waarbij ze elke uur kopen en verkopen op basis van live marktgegevens. Het is alsof je een auto bestuurt met een blinddoek op, maar de auto rijdt met 100 mph en de weg verandert elke seconde.

De Resultaten: De Robots Zijn Nog Aan het Leren

Toen de auteurs de slimste robots ter wereld in deze echte sportschool zetten, waren de resultaten... nou ja, een beetje een schok.

Zelfs de superster-robot, GPT-5, kreeg slechts 61,5% van de antwoorden goed. Dat klinkt prima voor een schooltoets, maar in de echte financiële wereld moet je 84,8% van de tijd gelijk hebben om als veilig genoeg te worden beschouwd voor gebruik. De robots slagen er nog steeds niet in om aan de basisvereisten van een echt bedrijf te voldoen.

Onder alle geteste robots viel één model genaamd DeepSeek-R1 op, maar met een addertje onder het gras. Het was het enige model dat "superieure investeringseffectiviteit" liet zien in het online investeringsspel, en maakte daadwerkelijk een winst van +47,34%. Het was echter ook een beetje roekeloos en verloor op een gegeven moment zelfs 53% van zijn geld (een "maximum drawdown"). Het is als een racewagenrijder die de race wint, maar de auto crasht op weg naar het podium. Hoewel het de beste van de groep was, was het nog steeds de enige die zelfs maar in de buurt kwam van de prestaties van gemiddelde traditionele handelsstrategieën; de rest van de commerciële modellen slaagde er niet in de markt te verslaan.

Interessant genoeg ontdekten de auteurs dat sommige robots die beroemd zijn als "financiële experts", juist slechter presteerden dan de algemene modellen. Het blijkt dat het trainen van een robot enkel op financiële tekstboeken hem niet tot een betere handelaar maakt als hij de chaos van de echte markt niet aankan.

De "Denk"-valstrik

De auteurs probeerden ook een truc genaamd Chain-of-Thought (CoT), waarbij ze de robots vertelden om "stap voor stap na te denken" voordat ze antwoorden. Je zou denken dat dit zou helpen, toch? Fout. Voor de meeste robots maakte dit hen juist slechter. Het was alsof je een zenuwachtige student vertelt om elke stap van een wiskundeprobleem te overanalyseren totdat hij het antwoord volledig vergeet! Eén robot, Claude-Sonnet-4, zag zijn score kelderen van 39,5% naar 13,7% alleen maar omdat hij werd gedwongen te veel na te denken!

De Vijf Grote Fouten

Door te kijken naar waar de robots faalden, ontdekten de auteurs vijf specifieke manieren waarop ze fouten maken in de echte wereld:

  1. Semantische Afwijking: Ze begrijpen de woorden, maar missen de betekenis. Ze kunnen denken dat een technologiebedrijf hetzelfde is als een halfgeleiderbedrijf, simpelweg omdat ze beide de term "tech" gebruiken, terwijl ze de nuance negeren dat dit totaal verschillende bedrijven zijn.
  2. Logische Discontinuïteit: Ze verliezen de draad in lange verhalen. Als je ze vraagt om een oorzaak-gevolgketen over een lange periode te volgen, raken ze in de war en laten ze het stokje vallen.
  3. Multivariabele Analyse: Ze kunnen niet te veel ballen tegelijk in de lucht houden. Wanneer ze nieuws, grafieken en gebruikersgevoelens moeten combineren om een beslissing te nemen, raken ze overweldigd en kiezen ze de verkeerde factoren.
  4. Hoge-Precisie Distorsie: Ze zijn slecht in rekenen. In de financiële wereld kan een kleine fout in de decimalen miljoenen kosten, en deze robots berekenen vaak getallen onjuist.
  5. Tijdsvolgorde-Verwarring: Ze halen de tijdlijn door elkaar. Ze kunnen denken dat een gebeurtenis plaatsvond vóórdat deze een reactie veroorzaakte, of andersom, waardoor het hele verhaal volledig wordt omgedraaid.

De Kern van het Verhaal

Het artikel suggereert dat hoewel deze AI-modellen slimmer worden, ze nog niet klaar zijn om jouw persoonlijke financieel adviseur te zijn. De kloof tussen hun "toetsscores" en hun "prestaties in de echte wereld" is enorm. De auteurs zeggen niet dat AI nutteloos is; ze zeggen dat we moeten stoppen met het testen van ze in nep klaslokalen en ze moeten testen in de echte, rommelige sportschool. Totdat ze consistent die 84,8% nauwkeurigheid kunnen halen, moeten we zeer voorzichtig zijn met het toevertrouwen van ons geld aan hen.

Het goede nieuws? De auteurs delen hun data en de "sportschool" die ze gebouwd hebben, zodat andere wetenschappers kunnen helpen de robots te trainen om klaar te zijn voor de echte wereld. Maar voor nu zijn de robots nog steeds slechts studenten, geen meesters.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →