UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
Dit artikel introduceert UniFinEval, de eerste verenigde multimodale benchmark die tekst, afbeeldingen en video's beslaat over vijf kernscenario's in de financiële sector, wat onthult dat hoewel huidige modellen zoals Gemini-3-pro-preview leiden in prestaties, ze nog steeds aanzienlijk achterlopen op financiële experts in het verwerken van informatie met een hoge dichtheid en complexe redenering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een nieuwe assistent inhuurt om een enorm, risicovol investeringsbedrijf te helpen aansturen. Deze assistent moet een "super-analist" zijn die dikke financiële rapporten kan lezen, complexe grafieken kan interpreteren, uren aan marktanalyses kan bekijken en vervolgens slimme beslissingen kan nemen over waar het geld moet worden geïnvesteerd.
Lamaag hebben we deze AI-assistenten getest met eenvoudige quizjes—zoals het vragen om een enkele paragraaf te lezen of een simpele grafiek te identificeren. Maar in de echte wereld is financiën chaotisch. Het is alsof je een stormachtige oceaan probeert te navigeren terwijl je tegelijkertijd een kaart leest, naar een radio-uitzending luistert en een live videofeed bekijkt. De oude tests waren te makkelijk en weerspiegelden niet de chaos van de echte baan.
Ontmoet "UniFinEval": De Ultieme Financiële Bootcamp
De auteurs van dit paper hebben een nieuwe, super uitdagende test ontwikkeld genaamd UniFinEval. Zie dit als een "overlevingscursus" voor AI-modellen, specif waarin wordt gekeken of ze de hoge druk en de informatie-overload van de echte financiële wereld aankunnen.
Zo hebben zij deze bootcamp opgebouwd:
1. De Vijf Niveaus van de Bootcamp
In plaats van alleen maar één type vraag te stellen, is de test verdeeld in vijf realistische scenario's, die steeds moeilijker worden naarmate je verder gaat:
- Niveau 1: De Detective (Audit van Financiële Overzichten): Stel je een detective voor die naar een rommelige plaats delict kijkt. De AI moet kleine inconsistenties vinden in een financieel rapport dat vol zit met tekst, grafieken en verwarrende lay-outs. Het is alsof je een enkele typefout moet vinden in een document van 100 pagina's terwijl iemand afleidende geluiden in je oor schreeuwt.
- Niveau 2: De Onderzoeker (Fundamentele Bedrijfsanalyse): Nu moet de AI uitzoeken of een bedrijf daadwerkelijk gezond is. Het moet cijfers uit verschillende rapporten halen, complexe berekeningen uitvoeren en de verbanden leggen tussen een tekstuele beschrijving en een grafiek. Het is als het oplossen van een puzzel waarbij de stukjes in verschillende talen zijn.
- Niveau 3: De Trendspotter (Inzicht in Sector Trends): De AI zoomt uit. Het kijkt niet langer naar één enkel bedrijf, maar naar een hele sector. Het moet tientallen bedrijven over een langere periode vergelijken om grote patronen te ontdekken. Het is als het kijken naar een voetbalwedstrijd en de winnaar voorspellen op basis van de prestaties van elke individuele speler op het veld, en niet alleen op basis van de ster-kwartjes.
- Niveau 4: De Radar (Financieel Risico Detecteren): Dit is het spannende deel. De AI moet een video bekijken van een marktanalist die aan het woord is, terwijl hij tegelijkertijd een rapport leest en naar een grafiek kijkt. De AI moet verborgen gevaren (risico's) opsporen die begraven liggen in de ruis. Het is als proberen een fluistering te horen tijdens een orkaan.
- Niveau 5: De Generaal (Analyse van Activa-allocatie): Het ultieme eindbaas-niveau. De AI moet alles wat hij heeft geleerd van de voorgaande vier niveaus gebruiken om een definitieve beslissing te nemen over hoe er geïnvesteerd moet worden, waarbij alle risico's en regels in evenwicht worden gehouden. Dit is het moment waarop de Generaal moet beslissen waar de troepen naartoe gestuurd moeten worden.
2. De Regels van het Spel
- Geen Valsspelen: De testvragen werden niet geschreven door andere AI's (die fouten kunnen maken of kunnen liegen); ze werden geschreven door echte menselijke experts—mensen met gevorderde diploma's en jarenlange ervaring in de financiële wereld.
- De Mix: De test gebruikt tekst, afbeeldingen en video's samen. Je kunt het antwoord niet alleen door te lezen vinden; je moet de grafiek ook echt "zien" en de video "bekijken" om de context te begrijpen.
- De Omvang: Ze hebben bijna 4.000 van deze uitdagende vragen gemaakt in zowel het Engels als het Chinees.
3. De Resultaten: Wie is Geslaagd?
De onderzoekers hebben 10 van de slimste AI-modellen (de "studenten") door deze bootcamp gehaald. Dit is wat er gebeurde:
- De Beste Presteerder: Eén model, Gemini-3-pro-preview, kwam als winnaar uit de bus. Het had ongeveer 74% van de antwoorden goed. Dat klinkt goed, maar onthoud goed: dit is een zeer moeilijke test.
- De Kloof: Zelfs de beste AI maakte nog veel fouten in vergelijking met een menselijke expert, die ongeveer 90-95% goed had. De AI is goed in het lezen van de tekst, maar heeft moeite met het leggen van de verbanden tussen een video, een grafiek en een rapport.
- De Moeitepunten:
- Problemen met Rekenen: Veel modellen maakten fouten in de eenvoudige wiskunde.
- Hallucinaties: Sommige modellen bedachten feiten die er niet waren (zoals een student die een antwoord gokt omdat hij bang is om te zeggen "ik weet het niet").
- Het "Video"-probleem: Wanneer er video's bij betrokken waren, raakten de meeste modellen de weg kwijt. Ze konden het verhaal over een bepaalde tijdlijn niet goed volgen.
- De Eindbaas: In het moeilijkste niveau (Asset Allocation) zakte de prestatie van de AI aanzienlijk. Ze konden de informatie wel verzamelen, maar ze konden de uiteindelijke, complexe beslissing niet nemen zonder in de war te raken.
4. De Belangrijkste Conclusie
De paper concludeert dat hoewel AI erg goed wordt in het lezen en begrijpen van eenvoudige financiële gegevens, het nog niet klaar is om menselijke financiële experts te vervangen in complexe, real-world situaties.
Zie het zo: de AI is als een briljante student die een hele bibliotheek aan tekstboeken uit zijn hoofd kan leren. Maar wanneer je hem in een echte commandocentrale zet met een live videofeed, een trillende hand en een tikkende klok, raakt hij in paniek en maakt hij fouten.
De auteurs hebben UniFinEval gebouwd om ons precies te laten zien waar de AI faalt, zodat ontwikkelaars deze specifieke zwaktes kunnen repareren voordat ze deze modellen met echt geld vertrouwen. Ze zeiden niet dat AI binnenkort de aandelenmarkt zal besturen; ze zeiden: "Hier is een kaart van de kliffen, zodat we weten waar de AI waarschijnlijk van de rand zal vallen."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.