FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation
Dit artikel introduceert FinDocMRE, een uitgebreide benchmark op documentniveau voor meerdere afbeeldingen met meer dan 12.000 voorbeelden uit financiële verslagen om de beperkingen van huidige grote multimodale modellen bij het integreren van tekst, tabellen en afbeeldingen voor complexe financiële redenering strikt te evalueren en bloot te leggen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een nieuwe financieel analist inhuurt. Je hebt een massaal, 100 pagina's tellend rapport vol met tekst, complexe spreadsheets en kleurrijke grafieken die verspreid liggen over verschillende pagina's. Je wilt zien of je nieuwe medewerker het grote geheel kan overzien, verbanden kan leggen tussen een grafiek op pagina 5 en een tabel op pagina 40, en de rekenkunde correct uitvoert om je een nauwkeurig antwoord te geven.
Dat is precies waar dit paper, FinDocMRE, over gaat. Het is een gigantisch "eindexamen" ontworpen om te testen hoe goed Kunstmatige Intelligentie (AI) deze rommelige, real-world financiële documenten aankan.
Hier is een uiteenzetting van wat de onderzoekers deden en wat ze vonden, met gebruikmaking van eenvoudige analogieën:
1. Het Probleem: De "Enkele Grafiek"-Valstrik
Tot nu toe waren de meeste AI-tests vergelijkbaar met het tonen van een enkel, geïsoleerd rekenprobleem op een vel papier aan een student. De AI kon dit gemakkelijk oplossen. Maar in de echte financiële wereld is informatie niet geïsoleerd. Het is als een puzzel waarvan de stukjes verspreid liggen over een heel boek.
- Het Probleem: Bestaande AI-modellen zijn uitstekend in het bekijken van één grafiek en zeggen: "Oh, die lijn gaat omhoog." Maar ze hebben moeite wanneer ze worden gevraagd: "Neem het getal uit de grafiek op pagina 10, vermenigvuldig het met het percentage in de tabel op pagina 30, en vertel me de totale kosten."
- Het Gat: Er was geen grote, zware test die AI dwong tot dit soort "documentniveau"-redenering.
2. De Oplossing: Het Bouwen van het "FinDocMRE"-Examen
Het team creëerde een enorme nieuwe benchmark (een testset) genaamd FinDocMRE. Denk hierbij aan het bouwen van een sportschool voor AI om zware lasten te tillen.
- De Dataset: Ze verzamelden 2.878 echte financiële rapporten (zoals jaarverslagen van grote bedrijven) en haalden 12.207 specifieke vragen uit deze documenten.
- Het "Recept" voor Kwaliteit: Ze vroegen niet zomaar aan een computer om vragen te schrijven, omdat computers soms feiten verzinnen (een probleem genaamd "hallucinatie"). In plaats daarvan gebruikten ze een drie-staps recept:
- De Robot-Kok: Een AI genereerde de vragen uitsluitend op basis van de afbeeldingen en grafieken, waarbij de omringende tekst werd genegeerd om het te dwingen de data te "zien".
- De Menselijke Proeverij: Drie echte financiële experts (zoals senior analisten) beoordeelden elke enkele vraag. Als de vraag verwarrend was, de wiskunde fout was, of de verwijzing naar de grafiek niet klopte, werd deze in de prullenbak gegooid.
- De Finale Selectie: Slechts ongeveer 55% van de gegenereerde vragen haalde de selectie. Dit zorgde ervoor dat het eindexamen ongelooflijk hoogwaardig en moeilijk was.
3. De Resultaten: De "Analist versus Rekenmachine"-Splitsing
De onderzoekers testten 11 van de slimste beschikbare AI-modellen (inclusief grote namen zoals GPT-5, Gemini en Qwen) tegen dit examen. Ze haalden ook echte menselijke financiële experts erbij om te zien hoe de AI zich verhoudt.
Hier is wat ze ontdekten:
- Het Scorebord: Het beste AI-model scoorde slechts ongeveer 64 van de 100. De menselijke experts scoorden ongeveer 79. Er is nog steeds een enorm gat.
- De "Verhaler" versus de "Rekenwonder":
- Goed in Verhalen: De AI-modellen zijn verrassend goed in het schrijven van lange, samenhangende samenvattingen. Als je vroeg: "Wat is de algemene trend van dit bedrijf?", konden ze een geweldig alinea schrijven.
- Slecht in Wiskunde & Navigatie: Wanneer ze werden gevraagd om nauwkeurige berekeningen te maken of een specifiek getal te vinden dat verborgen zat in een grafiek op pagina 45 terwijl ze keken naar een grafiek op pagina 5, faalden ze vaak. Ze zouden de getallen verkeerd hebben of verwisselen welke grafiek bij welk jaar hoorde.
- Het "Verloren in het Midden"-Effect: Naarmate de documenten langer werden en de AI meer afbeeldingen moest bekijken (zoals 3 of 4 verschillende grafieken tegelijk), daalde de prestatie van de AI. Het is als proberen drie verschillende telefoonnummers tegelijk te onthouden; hoe meer je toevoegt, hoe waarschijnlijker het is dat je ze door elkaar haalt.
4. De Grote Conclusie
Het paper concludeert dat hoewel AI beter wordt in het "zien" en "praten", het nog steeds moeite heeft om te handelen als een professionele financieel analist.
- De Knelpunt: Het hoofdprobleem is niet dat de AI de woorden niet kan lezen; het is dat het zijn redenering niet betrouwbaar kan verankeren in het specifieke visuele bewijs dat verspreid ligt over een complex document. Het is als een student die de theorie van de boekhouding kent, maar steeds naar de verkeerde regel op de spreadsheet kijkt tijdens het rekenen.
Kortom: FinDocMRE is een rigoureuze stress-test die laat zien dat huidige AI een geweldige "opstelschrijver" is, maar een wankel "rekenmachine" als het gaat om complexe, meerpagina's tellende financiële rapporten. Het paper suggereert dat AI, om menselijke analisten echt te vervangen, veel beter moet worden in het navigeren door deze visuele puzzels zonder verdwaald te raken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.