IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text
Dit paper introduceert IndiaFinBench, het eerste publiek beschikbare evaluatiekader voor de prestaties van grote taalmodellen op Indiase financiële regelgeving, dat een dataset van 406 door experts geannoteerde vraag-antwoordparen bevat en aantoont dat de onderzochte modellen aanzienlijk beter presteren dan een niet-specialistische menselijke baseline.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek hebt, maar dan niet met sprookjes of romans, maar met de regels en wetten van de Indiase financiële wereld. Denk aan documenten van de Indiase centrale bank (RBI) en de effectenbeurs-commissie (SEBI). Deze documenten zijn vaak saai, vol met moeilijke getallen, en zitten vol met regels die veranderen als je er niet goed naar kijkt.
Tot nu toe konden slimme computers (zoals de bekende AI's) alleen goed lezen in de "Westerse bibliotheek" (VS en Europa). Ze wisten alles over Amerikaanse bedrijven, maar waren vaak verdwaald in de Indiase regels.
IndiaFinBench is een nieuw examen dat is ontworpen om te testen hoe goed deze AI's de Indiase financiële regels begrijpen. Hier is hoe het werkt, vertaald naar alledaagse taal:
1. Het Examen: Een "Indiase Rijbewijstest" voor AI
Stel je voor dat je een AI wilt testen of het een goede "Indiase bankmedewerker" kan zijn. Je geeft het een examen met 406 vragen die zijn gebaseerd op echte documenten. De vragen zijn verdeeld in vier soorten:
- Regels uitleggen: "Wat is de maximale dividenduitkering voor een kleine bank?" (Zoek het antwoord in de tekst).
- Rekenen: "Als de winst X is en de belasting Y, hoeveel mag er dan worden uitgekeerd?" (De AI moet echt rekenen, niet gokken).
- Tegenstrijdigheden vinden: "Zeggen deze twee documenten iets tegenovergestelde?" (Zoals een detective die kijkt of twee getuigen elkaar tegenspreken).
- Tijdsreizen: "Welke versie van de wet gold in 2019?" (De Indiase regels worden vaak aangepast; de AI moet weten welke versie op welk moment geldig was).
2. De Kandidaten: De "AI-klasse"
De onderzoekers hebben 12 verschillende AI-modellen op dit examen laten zitten.
- Sommige zijn gigantisch en krachtig (zoals Gemini 2.5 Flash en LLaMA-3.3-70B).
- Sommige zijn kleiner en lichter (zoals Gemma 4 E4B).
- Ze kregen allemaal dezelfde opdracht: "Gebruik alleen de tekst die ik je geef. Raad niet en gebruik geen buitenkennis."
3. De Uitslag: Wie is de beste?
De resultaten waren verrassend:
- De Winnaar: Gemini 2.5 Flash scoorde het hoogst (ongeveer 90% goed). Het was als de slimste student die alles precies las.
- De Verrassing: Een kleiner model, Llama 4 Scout, deed het bijna even goed als een veel groter en zwaarder model (LLaMA-3.3-70B). Dit is alsof een kleine, wendbare racefiets net zo snel gaat als een zware vrachtwagen. Het bewijst dat kwaliteit van training belangrijker kan zijn dan alleen grootte.
- De Teleurstelling: Een model dat bekend staat om zijn "redeneerkracht" (DeepSeek R1) deed het verrassend slecht. Het leek alsof het te veel zat te "nadenken" en de simpele feiten uit de tekst miste.
- De Menselijke Vergelijking: Zelfs de slechtste AI scoorde beter dan een gemiddelde mens die geen expert is (ongeveer 60% goed). Maar de beste AI's waren ver boven de mens uit.
4. Waar struikelden ze? (De "Valkuilen")
De onderzoekers keken waar de AI's fouten maakten. Het was alsof ze de fouten in de examenbladen analyseerden:
- Tijdsrekenen was het lastigst: De Indiase regels zijn als een ingewikkeld web van oude en nieuwe regels. De AI's raakten vaak de draad kwijt: "Welke regel gold er precies op die datum?"
- Rekenen ging vaak mis: Zelfs de slimste modellen maakten fouten bij het rekenen met specifieke Indiase bedragen en percentages.
- Kleine modellen wisten niet genoeg: De kleinere AI's wisten vaak niet wat bepaalde Indiase termen betekenden (zoals "AIF" of "FEMA"). Ze probeerden het te raden, wat leidde tot fouten.
Waarom is dit belangrijk?
Vroeger dachten we dat AI's overal goed in waren omdat ze veel Engels hadden gelezen. Dit onderzoek laat zien dat AI's soms "blind" zijn voor specifieke regio's. Net zoals een auto die perfect rijdt op de Duitse Autobahn, niet per se goed rijdt op de smalle, kronkelende wegen van een Indiase stad.
Conclusie:
IndiaFinBench is een noodzakelijke "reality check". Het laat zien dat we AI's niet zomaar kunnen vertrouwen op complexe financiële regels in landen buiten de VS, tenzij we ze specifiek trainen en testen op die lokale regels. Het is een hulpmiddel om ervoor te zorgen dat de AI's die onze geldzaken controleren, de lokale wetten écht begrijpen en niet alleen maar "gokken".
De hele dataset en de resultaten zijn nu openbaar beschikbaar, zodat iedereen (onderzoekers, ontwikkelaars, en zelfs de AI's zelf) kan leren van deze fouten en beter kan worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.