Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval
Het DS@GT-team stelt een taalgerouteerde, retrieval-augmented pijplijn voor voor meertalige financiële QA die BGE-M3-embeddings combineert met gewogen Reciprocal Rank Fusion en directe optie-scoring via next-token log-waarschijnlijkheden, waarmee wordt aangetoond dat optimale prestaties een taalspecifieke modelselectie en het zorgvuldig vermijden van chain-of-thought prompting voor bepaalde talen vereisen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een lastige puzzel op te lossen, maar in plaats van alleen je eigen brein te gebruiken, heb je een enorme bibliotheek met naslagwerken direct naast je staan. Dit is de wereld van Retrieval-Augmented Generation (RAG). Denk aan een student die een toets maakt waarbij hij de toestemming heeft om feiten in een tekstboek op te zoeken voordat hij antwoord geeft. Meestal zijn computers hier erg goed in als de vragen in het Engels zijn, maar het wordt een rommeltje wanneer de vragen in het Spaans, Grieks of Hindi zijn. De "bibliotheek" kan vol staan met Engelse boeken maar leeg zijn voor andere talen, en de student kan misschien niet eens de buitenlandse boeken lezen, zelfs als hij ze vindt.
Dit artikel behandelt een zeer specifieke, cruciale versie van dit probleem: Financiële Certificeringsexamens. Dit zijn niet zomaar trivia; het zijn complexe toetsen om een gecertificeerd financieel analist of accountant te worden, die diepe logica vereisen over geld, wetten en boekhoudregels. De grote vraag die de auteurs stellen is: Kunnen we een computersysteem bouren dat deze moeilijke financiële examens in vijf verschillende talen (Engels, Spaans, Grieks, Chinees en Hindi) net zo goed doorstaat als in het Engels? Het antwoord is van belang omdat financiën globaal zijn, maar de meeste "computerbreinen" voornamelijk op Engels zijn getraind, wat enorme hiaten achterlaat in hoe ze met financieel jargon in andere talen omgaan.
Het Grote Experiment van het Team: Een Slimme, Meertalige Detective
De onderzoekers van Georgia Tech, die hun team DS@GT noemen, bouwden een digitaal detectivesysteem om deze financiële examenvragen op te lossen. In plaats van simpelweg te gokken, volgt hun systeem een strikt driestappenproces, dat ze een "pipeline" noemen.
Stap 1: De Taaldetective
Eerst kijelt het systeem naar de vraag en vraagt het: "Welke taal is dit?" Het is als een uitsmijter bij een club die ID-kaarten controleert. Als de vraag in het Grieks is, weet het systeem dat het boeken uit de "Griekse Sectie" van zijn bibliotheek moet halen. Als de bibliotheek leeg is voor die taal (wat gebeurt bij kleinere talen zoals Grieks of Hindi), pakt het boeken uit de "Globale Sectie" die mogelijk vergelijkbare ideeën bevatten, zelfs als ze in een andere taal zijn. Ze gebruikten een speciale tool genaamd BGE-M3 om de betekenis van de vragen te vertalen naar een universele code, zodat het systeem relevante voorbeelden kon vinden, zelfs over taalgrenzen heen.
Stap 2: De Model Router (Het "Rechterbrein" voor de Juiste Taak)
Hier ontdekte het team iets verrassends. Ze gebruikten niet zomaar één gigantisch computerbrein voor alles. Ze ontdekten dat verschillende computerbreinen beter zijn in verschillende talen.
- Voor Engels gebruikten ze een model genaamd Qwen2.5-14B.
- Voor Grieks vonden ze verrassend genoeg dat een kleiner model, Llama-3.1-8B, de echte superster was en de grotere modellen met een enorme marge versloeg (ongeveer 19,5 procentpunt!).
- Voor Chinees, Hindi en Arabisch gebruikten ze Qwen3-14B.
Als ze simpelweg het "beste" model voor iedereen hadden gebruikt, zou hun systeem op Engels en Grieks hopeloos gefaald hebben. Het is alsof je beseft dat hoewel een marathonloper geweldig is voor lange afstanden, je die persoon niet wilt laten schaken; je hebt een andere specialist nodig voor elke taak.
Stap 3: De Scorer (Geen Gokspelletjes Meer)
Normaal gesproken, wanneer computers vragen beantwoorden, proberen ze het antwoord te "schrijven", zoals "Het antwoord is C." Dit leidt vaak tot fouten waarbij de computer een lang verhaal schrijft en vergeet te vermelden welke letter hij heeft gekozen. Het DS@GT-team gebruikte een slimme truc genaamd Retrieval-Augmented Direct Scoring (RADS). In plaats van het antwoord te schrijven, controleert het systeem simpelweg de wiskunde: "Hoe waarschijnlijk is het dat de letter 'A' het volgende woord is? Hoe waarschijnlijk is 'B'? Hoe waarschijnlijk is 'C'?" Het kiest de letter met de hoogste wiskundige score. Dit is als een meerkeuzetoets waarbij de computer geen essay hoeft te schrijven; hij wijst gewoon naar het juiste vakje. Deze methode elimineerde bijna alle "parse failures" (fouten in het lezen van het eigen antwoord van de computer) en behaalde een slagingspercentage van 100% op Chinese vragen waar andere methoden moeite mee hadden.
De Verrassende Ontdekkingen
Het team voerde duizenden tests uit en vond enkele regels die de gebruikelijke ideeën over hoe AI werkt, doorbreken:
- Te veel nadenken kan slecht zijn: Voor de meeste mensen helpt "Chain-of-Thought" (de AI vragen om zijn redenering stap voor stap uit te leggen) wel. Maar voor Griekse vragen vernietigde dit de prestaties juist. De nauwkeurigheid daalde van een fantastische 90,7% naar een verschrikkelijke 20,9%. Het blijkt dat voor deze specifieke Griekse vragen, die meer gaan over het categoriseren van feiten dan over het oplossen van wiskundige problemen, het "hardop denken" de AI in de war bracht. De AI begon verhalen te schrijven in plaats van de juiste categorie te kiezen.
- De "Denkmodus"-val: Het model Qwen3 heeft een standaardinstelling waarbij het een "denksectie" schrijft voor het antwoord. Het team ontdekte dat als ze dit aan lieten staan, het vermogen van het systeem om het juiste letter te kiezen (RADS) voor Arabisch instortte tot bijna willekeurig gokken. Ze moesten deze "denkmodus" handmatig uitzetten om het systeem te laten werken.
- Vertaling is een valstrik: Ze probeerden vragen uit andere talen naar het Engels te vertalen, ze op te lossen en weer terug te vertalen. Dit was een ramp. De vertaling verloor belangrijke financiële details, en de scores daalden met bijna 20 procentpunt vergeleken met het oplossen van de vragen in de oorspronkelijke taal.
- Data doet ertoe, maar Modellen doen er meer toe: Voor Hindi hielp het toevoegen van meer inheemse Hindi-voorbeelden aan hun bibliotheek wel, maar slechts een klein beetje (ongeveer 1 procentpunt). Echter, de kloof tussen hun systeem en de beste commerciële AI (Claude Opus 4.7) was enorm (17 procentpunt). Dit suggereert dat voor talen met weinig middelen (low-resource languages), het probleem niet alleen het hebben van meer boeken in de bibliotheek is; het is dat het computerbrein zelf dieper getraind moet zijn op die specifieke financiële termen in die taal.
De Eindscore
Toen het team hun systeem indiende voor de officiële FinMMEval 2026 competitie, deden ze het goed en eindigden ze in de top 10 voor de meeste talen.
- Arabisch: 76,0% (10e plaats)
- Hindi: 73,5% (7e plaats)
- Engels: 69,5% (9e plaats)
- Chinees: 64,5% (9e plaats)
Hoewel ze niet de eerste plaats wonnen (de topteams scoorden boven de 90%), bewees hun werk een cruciale les: Eén maat past niet voor iedereen. Om een slimme financiële AI te bouwen die wereldwijd werkt, kun je niet zomaar één model en één strategie gebruiken. Je moet verschillende talen naar verschillende modellen routeren, verschillende denkstrategieën kiezen op basis van de taak, en antwoorden wiskundig scoren in plaats van ze uit te schrijven. De toekomst van wereldwijde financiële AI gaat niet over één enkel superbrein; het gaat over een team van specialisten, die elk de juiste taal spreken en de juiste tools gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.