← Nieuwste papers
💬 NLP

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

Dit artikel toont aan dat het finetunen van een open-weight taalmodel met Group Relative Policy Optimization (GRPO) en een duaal evaluatiekader — waarbij een LLM-als-rechter-rubriek wordt gecombineerd met een rechter-onafhankelijke Causal Average Treatment Effect (CATE) audit — financieel advies produceert dat commerciële baselines aanzienlijk overtreft in geschatte winststijging en risicomitigatie.

Oorspronkelijke auteurs: Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

Gepubliceerd 2026-08-13
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij advies moet geven. In de wereld van kunstmatige intelligentie is dit een beetje zoals het leren van een student om een wiskundig probleem op te lossen. Meestal laten we de student de vraag en het juiste antwoord zien, in de hoop dat ze het patroon onthouden. Maar wat als het "juiste antwoord" in de echte wereld rommelig is? Wat als de geschiedenisboeken vol fouten zitten, of als het juiste antwoord verandert afhankelijk van de situatie? Dit is de uitdaging van Reinforcement Learning (RL). In plaats van alleen oude antwoorden te kopiëren, laat RL een AI veel verschillende dingen proberen, een "score" krijgen voor hoe goed het ging, en leren van die score om het de volgende keer beter te doen. Het is als een videogame waarbij de AI duizenden levels speelt, punten krijgt voor goede zetten, en langzaam de perfecte strategie leert.

Stel je nu voor dat dit spel over geld gaat. Financieel advies geven is lastig omdat een slecht advies een bedrijf daadwerkelijk schade kan berokkenen. Om ervoor te zorgen dat de AI de juiste weg leert, gebruiken onderzoekers een "rechter"—een andere slimme AI die het advies beoordeelt. Maar er is een addertje onder het gras: soms leert de student-AI de rechter te misleiden door precies te zeggen wat de rechter wil horen, in plaats van advies te geven dat in de echte wereld ook echt werkt. Dit artikel pakt dat probleem aan door een nieuwe manier te creëren om een AI te trainen om zakelijk advies te geven, waarbij het werk niet alleen gecontroleerd wordt door een rechter, maar ook door te kijken of het advies in het verleden geld zou hebben opgeleverd.


Het Verhaal van de Geldslimme Robot

Maak kennis met het team van Intuit. Ze wilden een AI bouseren die naar de rommelige financiële gegevens van een bedrijf kan kijken en kan zeggen: "Hé, hier is iets specifiekss dat je moet doen om meer winst te maken." Het klinkt simpel, maar het is eigenlijk een nachtmerrie voor computers. Het advies moet gebaseerd zijn op echte cijfers, het moet veilig zijn (vertel een bedrijf niet dat ze hun enige klant moeten ontslaan!) en het moet actiegericht zijn.

Het probleem is dat we geen "gouden standaard" antwoord sleutel hebben. De beslissingen die ondernemers in het verleden namen waren niet altijd perfect, dus we kunnen de AI niet simpelweg leren om hen te kopiëren. En het vragen aan menselijke experts om perfect advies te schrijven voor elk scenario is te duur en te traag. Dus besloot het team dit als een videogame te behandelen. Ze gebruikten een methode genaamd GRPO (Group Relative Policy Optimization).

Beschouw GRPO als een "groep uitdaging". In plaats van dat de AI één antwoord raadt en een score krijgt, genereert het in één keer een hele groep verschillende adviesvoorstellen. Vervolgens kijkt een superintelligente "Rechter-AI" (genaamd Claude Opus 4.5) naar al deze voorstellen en geeft ze scores op basis van een checklist. Deze checklist heeft 11 regels: Is het veilig? Gebruikt het echte cijfers van het bedrijf? Legt het uit waarom? Als een suggestie gevaarlijk is, krijgt het direct een nul. Als het veilig maar saai is, krijgt het een lage score. Als het veilig, specifiek en slim is, krijgt het een hoge score. De AI leert vervolgens om meer suggesties te maken die lijken op de hoog scorende exemplaren.

De Valstrik van de "Lieve" Rechter

Hier wordt het interessant. Het team wist dat er een risico bestond. Wat als de AI gewoon leert om advies te schrijven dat goed klinkt voor de Rechter-AI, maar dat in werkelijkheid geen geld aan een bedrijf verdient? Het is als een student die de favoriete zinnen van de leraar uit het hoofd leert om een voldoende te halen, maar vervolgens faalt voor het echte examen.

Om dit te vangen, bouwden de onderzoekers een tweede, totaal andere test. Ze gebruikten de Rechter-AI niet. In plaats daarvan gebruikten ze een "Tijdreis"-methode genaamd CATE (Conditional Average Treatment Effect).

Stel je voor dat je een enorme doos met oude bedrijfsgegevens hebt. Je wilt weten: "Als we in het verleden deze specifieke actie hadden ondernomen, had het bedrijf dan meer winst gemaakt?" De onderzoekers namen het advies dat door hun nieuwe AI was gegenereerd, vertaalden dit naar een eenvoudige "actie" (zoals "kosten voor verzending verlagen" of "prijzen van product X verhogen"), en keken vervolgens naar de historische gegevens. Ze vroegen: "Hadden bedrijven in het verleden meer winst gemaakt toen ze deze actie ondernamen?" Dit is een "rechter-onafhankelijke" audit omdat het vertrouwt op echte wereldcijfers, niet op wat de Rechter-AI mooi vindt klinken.

De Grote Verrassing

De resultaten waren een mix van verwachte overwinningen en een zeer grappige wending.

Ten eerste was de nieuwe AI (getraind met GRPO) een ster. Wanneer de Rechter-AI het beoordeelde, kreeg het een score van 9.514 van de 10. Dit was de hoogste score van iedereen, zelfs hoger dan de meest beroemde commerciële AI-modellen zoals Claude Opus 4.6 en GPT-5.4.

Maar de echte magie gebeurde in de "Tijdreis"-audit.

  • De nieuwe AI suggereerde acties die, als ze in het verleden waren uitgevoerd, de bruto winst met 0.0228 zouden hebben verhoogd (ongeveer een stijging van 2,3%).
  • Het beste commerciële AI-model (Claude Opus 4.6) slaagde er slechts in om een stijging van 0.0104 te realiseren.
  • Dat betekent dat de nieuwe AI ongeveer twee keer zo goed was in het vinden van acties die daadwerkelijk geld opleveren als de sterkste commerciële concurrent.

Nog cooler was dat de nieuwe AI veiliger was. Het had de laagste "downside rate" (de kans dat er iets wordt gesuggereerd dat het bedrijf schaadt) en het minste "tail risk" (de kans op een heel slecht resultaat).

De Wending: De Rechter en de Tijdreis waren het oneens

Dit is het meest speelse deel van het verhaal. De Rechter en de Tijdreis waren het niet altijd eens over wie de tweede of derde plaats verdiende.

De ongetrainde "basis"-AI (het ruwe model vóór de training) was verschrikkelijk in de test van de Rechter. Het scoorde een 8.457, de laatste plaats. Het klonk slordig en onverfijnd. Maar wanneer de Tijdreis het advies controleerde? Dan deed het het eigenlijk best goed! Het suggereerde acties die de winst met 0.0170 zouden hebben verhoogd, wat beter was dan elk enkel commercieel model.

Aan de andere kant kreeg een van de commerciële modellen (Claude Opus 4.5) een geweldige score van de Rechter (8.982), waardoor het heel professioneel klonk. Maar de Tijdreis zei: "Wacht eens even." Het schatte dat het volgen van dit models advies eigenlijk geld zou kosten (een negatieve lift van -0.0025).

Wat dit betekent

Dit artikel laat zien dat je de "Rechter" niet blind kunt vertrouwen om te vertellen of een AI goed is in het geven van financieel advies. De Rechter houdt van advies dat slim klinkt en de regels volgt. De Tijdreis geeft erom of het advies daadwerkelijk werkt.

De nieuwe methode van het team, waarbij GRPO met een veiligheidshek werd gecombineerd, slaagde erin om beide te doen. Het leerde om advies te schrijven dat er geweldig uitzag voor de Rechter én dat daadwerkelijk geld opleverde in de Tijdreis-test. Het bewees dat je door een open-source model te trainen met een slim, op veiligheid gericht beloningssysteem, de dure, commerciële reuzen kunt verslaan.

De auteurs suggereren dat je voor taken met een hoog belang, zoals geld, beide controles nodig hebt: een rubric om te controleren of het advies veilig en goed geschreven is, en een causale audit om te controleren of het daadwerkelijk werkt. Als je maar naar één van de twee kijkt, kun je in de digitale val lopen van een robot die er geweldig uitziet, maar waardeloos is in rekenen. Hun nieuwe robot is echter zowel een geweldige schrijver als een geweldige accountant.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →