← Nieuwste papers
💰 quantitative finance

Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?

Deze studie evalueert het gebruik van grote taalmodellen als post-hoc uitlegbaarheidstools voor kredietrisicomodellen en concludeert dat hoewel zij betrouwbaar de rangschikking van feature-belangrijkheid kunnen reproduceren onder gecontroleerde prompts, zij het beste kunnen worden ingezet als narratieve interfaces in plaats van als vervanging voor formele attributiemethoden vanwege beperkte afstemming in autonome verklaringgeneratie.

Oorspronkelijke auteurs: Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een leningsofficier bent bij een bank. Je hebt een superintelligente, maar mysterieuze computerrobot (een "machine learning model") die beslist wie wel en wie geen lening krijgt. Deze robot is geweldig in het voorspellen wie het geld zal terugbetalen, maar het is een "black box". Het geeft alleen een "Ja" of "Nee", en spreekt geen menselijke taal. Het geeft je alleen een lijst met getallen: "Deze factor telde voor 5% mee, die andere voor 3%."

Toch willen toezichthouders en klanten geen spreadsheet met cijfers zien. Ze willen een verhaal: "We hebben deze lening geweigerd omdat de aanvrager te veel schulden heeft en een wankele loopbaan heeft."

Hier komen Large Language Models (LLM's) om de hoek kijken. Zie dit als de "vertalers" of "verhalenvertellers" van de AI-wereld. Zij zijn degene die die saaie getallen kunnen omzetten in een vriendelijke, leesbare paragraaf.

Dit paper stelt een zeer specifieke vraag: Kunnen we deze AI-verhalenvertellers vertrouwen om de waarheid te vertellen over waarom de robot een beslissing heeft genomen?

De onderzoekers hebben twee verschillende tests opgezet om dit uit te zoeken, gebruikmakend van echte leninggegevens van LendingClub.

Test 1: De "Dictatie"-test (Kan de LLM opdrachten opvolgen?)

De Opzet: De onderzoekers gaven de AI-verhalenverteller de exacte lijst met redenen die de robot gebruikte, gerangschikt van meest belangrijk naar minst belangrijk. Vervolgens vroegen ze de AI: "Hier is de lijst met redenen. Schrijf deze lijst om tot een verhaal, maar zorg ervoor dat je exact dezelfde volgorde aanhoudt."

Het Resultaat: De AI-verhalenvertellers waren perfect.
Stel je een strenge leraar voor die een leerling een lijst met 24 ingrediënten geeft en zegt: "Schrijf een recept met deze ingrediënten, in precies deze volgorde." De AI deed precies dat. Het veranderde de ingrediënten niet, vergat er geen enkele en voegde geen eigen ideeën toe. Het vertaalde de "getallenlijst" van de robot trouw naar een "woordenlijst" zonder de betekenis te veranderen.

De Les: Als je de AI de feiten geeft, is de AI uitstekend in het omzetten van deze in een voor mensen leesbaar verhaal. Het fungeert als een zeer betrouwbare secretaresse.

Test 2: De "Detective"-test (Kan de AI het zelf uitzoeken?)

De Opzet: Dit keer gaven de onderzoekers de AI niet de lijst met redenen. Ze gaven de AI alleen de gegevens van de aanvrager (inkomen, kredietscore, etc.) en de beslissing van de robot. Ze vroegen de AI: "Op basis van de gegevens van deze persoon, wat denk JIJ dat de belangrijkste redenen voor deze beslissing zijn?"

Het Resultaat: De AI-verhalenvertellers struikelden.
Stel je voor dat je een detective vraagt een misdaad op te lossen zonder het politierapport te laten zien. De AI probeerde de redenen te raden op basis van algemene kennis over de wereld (zoals: "Oh, meestal is een hoge schuld slecht").

  • Het Probleem: De robot maakt beslissingen op basis van complexe, verborgen patronen die verschillen van de algemene menselijke logica. De gissingen van de AI misten vaak het doel.
  • De "Few-Shot"-truc: De onderzoekers probeerden de AI te helpen door eerst twee voorbeelden te tonen (zoals: "Hier is hoe we een 'Ja'-lening hebben uitgelegd, en hier is hoe we een 'Nee'-lening hebben uitgelegd"). Dit hielp een beetje, maar de AI kon nog steeds niet perfect overeenkomen met de werkelijke redenering van de robot, vooral bij de complexere robotmodellen.

De Les: Wanneer de AI probeert als een detective op te treden en de redenen zelf uit te zoeken, gaat het verhaal vaak niet kloppen. De AI kan plausibele redenen kiezen, maar dit zijn niet de werkelijke redenen die de robot gebruikte.

Het Eindoordeel: De "Vertaler" versus de "Detective"

Het paper komt tot een duidelijke regel voor het gebruik van deze tools in de bankwereld:

  1. Gebruik de AI NIET als een Detective: Je kunt de AI niet laten raden waarom een lening is geweigerd. Als je dat doet, geef je een klant misschien een reden die goed klinkt, maar die eigenlijk onjuist is. Dit is gevaarlijk voor de regelgeving en het vertrouwen.
  2. Gebruik de AI WEL als een Vertaler: Je kunt de AI gebruiken om de officiële, wiskundig bewezen redenen (berekend door de robot) om te zetten in een prettig leesbare brief voor de klant.

De Metafoor:
Zie het Machine Learning Model als een Chef die een complex gerecht bereidt.

  • De AI-vertaler is een Voedselcriticus die uitstekend in staat is om het gerecht te beschrijven, mits de Chef het recept aan hen geeft. Zij kunnen een prachtige menubeschrijving schrijven.
  • Maar als je de Voedselcriticus vraagt om het recept te raden door alleen het eten te proeven (zonder de hulp van de Chef), zullen ze waarschijnlijk de ingrediënten fout hebben.

Kortom: Large Language Models zijn geweldig in het omzetten van wiskunde naar woorden, maar ze zijn erg slecht in het vooraf raden van de wiskunde zelf. In het gebied van kredietrisico moet je altijd de wiskunde (de robot) laten beslissen over de redenen, en de AI alleen het verhaal laten schrijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →