V4FinBench: Benchmarking Tabular Foundation Models, LLMs, and Standard Methods on Corporate Bankruptcy Prediction
Deze paper introduceert V4FinBench, een grootschalige benchmark met meer dan één miljoen bedrijfs-jaargegevens uit de economieën van de Visegrádgroep die is ontworpen om methoden voor de voorspelling van faillissementen te evalueren, en onthult dat een op onbalansgevoeligheid afgestemde, fijngefineerde TabPFN standaard gradient boosting en LLM's zoals Llama-3-8B overtreft bij het hanteren van ernstige klasseonbalans en meerhorizonvoorspelling.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een financieel rechercheur bent die probeert een bedrijf te spotten dat op het punt staat failliet te gaan. Het probleem is dat faillissementen vergelijkbaar zijn met het vinden van een naald in een hooiberg: ze zijn ongelooflijk zeldzaam, en de "hooiberg" (de gegevens over gezonde bedrijven) is enorm.
Lange tijd hadden rechercheurs alleen kleine, oude hooibergen om op te oefenen. Dit artikel introduceert een brandnieuwe, enorme hooiberg genaamd V4FinBench.
Hier is een eenvoudige uiteenzetting van wat de onderzoekers hebben gedaan, met behulp van alledaagse analogieën:
1. De nieuwe "oefenterrein" (De dataset)
Voorheen moesten onderzoekers die bedrijfsfalen wilden voorspellen werken met kleine datasets met slechts enkele duizenden records. Het was alsof je probeerde te leren hoe je een complex videospel speelt op een klein scherm met lage resolutie.
- De upgrade: De auteurs bouwden V4FinBench, een enorme dataset met meer dan 1,1 miljoen records van bedrijven uit vier Centraal-Europese landen (Polen, Hongarije, Tsjechië en Slowakije) over een periode van 15 jaar.
- De details: Ze keken niet alleen naar één jaar; ze bekeken hoe bedrijven presteerden van "nu" tot wel "vijf jaar in de toekomst".
- De label: Ze creëerden een strenge "Noodtoestandstest". Een bedrijf wordt alleen gemarkeerd als "in de problemen" als het op drie manieren tegelijk faalt: het schuldt meer dan het bezit (solvabiliteit), het maakt verlies (winstgevendheid) en het kan zijn directe rekeningen niet betalen (liquiditeit). Dit zorgt ervoor dat ze geen bedrijven markeren die slechts één slechte maand hebben.
2. De deelnemers (De modellen)
De onderzoekers stelden drie verschillende soorten "rechercheurs" op de proef om te zien wie de probleemveroorzakers het beste kon spotten:
- De oude schoolprofessionals (Gradient Boosting): Dit zijn traditionele, nauwkeurig afgestelde statistische modellen (zoals XGBoost). Denk aan hen als veteranen-rechercheurs die duizenden zaken hebben opgelost en precies weten welke aanwijzingen ze moeten zoeken.
- De nieuwe "TabPFN" (Het tabulaire basismodel): Dit is een nieuwere vorm van AI die specifiek is ontworpen voor spreadsheets. Stel je een rechercheur voor die elke financieel handboek ooit geschreven heeft gelezen en nieuwe zaken direct kan leren door naar een paar voorbeelden te kijken. Omdat faillissementen echter zo zeldzaam zijn, raakt deze rechercheur vaak in de war omdat ze zelden een "ziek" bedrijf in hun trainingsdata tegenkomen.
- De "Llama-3" (Het grote taalmodel): Dit is een gigantische AI die meestal wordt gebruikt voor het schrijven van verhalen of het beantwoorden van vragen. De onderzoekers probeerden het te leren financieel spreadsheets te lezen door rijen met getallen om te zetten in een verhaalformaat. Denk hierbij aan het vragen aan een briljante literatuurprofessor om de ziekte van een patiënt te diagnosticeren door alleen het medisch dossier als een roman te lezen.
3. De resultaten: Wie won?
De veteraanprofessionals versus de nieuwe TabPFN:
- Het probleem: Omdat faillissementen zo zeldzaam zijn (minder dan 1% van de data), werd de "TabPFN"-rechercheur aanvankelijk overweldigd door de zee van gezonde bedrijven. Het was alsof je probeerde een rode marmer te vinden in een emmer met een miljoen blauwe; de rechercheur zag voornamelijk blauw.
- De oplossing: De onderzoekers gebruikten een slimme truc genaamd "Prototype Undersampling". In plaats van de AI alle gezonde bedrijven te tonen, toonden ze haar een zorgvuldig geselecteerd, representatief voorbeeld daarvan. Het is alsof je de rechercheur een "best of"-album van gezonde bedrijven laat zien, zodat ze kan leren hoe "normaal" eruit ziet zonder zich te vervelen door de enorme hoeveelheid.
- Het resultaat: Met deze truc werd de TabPFN-rechercheur net zo goed als, of zelfs beter dan, de veteraanprofessionals in het opsporen van problemen 2 tot 5 jaar van tevoren.
De literatuurprofessor (Llama-3) versus de veteraanprofessionals:
- Het resultaat: Het Llama-3-model had aanzienlijke moeite. Zelfs nadat het was geleerd hoe het financieel "verhaal" moest lezen, kon het niet tippen aan de veteraanprofessionals. Het was bijzonder slecht in het voorspellen van problemen meer dan een jaar van tevoren.
- De les: Het omzetten van een spreadsheet in een verhaal hielp deze specifieke AI niet. Voor gestructureerde financiële data zijn de "veteraanprofessionals" en de gespecialiseerde "TabPFN" nog steeds de betere rechercheurs.
4. De "Transfer"-test
Om te zien of de TabPFN-rechercheur daadwerkelijk universele regels van financiën had geleerd of gewoon de specifieke eigenaardigheden van de Europese bedrijven had onthouden, testten de onderzoekers het op een volledig andere dataset uit de Verenigde Staten.
- Het resultaat: Het TabPFN-model, getraind op de Europese data, presteerde beter op de Amerikaanse data dan een standaard, niet-getrainde versie van zichzelf. Dit suggereert dat het algemene principes van financiële noodtoestand heeft geleerd, niet alleen lokale patronen.
Samenvatting
Het artikel zegt in wezen het volgende:
- We hebben een gigantisch, realistisch oefenterrein gebouwd voor het voorspellen van faillissementen van bedrijven.
- Nieuwe AI-modellen (TabPFN) kunnen oude methoden verslaan als je ze leert omgaan met het feit dat faillissementen zeldzaam zijn.
- Algemeen doel AI (Llama-3) is nog niet klaar om gespecialiseerde hulpmiddelen voor deze specifieke taak te vervangen.
- De vaardigheden die op deze data zijn geleerd, lijken over te gaan naar andere landen, wat suggereert dat het model echte financiële logica heeft geleerd.
Belangrijke opmerking: De auteurs benadrukken dat dit een onderzoeksbenchmark is. Het is een hulpmiddel voor wetenschappers om hun methoden te testen en te verbeteren, niet een hulpmiddel voor banken om zonder menselijk toezicht directe kredietbeslissingen te nemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.