Predicting Bank Customer Churn Using a Random Forest Classifier With Engineered Risk Features
Deze studie ontwikkelt en implementeert een interactief Streamlit-dashboard met een Random Forest-classifier, verrijkt met engineered risicofactoren, om het verloop van bankklanten nauwkeurig te voorspellen, waarbij hoge prestatiecijfers worden behaald en bruikbare, verklaarbare inzichten voor retentie aan relatiemanagers worden geboden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van het bankwezen wordt geld niet alleen verplaatst; het wordt in vertrouwen beheerd. Maar dat vertrouwen is fragiel. Voor een retailbank is de duurste fout niet het verstrekken van een slechte lening, maar het verliezen van een goede klant. Het werven van een nieuw persoon om een rekening te openen kost aanzienlijk meer dan het tevreden houden van een bestaande klant. Deze realiteit heeft klantbehoud veranderd in een strategisch spel van hoge inzet waarbij voorspelling centraal staat. Banken kijken nu naar het verleden om de toekomst te raden, door een eenvoudige maar vitale vraag te stellen: welke van onze klanten staat op het punt om weg te lopen? Om dit te beantwoorden, hebben onderzoekers zich gericht op machine learning, een vakgebied waar computers leren patronen te herkennen in enorme hoeveelheden gegevens zonder dat ze expliciet voor elke regel geprogrammeerd hoeven te worden. In plaats van een menselijke analist die duizenden dossiers leest, scant een computer op subtiele signalen — zoals een plotselinge daling in de activiteit van de rekening of een specifieke leeftijdsgroep — die vaak voorafgaan aan een vertrek. Het doel is om deze signalen vroegtijdig op te merken om zo in te grijpen, door hulp of een beter aanbod te bieden voordat de klant al besloten heeft te vertrekken.
Een recente studie door Amula Venkatesh en Dr. Indira aan het Chaitanya Bharathi Institute of Technology in India pakt deze uitdaging rechtstreeks aan. Zij richtten zich op een dataset van 10.000 klanten van een Europese bank, een groep waarvan er bijna 38 procent de bank al had verlaten, een cijfer dat een aanzienlijk verlies aan omzet vertegenwoordigt. De onderzoekers bouwden een digitaal systeem dat ontworpen is om te voorspellen wie de volgende zal zijn die vertrekt. Ze vertrouwden niet op één enkele, eenvoudige regel, zoals "als het saldo laag is, zullen ze vertrekken." In plaats daarvan gebruikten ze een methode genaamd een Random Forest. Stel je een bos van beslissingsbomen voor, waarbij elke boom naar de gegevens van de klant kijkt vanuit een iets andere invalshoek. De ene boom focust misschien op leeftijd, een andere op het aantal creditcards dat ze bezitten, en een derde op hun locatie. Door de meningen van honderden van deze bomen te combineren, bereikt het systeem een consensus die veel nauwkeuriger en betrouwbaarder is dan wat een enkele boom alleen zou kunnen bieden.
Om dit systeem scherper te maken, voerden de onderzoekers niet alleen de ruwe cijfers uit de bankgegevens in. Ze creëerden nieuwe, "engineered" aanwijzingen door bestaande feiten met elkaar te combineren. Ze berekenden hoeveel van het salaris van een klant op de bankrekening stond, een ratio die onthult hoe afhankelijk die persoon is van die specifics bank. Ze keken naar hoeveel producten een klant bezat in verhouding tot hoe lang zij al klant waren, wat het tempo van hun betrokkenheid mat. Ze vermenigvuldigden zelfs de leeftijd van een klant met het aantal jaren dat zij bij de bank waren, om te zien of een levensfase een rol speelde in hun loyaliteit. Deze nieuwe combinaties fungeerden als een vergrootglas, waardoor verborgen relaties zichtbaar werden die de ruwe gegevens alleen hadden gemist. Toen de computer werd getraind op deze verrijkte informatie, leerde hij de tekenen van vertrek met opmerkelijke helderheid te zien.
De resultaten van deze training waren indrukwekkend. Wanneer het systeem werd getest op een groep klanten die het nog nooit eerder had gezien, identificeerde het met 91,4 procent nauwkeurigheid wie zou blijven en wie zou vertrekken. Belangrijker nog, het ving 87,8 procent van de mensen die daadwerkelijk van plan waren te vertrekken, een cruciale metriek voor een bank die haar klanten wil behouden. Het systeem presteerde beter dan oudere, eenvoudigere methoden zoals basis lineaire modellen of enkele beslissingsbomen, en kwam zeer dicht in de buurt van de prestaties van veel complexere en rekenintensievere systemen. De onderzoekers ontdekten dat leeftijd de sterkste individuele voorspeller van vertrek was, gevolgd door hoe actief een klant gebruikmaakt van hun producten. Ze ontdekten ook dat klanten in Duitsland bijna twee keer zo snel vertrokken als die in Frankrijk of Spanje, een regionaal verschil dat suggereert dat lokale factoren een rol spelen.
Misschien wel het meest significante deel van dit werk is niet alleen de voorspelling, maar de uitleg. In het verleden kon een computer zeggen "deze klant zal vertrekken" zonder te zeggen waarom, waardoor bankmedewerkers in verwarring achterbleven en niet in staat waren om actie te ondernemen. Dit nieuwe systeem bevat een functie die werkt als een spotlight, die precies laat zien welke factoren een specifieke klant richting de categorie "risicovol" hebben geduwd. Als een klant als hoog risico wordt gemarkeerd, kan het systeem de bankmanager vertellen dat dit komt doordat de klant tussen de 51 en 60 jaar oud is en gestopt is met het gebruiken van hun producten, ondanks dat zij nog steeds verschillende rekeningen aanhouden. Deze helderheid stelt bankmedewerkers in staat om verder te gaan dan gissen. Ze kunnen nu gerichte hulp bieden, zoals een financieel overzicht voor iemand die de pensioengerechtigde leeftijd nadert, of een campagne voor hernieuwde betrokkenheid voor iemand die inactief is geworden.
De onderzoekers hebben dit model uit het computervak gehaald en een eenvoudige, interactieve dashboard gebouwd die elke bankmedewerker kan gebruiken. Er is geen programmeerkennis voor nodig. Een manager kan de gegevens van een klant invoeren, en het scherm toont een waarschijnlijkheidsmeter, een kleurgecodeerd risiconiveau en een uitleg in gewone taal over de risicofactoren. Dit hulpmiddel verandert een complex wiskundig resultaat in een praktische gids voor dagelijkse zakelijke beslissingen. De studie suggereert dat door de focus te leggen op betrokkenheid in plaats van enkel op eigendom, en door aandacht te besteden aan specifieke levensfasen en regionale verschillen, banken hun vermogen om klanten te behouden aanzienlijk kunnen verbeteren. Hoewel het model krachtig is, merken de onderzoekers op dat het gebaseerd is op een enkele momentopname uit het verleden en dat toekomstig werk realtime transactiegegevens kan bevatten om voorspellingen nog actueler te maken. Voor nu biedt dit systeem een duidelijk, op data gebaseerd pad naar het begrijpen van waarom klanten vertrekken en hoe ze behouden kunnen worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.