Predicting Bank Customer Churn Using a Random Forest Classifier With Engineered Risk Features
यह अध्ययन एक इंटरैक्टिव स्ट्रीमलिट (Streamlit) डैशबोर्ड विकसित और तैनात करता है जिसमें बैंक ग्राहक मंथन (churn) की सटीक भविष्यवाणी करने के लिए इंजीनियर किए गए जोखिम फीचर्स से सुसज्जित एक रैंडम फॉरेस्ट क्लासिफायर शामिल है, जो उच्च प्रदर्शन मेट्रिक्स प्राप्त करता है और रिलेशनशिप प्रबंधकों के लिए कार्रवाई योग्य, व्याख्या योग्य प्रतिधारण अंतर्दृष्टि प्रदान करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बैंकिंग की दुनिया में, पैसा केवल स्थानांतरित नहीं किया जाता; इसे विश्वास के रूप में रखा जाता है। लेकिन वह विश्वास नाजुक होता है। एक रिटेल बैंक के लिए, सबसे महंगी गलती एक बुरा ऋण देना नहीं है, बल्कि एक अच्छे ग्राहक को खोना है। एक नया खाता खोलने के लिए किसी व्यक्ति को प्राप्त करने की लागत मौजूदा ग्राहक को खुश रखने की तुलना में काफी अधिक होती है। इस वास्तविकता ने ग्राहक प्रतिधारण (रिटेंशन) को भविष्यवाणी के एक उच्च-दांव वाले खेल में बदल दिया है। बैंक अब भविष्य का अनुमान लगाने के लिए अतीत की ओर देखते हैं, एक सरल लेकिन महत्वपूर्ण प्रश्न पूछते हैं: हमारा कौन सा ग्राहक जाने वाला है? इसका उत्तर देने के लिए, शोधकर्ताओं ने मशीन लर्निंग की ओर रुख किया है, जो एक ऐसा क्षेत्र है जहाँ कंप्यूटर बिना हर नियम के लिए स्पष्ट रूप से प्रोग्राम किए गए, डेटा की विशाल मात्रा में पैटर्न पहचानना सीखते हैं। एक मानव विश्लेषक द्वारा हजारों फाइलों को पढ़ने के बजाय, एक कंप्यूटर सूक्ष्म संकेतों को स्कैन करता है—जैसे कि खाते की गतिविधि में अचानक गिरावट या एक विशिष्ट आयु समूह—जो अक्सर प्रस्थान से पहले होते हैं। लक्ष्य इन संकेतों को इतनी जल्दी पहचानना है कि हस्तक्षेप किया जा सके, यानी ग्राहक के जाने का निर्णय लेने से पहले ही मदद या बेहतर डील पेश की जा सके।
भारत के चैतन्या भारती इंस्टीट्यूट ऑफ टेक्नोलॉजी के अमूला वेंकटेश और डॉ. इंदिरा द्वारा किया गया एक हालिया अध्ययन इस चुनौती का सीधे तौर पर सामना करता है। उन्होंने एक यूरोपीय बैंक के 10,000 ग्राहकों के डेटासेट पर ध्यान केंद्रित किया, जहाँ लगभग 38 प्रतिशत लोग पहले ही बैंक छोड़ चुके थे, जो राजस्व के एक महत्वपूर्ण नुकसान को दर्शाता है। शोधकर्ताओं ने एक डिजिटल प्रणाली बनाई जो यह भविष्यवाणी करने के लिए डिज़ाइन की गई थी कि अगला कौन जाएगा। वे किसी एक, सरल नियम पर निर्भर नहीं थे, जैसे कि "यदि बैलेंस कम है, तो वे चले जाएंगे।" इसके बजाय, उन्होंने 'रैंडम फॉरेस्ट' नामक एक पद्धति का उपयोग किया। निर्णय वृक्षों (डिसीजन ट्रीज़) के एक जंगल की कल्पना करें, जहाँ प्रत्येक वृक्ष ग्राहक के डेटा को थोड़े अलग कोण से देखता है। एक वृक्ष आयु पर ध्यान केंद्रित कर सकता है, दूसरा इस पर कि उनके पास कितने क्रेडिट कार्ड हैं, और तीसरा उनके स्थान पर। इन सैकड़ों वृक्षों की राय को मिलाकर, सिस्टम एक ऐसी सहमति तक पहुँचता है जो किसी भी एकल वृक्ष की तुलना में कहीं अधिक सटीक और विश्वसनीय होती है।
इस प्रणाली को और अधिक सटीक बनाने के लिए, शोधकर्ताओं ने केवल बैंक के रिकॉर्ड में पाए जाने वाले कच्चे नंबरों को ही इसमें नहीं डाला। उन्होंने मौजूदा तथ्यों को आपस में मिलाकर नए, "इंजीनियर्ड" सुराग बनाए। उन्होंने गणना की कि ग्राहक का कितना वेतन उनके बैंक खाते में जमा था, एक ऐसा अनुपात जो यह प्रकट करता है कि व्यक्ति उस विशिष्ट बैंक पर कितना निर्भर है। उन्होंने देखा कि एक ग्राहक के पास कितने उत्पाद थे और वे कितने समय से ग्राहक रहे, जिससे उनके जुड़ाव की गति का पता चला। उन्होंने यहाँ तक कि ग्राहक की आयु को उनके बैंक के साथ बिताए गए वर्षों से गुणा किया ताकि यह देखा जा सके कि क्या जीवन का चरण उनकी वफादारी में भूमिका निभाता है। ये नए संयोजन एक आवर्धक लेंस (मैग्निफाइंग ग्लास) की तरह काम करते थे, जो उन छिपे हुए संबंधों को उजागर करते थे जिन्हें केवल कच्चे डेटा ने मिस कर दिया था। जब कंप्यूटर को इस समृद्ध जानकारी पर प्रशिक्षित किया गया, तो इसने प्रस्थान के संकेतों को उल्लेखनीय स्पष्टता के साथ पहचानना सीख लिया।
इस प्रशिक्षण के परिणाम चौंकाने वाले थे। जब इसे ग्राहकों के एक ऐसे समूह पर परखा गया जिन्हें सिस्टम ने पहले कभी नहीं देखा था, तो इसने 91.4 प्रतिशत सटीकता के साथ सही पहचान की कि कौन रुकेगा और कौन जाएगा। इससे भी महत्वपूर्ण बात यह है कि इसने उन 87.8 प्रतिशत लोगों को पकड़ा जो वास्तव में जाने वाले थे, जो एक बैंक के लिए एक महत्वपूर्ण मीट्रिक है जो अपने ग्राहकों को बचाना चाहता है। यह प्रणाली बुनियादी लीनियर मॉडल या एकल निर्णय वृक्षों जैसे पुराने, सरल तरीकों की तुलना में बेहतर प्रदर्शन करती है, और बहुत अधिक जटिल और गणनात्मक रूप से भारी प्रणालियों के प्रदर्शन के बहुत करीब पहुँच गई। शोधकर्ताओं ने पाया कि जाने का सबसे मजबूत एकल भविष्यवक्ता आयु थी, जिसके ठीक बाद उनके उत्पादों के साथ सक्रिय जुड़ाव का स्थान था। उन्होंने यह भी पाया कि जर्मनी के ग्राहक फ्रांस या स्पेन के ग्राहकों की तुलना में लगभग दोगुनी दर से जा रहे थे, जो एक क्षेत्रीय अंतर है जो सुझाव देता है कि स्थानीय कारक काम कर रहे हैं।
शायद इस कार्य का सबसे महत्वपूर्ण हिस्सा केवल भविष्यवाणी नहीं, बल्कि स्पष्टीकरण है। अतीत में, एक कंप्यूटर यह कह सकता था कि "यह ग्राहक चला जाएगा" लेकिन यह बताए बिना कि क्यों, जिससे बैंक कर्मचारी भ्रमित और कार्य करने में असमर्थ रह जाते थे। इस नई प्रणाली में एक ऐसी विशेषता शामिल है जो एक स्पॉटलाइट की तरह काम करती है, जो ठीक से दिखाती है कि किन कारकों ने एक विशिष्ट ग्राहक को "जोखिम" श्रेणी की ओर धकेला। यदि किसी ग्राहक को उच्च जोखिम के रूप में चिह्नित किया जाता है, तो सिस्टम बैंक प्रबंधक को बता सकता है कि ऐसा इसलिए है क्योंकि ग्राहक 51 और 60 वर्ष के बीच का है और उसने अपने उत्पादों का उपयोग करना बंद कर दिया है, भले ही उसके पास कई खाते हों। यह स्पष्टता बैंक कर्मचारियों को अनुमान लगाने से आगे बढ़ने की अनुमति देती है। वे अब लक्षित मदद दे सकते हैं, जैसे कि सेवानिवृत्ति के करीब पहुँच रहे व्यक्ति के लिए वित्तीय समीक्षा या किसी ऐसे व्यक्ति के लिए पुन: जुड़ाव अभियान जो निष्क्रिय हो गया है।
शोधकर्ताओं ने इस मॉडल को कंप्यूटर लैब से बाहर निकाला और एक सरल, इंटरैक्टिव डैशबोर्ड बनाया जिसे कोई भी बैंक कर्मचारी उपयोग कर सकता है। इसमें कोडिंग ज्ञान की आवश्यकता नहीं है। एक प्रबंधक ग्राहक का विवरण टाइप कर सकता है, और स्क्रीन एक संभाव्यता गेज (प्रोबेबिलिटी गेज), एक रंग-कोडित जोखिम स्तर और जोखिम कारकों का सरल भाषा में स्पष्टीकरण प्रदर्शित करेगी। यह उपकरण एक जटिल गणितीय परिणाम को दैनिक व्यावसायिक निर्णयों के लिए एक व्यावहारिक मार्गदर्शिका में बदल देता है। अध्ययन बताता है कि केवल स्वामित्व के बजाय जुड़ाव पर ध्यान केंद्रित करके, और विशिष्ट जीवन चरणों और क्षेत्रीय अंतरों पर ध्यान देकर, बैंक अपने ग्राहकों को बनाए रखने की अपनी क्षमता में काफी सुधार कर सकते हैं। हालांकि मॉडल शक्तिशाली है, शोधकर्ता नोट करते हैं कि यह इतिहास के एक एकल स्नैपशॉट पर आधारित है और भविष्य के कार्य में भविष्यवाणियों को और भी सामयिक बनाने के लिए वास्तविक समय (रियल-टाइम) के लेनदेन डेटा को शामिल किया जा सकता है। फिलहाल, यह प्रणाली ग्राहकों के जाने के कारणों को समझने और उन्हें बनाए रखने के लिए एक स्पष्ट, डेटा-संचालित मार्ग प्रदान करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।