← नवीनतम पेपर
🤖 machine learning

Customer Churn Prediction on Structured Data Using FT-Transformer and Stacking Ensembles

यह शोध पत्र एक प्रमाणित हाइब्रिड आर्किटेक्चर प्रस्तुत करता है जो ग्राहक मंथन (customer churn) की भविष्यवाणी में क्लास इम्बैलेंस और फीचर इंटरैक्शन को प्रभावी ढंग से संबोधित करने के लिए कैलिब्रेशन-अवेयर स्टैकिंग के माध्यम से FT-Transformer और ग्रेडिएंट-बूस्टेड ट्रीज़ को जोड़ता है, जिससे स्ट्रक्चर्ड टैबुलर डेटा पर बेसलाइन मॉडल्स की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Joyjit Roy, Samaresh Kumar Singh, Laxmi Shaw

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joyjit Roy, Samaresh Kumar Singh, Laxmi Shaw

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त कॉफी शॉप चलाते हैं। आपके पास 10,000 नियमित ग्राहक हैं, लेकिन हर साल, उनमें से लगभग 2,000 आना बंद कर देते हैं। आप जानना चाहते हैं कि कौन जाने वाला है ताकि आप उन्हें रुकने के लिए एक मुफ्त पेस्ट्री दे सकें। इसे "कस्टमर चर्न प्रेडिक्शन" (ग्राहक छोड़ने का पूर्वानुमान) कहा जाता है।

समस्या यह है कि जो लोग छोड़ कर जाते हैं, वे एक छोटा समूह (अल्पसंख्यक) हैं, और वे सभी एक जैसे नहीं होते। कुछ उम्र बढ़ने के कारण छोड़ देते हैं, कुछ इसलिए क्योंकि उन्होंने आना कम कर दिया है, और कुछ इसलिए क्योंकि उनके पास बहुत सारे लॉयल्टी कार्ड हैं। यह एक उलझा हुआ पहेली जैसा है।

यह पेपर इस पहेली को हल करने का एक नया, हाई-टेक तरीका पेश करता है, जिसमें दो अलग-अलग "जासूसों" को एक सुपर-टीम में मिलाने का विचार है।

दो जासूस

लेखकों ने एक सिस्टम बनाया है जिसमें दो बहुत ही अलग प्रकार के AI मॉडल शामिल हैं, जिनमें से प्रत्येक के सोचने का एक अनूमा तरीका है:

  1. "ट्री डिटेक्टिव" (XGBoost):
    इस जासूस को एक सख्त नियम मानने वाले के रूप में सोचें। वे निर्णय लेने के लिए "हाँ या ना" के प्रश्नों की एक श्रृंखला पूछते हैं, जैसे कि एक फ्लोचार्ट।
  • प्रश्न: "क्या ग्राहक 50 वर्ष से अधिक आयु का है?" -> हाँ।
  • प्रश्न: "क्या उनके पास 3 या अधिक उत्पाद हैं?" -> हाँ।
  • निष्कर्ष: "जाने का उच्च जोखिम!"
  • ताकत: स्पष्ट, तीखी सीमाओं (जैसे "यदि उनके पास 3 उत्पाद हैं, तो वे चले जाएंगे") को पहचानने में माहिर।
  • कमजोरी: यह थोड़ा कठोर हो सकता है और वेरिएबल्स के बीच सूक्ष्म, जटिल संबंधों को मिस कर सकता है।
  1. "अटेंशन डिटेक्टिव" (FT-Transformer):
    इस जासूस को एक सामाजिक पर्यवेक्षक के रूप में सोचें जो एक साथ पूरी तस्वीर को देखता है। सरल हाँ/ना प्रश्न पूछने के बजाय, वे "अटेंशन" (ध्यान) का उपयोग करते हैं ताकि यह देख सकें कि विभिन्न सूचनाएं एक साथ एक-दूसरे से कैसे संबंधित हैं।
  • अवलोकन: "हम्म, यह ग्राहक उम्रदराज है, और उनके पास कई उत्पाद हैं, और वे जर्मनी में रहते हैं। ये तीनों चीजें मिलकर एक विशिष्ट जोखिम पैटर्न बनाती हैं जिसे एक साधारण सूची नहीं पकड़ पाएगी।"
  • ता kekuatan: विभिन्न डेटा पॉइंट्स के बीच जटिल, छिपे हुए संबंधों को पहचानने में उत्कृष्ट।
  • कमजोरी: यह कभी-कभी अपने अनुमानों में थोड़ा अति-आत्मविश्वासी हो सकता है।

जादू का कमाल: "स्टैकिंग एनसेम्बल"

लेखकों का बड़ा विचार इन दोनों जासूसों को एक कमरे में रखने और उन्हें वोट देने के लिए कहने का है, लेकिन एक ट्विस्ट के साथ। वे केवल एक साधारण औसत नहीं लेते। वे एक मेटा-लर्नर (एक तीसरा, स्मार्ट रेफरी) का उपयोग करते हैं।

  • यह कैसे काम करता है: दोनों जासूस अपने अनुमान लगाते हैं। रेफरी दोनों के उत्तरों को देखता है।
  • कैलिब्रेशन (अंशांकन): यदि "ट्री डिटेक्टिव" खुद पर बहुत अधिक भरोसा करता है (अति-आत्मविश्वासी) और "अटेंशन डिटेक्टिव" थोड़ा अनिश्चित है, तो रेफरी अंतिम स्कोर को अधिक सटीक बनाने के लिए उसे एडजस्ट करता है।
  • परिणाम: टीम अकेले किसी भी जासूस की तुलना में कम गलतियाँ करती है।

यह क्यों मायने रखता है (क्यों करें?)

लेखकों ने इसका परीक्षण 10,000 ग्राहकों के वास्तविक बैंकिंग डेटासेट पर किया। यहाँ उन्होंने क्या पाया, जिसे सरल भाषा में अनुवादित किया गया है:

  • पुराने तरीके को मात देना: नया टीम मानक "न्यूरल नेटवर्क" (एक सामान्य AI मॉडल) को एक महत्वपूर्ण अंतर से पीछे छोड़ देता है। यह साइकिल से स्पोर्ट्स कार में अपग्रेड करने जैसा था।
  • असंतुलन को संभालना: चूंकि केवल 20% ग्राहक छोड़ते हैं, इसलिए अधिकांश AI मॉडल बस यह अनुमान लगाते हैं कि "कोई नहीं छोड़ रहा" और एक उच्च स्कोर प्राप्त करते हैं लेकिन शून्य वास्तविक मूल्य देते हैं। यह नई विधि विशेष रूप से उन 20% लोगों को खोजने पर केंद्रित थी जो वास्तव में छोड़ रहे हैं, बिना नकली डेटा बनाकर धोखाधड़ी किए (एक सामान्य ट्रिक जिसे SMOTE कहा जाता है, जिसे लेखकों ने टाल दिया)।
  • भरोसेमंद भविष्यवाणियां: AI के साथ सबसे बड़ी समस्याओं में से एक यह है कि यह अक्सर कहता है, "मैं 99% निश्चित हूँ!" जबकि वास्तव में यह केवल 60% निश्चित होता है। यह नया सिस्टम अपने आत्मविश्वास को "कैलिब्रेट" करता है। यदि यह कहता है कि ग्राहक के छोड़ने की 70% संभावना है, तो वास्तव में यह लगभग 70% ही है। यह व्यवसायों के लिए महत्वपूर्ण है क्योंकि आप उन लोगों को फोन करने में पैसा बर्बाद नहीं करना चाहते जो वास्तव में जा नहीं रहे हैं।

"अहा!" क्षण (डेटा ने क्या खुलासा किया)

यह देखकर कि मॉडल कैसे निर्णय लेता है, लेखकों ने कुछ दिलचस्प पैटर्न खोजे:

  • "ओवर-लोडेड" ग्राहक: जिन ग्राहकों के पास 3 या अधिक उत्पाद थे, उनके जाने की संभावना बहुत अधिक थी, खासकर यदि वे उम्रदराज थे। "अटेंशन डिटेक्टिव" ने इस जटिल संबंध को तुरंत पकड़ लिया।
  • "निष्क्रिय" जोखिम: यदि किसी ग्राहक का बैलेंस अधिक है लेकिन वे हाल ही में सक्रिय नहीं रहे हैं, तो वे उच्च जोखिम पर हैं। मॉडल ने देखा कि "पैसा होना" और "खाते का उपयोग न करना" मिलकर एक खतरे का संकेत है।
  • "अप्रत्याशित" छोड़ने वाले: मॉडल अभी भी कुछ लोगों को मिस करता है (लग l 25% समय)। ये वे लोग थे जो कागज़ पर बिल्कुल ठीक दिखते थे (सक्रिय, अच्छा बैलेंस) लेकिन वे उन कारणों से चले गए जिन्हें डेटा कैप्चर नहीं कर सका (जैसे कि प्रतिस्पर्धी द्वारा बेहतर डील देना या कोई व्यक्तिगत जीवन की घटना)।

निचोड़

यह पेपर साबित करता है कि आपको एक सरल नियम-आधारित मॉडल और एक जटिल डीप-लर्निंग मॉडल के बीच चयन करने की आवश्यकता नहीं है। उन्हें एक साथ स्टैकिंग करके और एक स्मार्ट रेफरी को उनके वोटों को एडजस्ट करने देकर, आपको एक ऐसा सिस्टम मिलता है जो है:

  1. ग्राहकों को खोजने में अधिक सटीक है जो छोड़ कर जाएंगे।
  2. अपने विश्वास के बारे में अधिक ईमानदार है।
  3. पुनरुत्पादनीय (Reproducible) (अन्य वैज्ञानिक बिल्कुल वही चीज़ बना सकते हैं और समान परिणाम प्राप्त कर सकते हैं)।

यह बैंकों, सब्सक्रिप्शन सेवाओं, या किसी भी ऐसे व्यवसाय के लिए एक व्यावहारिक, तैयार-उपयोग उपकरण है जो अपने ग्राहकों को खुश रखने और उन्हें बनाए रखने की कोशिश कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →