Empowering Credit Risk Detection in Weixin Pay with Billion-Scale Deep Graph Learning
यह शोध पत्र एक जोखिम-सचेत ओवरलैपिंग सबग्राफ लर्निंग फ्रेमवर्क प्रस्तावित करता है जो बजट-बाधित सैंपलिंग और क्रॉस-सबग्राफ कंसिस्टेंसी अलाइनमेंट के माध्यम से लोड वितरण को क्रिटिकल लॉन्ग-टेल रिस्क पैटर्न के संरक्षण के साथ संतुलित करता है, जो वीचिन पे (Weixin Pay) के लिए बिलियन-स्केल क्रेडिट रिस्क डिटेक्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटरनेट की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जहाँ हर कोई एक-दूसरे से जुड़ा हुआ है। इस शहर में, हर व्यक्ति अपने डिजिटल पदचिह्न (digital footprints) पीछे छोड़ जाता है—वे क्या खरीदते हैं, वे किससे बात करते हैं, और वे कहाँ जाते हैं। अधिकांश समय, ये पदचिह्न एक सामान्य कहानी बताते हैं। लेकिन कभी-कभी, कुछ लोग चुपके से घुसने और पैसे चुराने या सिस्टम को धोखा देने की कोशिश करते हैं। इसे "क्रेडिट फ्रॉड" (credit fraud) कहा जाता है, और यह लुका-छिपी के खेल की तरह है जहाँ बुरे लोग छिपने में बहुत माहिर होते हैं। उन्हें पकड़ने के लिए, बैंक और भुगतान ऐप पहले केवल एक व्यक्ति के अपने पदचिह्नों को देखते थे। लेकिन बुरे लोग समझदार होते हैं; वे अक्सर समूहों में काम करते हैं या अन्य लोगों के जीवन की छाया में छिप जाते हैं। इसलिए, वैज्ञानिकों ने एक विशेष प्रकार के मानचित्र का उपयोग करना शुरू किया जिसे "ग्राफ" (graph) कहा जाता है। एक ग्राफ को चार्ट के रूप में नहीं, बल्कि लोगों को घटनाओं से जोड़ने वाले धागों के एक विशाल जाल के रूप में सोचें। यदि आप एक धागे को खींचते हैं, तो पूरा जाल हिलता है, जिससे छिपे हुए पैटर्न प्रकट होते हैं। यही "ग्राफ न्यूरल नेटवर्क्स" (GNNs) की शक्ति है—वे सुपर-स्मार्ट जासूसों की तरह हैं जो देख सकते हैं कि कैसे एक व्यक्ति के संबंध यह प्रकट कर सकते हैं कि वह कुछ गलत करने की फिराक में है।
हालाँकि, इन मानचित्रों के साथ एक बड़ी समस्या है। वास्तविक दुनिया में, जैसे कि वीचिन पे (Weixin Pay) पर, मानचित्र इतना बड़ा है कि इसमें अरबों लोग और संबंध हैं। यह एक अकेले कंप्यूटर के लिए संभालना बहुत भारी है, जैसे कि एक चाय के प्याले में पूरे समुद्र को ले जाने की कोशिश करना। इसलिए, इंजीनियरों को काम बांटने के लिए मानचित्र को छोटे टुकड़ों में काटना पड़ा। लेकिन यहाँ एक पेंच है: जब आप एक मानचित्र को टुकड़ों में काटते हैं, तो आप अक्सर उन महत्वपूर्ण धागों को भी काट देते हैं जो बुरे लोगों को सुरागों से जोड़ते हैं। यह अपराध स्थल के केवल आधे हिस्से को देखकर रहस्य सुलझाने की कोशिश करने जैसा है; आप सबसे महत्वपूर्ण सबूत को मिस कर सकते हैं। यह शोध पत्र मानचित्र को काटने का एक नया तरीका पेश करता है जो टुकड़ों को बहुत भारी बनाए बिना महत्वपूर्ण धागों को सुरक्षित रखता है।
शोधकर्ताओं ने, टेनसेंट (Tencent) के वीचिन पे के साथ मिलकर, एक चतुर प्रणाली विकसित की जिसे RAOS (रिस्क-अवेयर ओवरलैपिंग सबग्राफ लर्निंग) कहा जाता है। कल्पना कीजिए कि आप दोस्तों के एक समूह के साथ पिज्जा के बड़े टुकड़े साझा करने के लिए उसे काट रहे हैं। पुराना तरीका यह था कि आप पिज्जा को इस तरह काटते थे कि कोई भी दो दोस्त एक ही टुकड़ा न लें। लेकिन अगर कोई "खराब टॉपिंग" (धोखेबाज) किसी टुकड़े के किनारे पर बैठा होता, तो उस टुकड़े को रखने वाला व्यक्ति उसे मिस कर सकता था क्योंकि वह टॉपिंग तकनीकी रूप से पड़ोसी के टुकड़े पर होती थी। नई विधि, RAOS, पिज्जा को थोड़े ओवरलैप (overlap) के साथ काटने के समान है। आप प्रत्येक मित्र को एक टुकड़ा देते हैं, लेकिन आप उन्हें अपने पड़ोसी के टुकड़े का एक छोटा सा हिस्सा भी रखने देते हैं। इस तरह, यदि कोई खराब टॉपिंग किनारे पर है, तो उसके आस-पास के सभी लोगों को उसे देखने का मौका मिलता है।
लेकिन एक जोखिम है: यदि आप सबको पड़ोसी का बहुत अधिक हिस्सा दे देते हैं, तो आपके पास बहुत सारा अतिरिक्त चीज़ और क्रस्ट (crust) जमा हो जाता है जो काम नहीं आता (इसे "शोर" और "अतिरेक" या noise and redundancy कहा जाता है)। टीम ने इसे चुनकर हल किया कि कौन से अतिरिक्त हिस्से जोड़ने हैं। उन्होंने "लॉन्ग-टेल" (long-tail) कनेक्शनों पर ध्यान केंद्रित किया—ये वे शांत, कम लोकप्रिय कनेक्शन हैं जो अक्सर छिपे हुए धोखाधड़ी के गुप्त सुरागों को थामे रहते हैं। उन्होंने इन महत्वपूर्ण लेकिन अनदेखे हिस्सों को खोजने और उन्हें टुकड़ों में जोड़ने के लिए एक विशेष फिल्टर (जिसे "h-index" कहा जाता है) का उपयोग किया, जबकि शोर वाले, महत्वहीन हिस्सों को अनदेखा कर दिया।
इसके अलावा, क्योंकि एक ही व्यक्ति दो अलग-अलग टुकड़ों पर दिखाई दे सकता है, कंप्यूटर भ्रमित हो सकता है और यह सोच सकता है कि वे अलग-अलग कहानियों वाले दो अलग व्यक्ति हैं। इसे ठीक करने के लिए, टीम ने एक "कंसिस्टेंसी अलाइनमेंट" (consistency alignment) चरण जोड़ा। यह एक टीम मीटिंग की तरह है जहाँ सभी मित्र उस व्यक्ति के बारे में अपने नोट्स की तुलना करते हैं जो दोनों टुकड़ों पर दिखाई देता है, ताकि वे इस बात पर सहमत हो सकें कि वह व्यक्ति वास्तव में कौन है। यह सुनिश्चित करता है कि अंतिम तस्वीर स्पष्ट और सटीक हो।
जब उन्होंने वास्तविक डेटा पर इस नई प्रणाली का परीक्षण किया, जिसमें सैकड़ों मिलियन उपयोगकर्ता शामिल थे, तो परिणाम प्रभावशाली थे। नई विधि पुराने मानचित्र काटने के तरीकों की तुलना में धोखेबाजों को पकड़ने में बहुत बेहतर थी। इसने न केवल स्पष्ट रूप से बुरे लोगों को पकड़ा; बल्कि यह भविष्यवाणी करने में भी बहुत बेहतर थी कि भविष्य में कौन धोखेबाज बन सकता है (एक "फॉरवर्ड रिस्क" भविष्यवाणी)। वास्तव में, इसने मानक विधि की तुलना में जोखिम भरे उपयोगकर्ताओं को पकड़ने की क्षमता में 10% से अधिक सुधार किया, जो बिना ओवरलैप के मानचित्र को काटती है। आश्चर्यजनक रूप से, उनकी नई विधि पूरे मानचित्र को एक साथ देखने की कोशिश करने की तुलना में धोखाधड़ी खोजने में बेहतर थी, क्योंकि पुराना "पूरा मानचित्र" वाला दृष्टिकोण बहुत अधिक शोर (noise) के कारण भ्रमित हो जाता था।
वास्तविक दुनिया में, इसका अर्थ है स्कैम से कम लोगों का पैसा खोना और सभी के लिए एक सुरक्षित वित्तीय प्रणाली। टीम ने वास्तविक उपयोगकर्ताओं के साथ एक लाइव टेस्ट में इस प्रणाली को काम पर लगाया, और इसने पिछले सिस्टम की तुलना में अधिक जोखिम वाले उपयोगकर्ताओं की पहचान की और अधिक वित्तीय नुकसान को रोका। टुकड़ों को सावधानीपूर्वक ओवरलैप करके और यह सुनिश्चित करके कि सभी एक ही तस्वीर पर सहमत हैं, वे एक ऐसी समस्या को हल करने में सफल रहे जो पहले के लिए बहुत बड़ी और जटिल थी जिसे कंप्यूटर अकेले नहीं संभाल सकते थे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।