← नवीनतम पेपर
🤖 machine learning

Empowering Credit Risk Detection in Weixin Pay with Billion-Scale Deep Graph Learning

यह शोध पत्र एक जोखिम-सचेत ओवरलैपिंग सबग्राफ लर्निंग फ्रेमवर्क प्रस्तावित करता है जो बजट-बाधित सैंपलिंग और क्रॉस-सबग्राफ कंसिस्टेंसी अलाइनमेंट के माध्यम से लोड वितरण को क्रिटिकल लॉन्ग-टेल रिस्क पैटर्न के संरक्षण के साथ संतुलित करता है, जो वीचिन पे (Weixin Pay) के लिए बिलियन-स्केल क्रेडिट रिस्क डिटेक्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Xin Liu, Xiyuan Chen, Chenglong Wu, Xuan Zong, Jun Zhou, Dawei Cheng

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Liu, Xiyuan Chen, Chenglong Wu, Xuan Zong, Jun Zhou, Dawei Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जहाँ हर कोई एक-दूसरे से जुड़ा हुआ है। इस शहर में, हर व्यक्ति अपने डिजिटल पदचिह्न (digital footprints) पीछे छोड़ जाता है—वे क्या खरीदते हैं, वे किससे बात करते हैं, और वे कहाँ जाते हैं। अधिकांश समय, ये पदचिह्न एक सामान्य कहानी बताते हैं। लेकिन कभी-कभी, कुछ लोग चुपके से घुसने और पैसे चुराने या सिस्टम को धोखा देने की कोशिश करते हैं। इसे "क्रेडिट फ्रॉड" (credit fraud) कहा जाता है, और यह लुका-छिपी के खेल की तरह है जहाँ बुरे लोग छिपने में बहुत माहिर होते हैं। उन्हें पकड़ने के लिए, बैंक और भुगतान ऐप पहले केवल एक व्यक्ति के अपने पदचिह्नों को देखते थे। लेकिन बुरे लोग समझदार होते हैं; वे अक्सर समूहों में काम करते हैं या अन्य लोगों के जीवन की छाया में छिप जाते हैं। इसलिए, वैज्ञानिकों ने एक विशेष प्रकार के मानचित्र का उपयोग करना शुरू किया जिसे "ग्राफ" (graph) कहा जाता है। एक ग्राफ को चार्ट के रूप में नहीं, बल्कि लोगों को घटनाओं से जोड़ने वाले धागों के एक विशाल जाल के रूप में सोचें। यदि आप एक धागे को खींचते हैं, तो पूरा जाल हिलता है, जिससे छिपे हुए पैटर्न प्रकट होते हैं। यही "ग्राफ न्यूरल नेटवर्क्स" (GNNs) की शक्ति है—वे सुपर-स्मार्ट जासूसों की तरह हैं जो देख सकते हैं कि कैसे एक व्यक्ति के संबंध यह प्रकट कर सकते हैं कि वह कुछ गलत करने की फिराक में है।

हालाँकि, इन मानचित्रों के साथ एक बड़ी समस्या है। वास्तविक दुनिया में, जैसे कि वीचिन पे (Weixin Pay) पर, मानचित्र इतना बड़ा है कि इसमें अरबों लोग और संबंध हैं। यह एक अकेले कंप्यूटर के लिए संभालना बहुत भारी है, जैसे कि एक चाय के प्याले में पूरे समुद्र को ले जाने की कोशिश करना। इसलिए, इंजीनियरों को काम बांटने के लिए मानचित्र को छोटे टुकड़ों में काटना पड़ा। लेकिन यहाँ एक पेंच है: जब आप एक मानचित्र को टुकड़ों में काटते हैं, तो आप अक्सर उन महत्वपूर्ण धागों को भी काट देते हैं जो बुरे लोगों को सुरागों से जोड़ते हैं। यह अपराध स्थल के केवल आधे हिस्से को देखकर रहस्य सुलझाने की कोशिश करने जैसा है; आप सबसे महत्वपूर्ण सबूत को मिस कर सकते हैं। यह शोध पत्र मानचित्र को काटने का एक नया तरीका पेश करता है जो टुकड़ों को बहुत भारी बनाए बिना महत्वपूर्ण धागों को सुरक्षित रखता है।

शोधकर्ताओं ने, टेनसेंट (Tencent) के वीचिन पे के साथ मिलकर, एक चतुर प्रणाली विकसित की जिसे RAOS (रिस्क-अवेयर ओवरलैपिंग सबग्राफ लर्निंग) कहा जाता है। कल्पना कीजिए कि आप दोस्तों के एक समूह के साथ पिज्जा के बड़े टुकड़े साझा करने के लिए उसे काट रहे हैं। पुराना तरीका यह था कि आप पिज्जा को इस तरह काटते थे कि कोई भी दो दोस्त एक ही टुकड़ा न लें। लेकिन अगर कोई "खराब टॉपिंग" (धोखेबाज) किसी टुकड़े के किनारे पर बैठा होता, तो उस टुकड़े को रखने वाला व्यक्ति उसे मिस कर सकता था क्योंकि वह टॉपिंग तकनीकी रूप से पड़ोसी के टुकड़े पर होती थी। नई विधि, RAOS, पिज्जा को थोड़े ओवरलैप (overlap) के साथ काटने के समान है। आप प्रत्येक मित्र को एक टुकड़ा देते हैं, लेकिन आप उन्हें अपने पड़ोसी के टुकड़े का एक छोटा सा हिस्सा भी रखने देते हैं। इस तरह, यदि कोई खराब टॉपिंग किनारे पर है, तो उसके आस-पास के सभी लोगों को उसे देखने का मौका मिलता है।

लेकिन एक जोखिम है: यदि आप सबको पड़ोसी का बहुत अधिक हिस्सा दे देते हैं, तो आपके पास बहुत सारा अतिरिक्त चीज़ और क्रस्ट (crust) जमा हो जाता है जो काम नहीं आता (इसे "शोर" और "अतिरेक" या noise and redundancy कहा जाता है)। टीम ने इसे चुनकर हल किया कि कौन से अतिरिक्त हिस्से जोड़ने हैं। उन्होंने "लॉन्ग-टेल" (long-tail) कनेक्शनों पर ध्यान केंद्रित किया—ये वे शांत, कम लोकप्रिय कनेक्शन हैं जो अक्सर छिपे हुए धोखाधड़ी के गुप्त सुरागों को थामे रहते हैं। उन्होंने इन महत्वपूर्ण लेकिन अनदेखे हिस्सों को खोजने और उन्हें टुकड़ों में जोड़ने के लिए एक विशेष फिल्टर (जिसे "h-index" कहा जाता है) का उपयोग किया, जबकि शोर वाले, महत्वहीन हिस्सों को अनदेखा कर दिया।

इसके अलावा, क्योंकि एक ही व्यक्ति दो अलग-अलग टुकड़ों पर दिखाई दे सकता है, कंप्यूटर भ्रमित हो सकता है और यह सोच सकता है कि वे अलग-अलग कहानियों वाले दो अलग व्यक्ति हैं। इसे ठीक करने के लिए, टीम ने एक "कंसिस्टेंसी अलाइनमेंट" (consistency alignment) चरण जोड़ा। यह एक टीम मीटिंग की तरह है जहाँ सभी मित्र उस व्यक्ति के बारे में अपने नोट्स की तुलना करते हैं जो दोनों टुकड़ों पर दिखाई देता है, ताकि वे इस बात पर सहमत हो सकें कि वह व्यक्ति वास्तव में कौन है। यह सुनिश्चित करता है कि अंतिम तस्वीर स्पष्ट और सटीक हो।

जब उन्होंने वास्तविक डेटा पर इस नई प्रणाली का परीक्षण किया, जिसमें सैकड़ों मिलियन उपयोगकर्ता शामिल थे, तो परिणाम प्रभावशाली थे। नई विधि पुराने मानचित्र काटने के तरीकों की तुलना में धोखेबाजों को पकड़ने में बहुत बेहतर थी। इसने न केवल स्पष्ट रूप से बुरे लोगों को पकड़ा; बल्कि यह भविष्यवाणी करने में भी बहुत बेहतर थी कि भविष्य में कौन धोखेबाज बन सकता है (एक "फॉरवर्ड रिस्क" भविष्यवाणी)। वास्तव में, इसने मानक विधि की तुलना में जोखिम भरे उपयोगकर्ताओं को पकड़ने की क्षमता में 10% से अधिक सुधार किया, जो बिना ओवरलैप के मानचित्र को काटती है। आश्चर्यजनक रूप से, उनकी नई विधि पूरे मानचित्र को एक साथ देखने की कोशिश करने की तुलना में धोखाधड़ी खोजने में बेहतर थी, क्योंकि पुराना "पूरा मानचित्र" वाला दृष्टिकोण बहुत अधिक शोर (noise) के कारण भ्रमित हो जाता था।

वास्तविक दुनिया में, इसका अर्थ है स्कैम से कम लोगों का पैसा खोना और सभी के लिए एक सुरक्षित वित्तीय प्रणाली। टीम ने वास्तविक उपयोगकर्ताओं के साथ एक लाइव टेस्ट में इस प्रणाली को काम पर लगाया, और इसने पिछले सिस्टम की तुलना में अधिक जोखिम वाले उपयोगकर्ताओं की पहचान की और अधिक वित्तीय नुकसान को रोका। टुकड़ों को सावधानीपूर्वक ओवरलैप करके और यह सुनिश्चित करके कि सभी एक ही तस्वीर पर सहमत हैं, वे एक ऐसी समस्या को हल करने में सफल रहे जो पहले के लिए बहुत बड़ी और जटिल थी जिसे कंप्यूटर अकेले नहीं संभाल सकते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →