Inductive inference of gradient-boosted decision trees on graphs for insurance fraud detection
यह शोध पत्र G-GBM को प्रस्तुत करता है, जो एक नवीन इंडक्टिव ग्राफ ग्रेडिएंट बूस्टिंग मशीन है जो बीमा धोखाधड़ी का पता लगाने में क्लास इम्बैलेंस (वर्ग असंतुलन) और डायनेमिक डेटा जैसी चुनौतियों का समाधान करते हुए, स्टेट-ऑफ-द-आर्ट विधियों से बेहतर प्रदर्शन करने या उनके बराबर होने के लिए ग्रेडिएंट बूस्टिंग की मजबूती को व्याख्यात्मक हेटेरोजेनियस ग्राफ फीचर्स के साथ प्रभावी ढंग से जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बीमा जासूस (insurance detective) हैं जो उन लोगों के समूह को पकड़ने की कोशिश कर रहे हैं जो पैसे चुराने के लिए नकली कार दुर्घटनाओं या डॉक्टर के दौरों का नाटक करते हैं।
पुराना तरीका: व्यक्तियों को देखना
परंपरागत रूप से, जासूस प्रत्येक व्यक्ति (या कंपनी) को अलग से देखते थे। वे तथ्यों की एक सूची की जाँच करते थे: "उनकी उम्र क्या है? वे कौन सी कार चलाते हैं? क्या उन्होंने कई दावे किए हैं?" यह किसी संदिग्ध का आईडी कार्ड देखकर रहस्य सुलझाने जैसा है। यह ठीक-ठाက် काम करता है, लेकिन यह बड़े चित्र (big picture) को देखने में चूक जाता है। जालसाज अक्सर समूहों (rings) में काम करते हैं और एक-दूसरे की मदद करते हैं। यदि आप केवल एक व्यक्ति को देखते हैं, तो आप इस तथ्य को मिस कर सकते हैं कि वह एक ज्ञात अपराधी से जुड़ा हुआ है।
नया विचार: "सोशल नेटवर्क" मैप
इस शोध पत्र के लेखकों ने महसूस किया कि संगठित धोखाधड़ी को पकड़ने के लिए, आपको संबंधों को देखने की आवश्यकता है। उन्होंने एक विशाल मानचित्र (एक "ग्राफ") बनाया जहाँ:
- नोड्स (Nodes) लोग और कंपनियाँ हैं।
- रेखाएँ (Lines) संबंध हैं (जैसे, "कंपनी A इस कार की मालिक है," "व्यक्ति B इस पते पर रहता है," "व्यक्ति C कंपनी D का निदेशक है")।
यह मानचित्र अव्यवset और जटिल है। इसमें विभिन्न प्रकार के लोग और विभिन्न प्रकार के संबंध हैं। यह समय के साथ बदलता रहता है जैसे-जैसे नए लोग जुड़ते हैं या छोड़ते हैं।
वर्तमान "स्मार्ट" मैप्स के साथ समस्या
हाल ही में, कंप्यूटर वैज्ञानिकों ने इन मानचित्रों को पढ़ने के लिए फैंसी "डीप लर्निंग" (AI) का उपयोग करना शुरू कर दिया है। इन AI मॉडलों को एक 'ब्लैक बॉक्स' के रूप में सोचें जो पूरे मानचित्र को लेता है, उसे एक एकल, धुंधले सारांश में सिकोड़ देता है, और अनुमान लगाता है कि कौन सा व्यक्ति जालसाज है।
- खामी: ये ब्लैक बॉक्स समझने में कठिन हैं। बीमा की दुनिया में, आप केवल यह नहीं कह सकते कि "कंप्यूटर कहता है कि वे दोषी हैं।" आपको नियामकों (regulators) और अदालतों को यह समझाना होगा कि क्यों। इसके अलावा, ये AI मॉडल कभी-कभी भ्रमित हो जाते हैं जब मानचित्र बहुत बड़ा होता है या जब ईमानदार लोगों की तुलना में धोखाधड़ी के मामले बहुत कम होते हैं (जिसे "क्लास इम्बैलेंस" कहा जाता है)।
समाधान: G-GBM (द "पाथ-रीडिंग" डिटेक्टिव)
लेखकों ने G-GBM नामक एक नया टूल बनाया। मानचित्र को एक धुंधले सारांश में सिकोड़ने के बजाय, G-GBM एक ऐसे जासूस की तरह काम करता है जो मानचित्र के माध्यम से विशिष्ट रास्तों (paths) पर चलता है।
यह इस प्रकार काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:
"मेटापाथ" वॉक (The "Metapath" Walk): कल्पना कीजिए कि आप एक विशिष्ट व्यक्ति (मान लीजिए "बॉब") की जांच कर रहे हैं। G-GBM केवल बॉब को नहीं देखता है। यह बॉब से विशिष्ट मार्गों का पता लगाने के लिए छोटे "वॉकर" भेजता है।
- पथ 1: बॉब उसकी कार कार का मालिक (शायद बॉब का भाई)।
- पथ 2: बॉब रिपेयर शॉप शॉप का मालिक (शायद बॉब का चचेरा भाई)।
- पथ 3: बॉब पता पड़ोसी (जिसने भी संदिग्ध दावा किया है)।
सुरागों को पढ़ना (Reading the Clues): इन पथों को एक धुंधले सारांश में बदलने के बजाय, G-GBM प्रत्येक पथ के साथ पाए गए विशिष्ट विवरणों को लिख लेता है। "बॉब का भाई एक कार का मालिक है," "रिपेयर शॉप का मालिक बॉब का चचेरा भाई है।" यह इन विवरणों को अलग और स्पष्ट रखता है।
"ट्री" निर्णय (The "Tree" Decision): यह इन विशिष्ट पथ-विवरणों को एक शक्तिशाली निर्णय लेने वाले इंजन (जिसे ग्रेडिएंट बूस्टेड ट्री कहा जाता है) में फीड करता है। यह इंजन अव्यवस्थित डेटा में पैटर्न पहचानने और इस तथ्य को संभालने में माहिर है कि धोखाधड़ी दुर्लभ है। यह पूछता है: "यदि मैं इस विशिष्ट संयोजन के पड़ोसियों और संबंधों को देखता हूँ, तो क्या इस व्यक्ति के जालसाज होने की संभावना है?"
"क्यों" (व्याख्यात्मकता/Explainability): यह इसकी महाशक्ति है। क्योंकि मॉडल ने डेटा को धुंधला नहीं किया, इसलिए यह उस सटीक पथ की ओर इशारा कर सकता है जिसने अलार्म बजाया।
- उदाहरण: "हमने बॉब को इसलिए फ्लैग नहीं किया क्योंकि उसकी उम्र क्या है, बल्कि इसलिए क्योंकि पथ 2 ने दिखाया कि वह एक ऐसी रिपेयर शॉप के मालिक से जुड़ा हुआ है जिसके पास 50 अन्य संदिग्ध दावे हैं।"
- यह बीमा कंपनी को अपने निर्णय को साबित करने के लिए एक स्पष्ट "ऑडिट ट्रेल" देता है, जो कानून के अनुसार आवश्यक है।
शोध पत्र ने क्या पाया
लेखकों ने इस नए डिटेक्टिव टूल का परीक्षण दो वास्तविक दुनिया के परिदृश्यों पर किया:
- एक बेल्जियम बीमा डेटासेट: कंपनियों और उनके निदेशकों का एक विशाल, वास्तविक दुनिया का मानचित्र।
- एक हेल्थकेयर फ्रॉड डेटासेट: डॉक्टरों और रोगियों का एक मानचित्र।
परिणाम:
- बेहतर या समान प्रदर्शन: G-GBM ने फैंसी "ब्लैक बॉक्स" AI मॉडल और पारंपरिक तरीकों के समान या उनसे बेहतर तरीके से धोखाधड़ी को पकड़ा।
- गति: यह जटिल AI मॉडल की तुलना में प्रशिक्षित (train) होने में बहुत तेज़ था।
- पारदर्शिता: इसने अपने निर्णयों के स्पष्ट कारण प्रदान किए, जो AI मॉडल इतनी आसानी से नहीं कर सके।
- मजबूती (Robustness): इसने AI मॉडल की तुलना में डेटा की "अव्यवस्थित" प्रकृति (जैसे, गायब जानकारी या अजीब श्रेणियाँ) को बेहतर ढंग से संभाला।
सारांश में
यह शोध पत्र दो दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाने वाली एक विधि पेश करता है: एक सोशल नेटवर्क में जटिल संबंधों को देखने की AI की क्षमता, और पारंपरिक निर्णय वृक्षों (decision trees) की स्पष्टता और गति। यह केवल यह नहीं कहता कि "यह धोखाधड़ी है"; यह कहता है कि "यह इन विशिष्ट कनेक्शनों के कारण धोखाधड़ी है," जो इसे बीमा घोटालों से लड़ने के लिए एक व्यावहारिक, भरोसेमंद उपकरण बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।