Modeling and estimating skewed and heavy-tailed populations via unsupervised mixture models
यह शोध पत्र एक पूर्णतः अनसुपरवाइज्ड (unsupervised) मिश्रण मॉडल प्रस्तुत करता है जो बॉडी के लिए लॉग-नॉर्मल वितरण और टेल के लिए ज़ीरो-लोकेशन जनरल पैरेटो वितरण को जोड़ता है ताकि बिना थ्रेशोल्ड चयन की आवश्यकता के गैर-ऋणात्मक, हेवी-टेल्ड डेटा को प्रभावी ढंग से मॉडल किया जा सके, जो एक ईएम (EM) एल्गोरिदम और एक आर (R) पैकेज के माध्यम से मौजूदा विधियों का एक अनुमान-अनुकूल विकल्प प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप लोगों की ऊंचाई के आधार पर भीड़ का वर्णन करने की कोशिश कर रहे हैं। अधिकांश लोग औसत ऊंचाई के हैं, जो कमरे के बीच में एक सुंदर, चिकनी पहाड़ी (hill) बना रहे हैं। लेकिन फिर, आपके पास पीछे खड़े कुछ दिग्गज (giants) हैं, जो बाकी सभी से कहीं अधिक ऊंचे हैं।
डेटा की दुनिया में—जैसे बीमा दावे (insurance claims), शहरों का आकार, या बास्केटबॉल स्कोर—यह "पहाड़ी और दिग्गजों वाली" समस्या बहुत आम है। मध्य भाग (body) आमतौर पर एक अनुमानित पैटर्न का पालन करता है, लेकिन दिग्गज (tail) इतने विशाल और दुर्लभ होते हैं कि वे नियमों को तोड़ देते हैं। यदि आप पूरे समूह का वर्णन करने के लिए एक ही गणितीय सूत्र का उपयोग करने का प्रयास करते हैं, तो आप आमतौर पर विफल हो जाते हैं। या तो आप औसत लोगों को पूरी तरह से फिट करते हैं और दिग्गजों को छोड़ देते हैं, या आप दिग्गजों को फिट करते हैं और औसत लोगों को अजीब बना देते हैं।
वर्षों से, सांख्यिकीविदों ने इसे दो अलग-अलग सूत्रों को एक साथ "जोड़ने" (splicing) द्वारा हल करने की कोशिश की है: एक शरीर (body) के लिए और एक पूंछ (tail) के लिए। लेकिन यह दो अलग-अलग कपड़ों को आपस में जोड़ने जैसा है। आपको उन्हें जोड़ने के लिए एक विशिष्ट स्थान चुनना होगा, और आपको यह सुनिश्चित करना होगा कि उनके किनारे पूरी तरह से मेल खाएं ताकि कोई उभार न आए। यह "कटिंग पॉइंट" (जिसे थ्रेशोल्ड कहा जाता है) एक सिरदर्द है, और कभी-कभी गणित इतना जटिल हो जाता है कि आप आसानी से उत्तर की गणना भी नहीं कर पाते।
नया "जादुई मिश्रण" (The New "Magic Blend")
मार्को बी और फ्लेवियो सांती, यूनिवर्सिटी ऑफ ट्रेंटो के दो शोधकर्ताओं ने इस भीड़ को देखने का एक नया तरीका प्रस्तावित किया है। दो कपड़ों को जोड़ने के बजाय, वे सुझाव देते हैं कि उन्हें पेंट की तरह मिला दिया जाए।
वे इसे स्टैटिक लॉगनॉर्मल-जीपीडी मिश्रण (static lognormal-GPD mixture) कहते हैं। यह इस प्रकार काम करता है:
- बॉडी पेंट (The Body Paint): वे एक "लॉगनॉर्मल" (Lognormal) सूत्र का उपयोग करते हैं, जो औसत, रोज़मर्रा के डेटा (पहाड़ी) का वर्णन करने में उत्कृष्ट है।
- जायंट पेंट (The Giant Paint): वे एक "जनरलाइज्ड पारेटो डिस्ट्रीब्यूशन" (GPD) का उपयोग करते हैं, जो विशेष रूप से विशाल, दुर्लभ आउटलेर्स (दिग्गजों) के लिए डिज़ाइन किया गया एक विशेष सूत्र है।
- मिक्सिंग स्पून (The Mixing Spoon): वे काटते और चिपकाते नहीं हैं। इसके बजाय, वे कहते हैं, "आइए इन दोनों पेंट को एक साथ मिलाएं।" डेटा का एक निश्चित प्रतिशत लॉगनॉर्मल पेंट से आता है, और बाकी GPD पेंट से आता है।
सबसे अच्छी बात? कोई कटिंग पॉइंट नहीं है। यह मॉडल "अनसुपरवाइज्ड" (unsupervised) है, जिसका अर्थ है कि आपको यह अनुमान लगाने की आवश्यकता नहीं है कि औसत लोग कहाँ समाप्त होते हैं और दिग्गज कहाँ शुरू होते हैं। संक्रमण सुचारू है, जैसे एक ग्रेडिएंट, न कि एक ऊबड़-खाबड़ जोड़।
उन्होंने इसका परीक्षण कैसे किया
लेखकों ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने यह देखने के लिए बड़ी संख्या में कंप्यूटर सिमुलेशन चलाए कि क्या यह टिक पाता है।
- "सही" टेस्ट: उन्होंने नकली डेटा बनाया जो उनके नए मिश्रण मॉडल से पूरी तरह मेल खाता था। जब उन्होंने वापस उन सामग्रियों को खोजने की कोशिश की, तो यह तरीका खूबसूरती से काम कर गया, विशेष रूप से जब उनके पास बहुत सारा डेटा (500 या अधिक अवलोकन) था।
- "गलत" टेस्ट: उन्होंने अपने नए मॉडल को अन्य, अधिक जटिल तरीकों द्वारा उत्पन्न डेटा पर फिट करने का प्रयास किया। भले ही डेटा उनके विशिष्ट नुस्खे से नहीं बना था, फिर भी उनके मॉडल ने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया। वास्तव में, "जनरलाइज्ड बीटा डिस्ट्रीब्यूशन" का उपयोग करने वाले एक परीक्षण में, उनके मॉडल ने अपने दो प्रमुख प्रतिस्पर्धियों से बेहतर प्रदर्शन किया।
- स्पीड टेस्ट: उन्होंने उत्तर की गणना करने में लगने वाले समय की तुलना की। उनका तरीका "डायनेमिक मिक्सचर" विधि (एक अन्य लोकप्रिय दृष्टिकोण) की तुलना में बहुत तेज़ था, लेकिन सबसे सरल "स्प्लाइड" (spliced) विधि से थोड़ा धीमा था। हालांकि, लेखकों का कहना है कि उनका तरीका संभालने में बहुत आसान है क्योंकि इसमें असंभव गणितीय पहेलियों को हल करने की आवश्यकता नहीं होती है।
वास्तविक दुनिया का प्रमाण
यह देखने के लिए कि क्या यह वास्तविक दुनिया में काम करता है, लेखकों ने दो बहुत ही अव्यवस्थित डेटासेट पर इसका परीक्षण किया:
- कार बीमा दावे (Car Insurance Claims): उन्होंने एक अमेरिकी बीमाकर्ता के 6,773 कार बीमा दावों का विश्लेषण किया। डेटा विषम (skewed) था, जिसमें कई छोटे दावे और कुछ बहुत बड़े दावे थे। उनका मिश्रण मॉडल डेटा में पूरी तरह फिट बैठा, जबकि पुराने एकल-सूत्र विधियों (केवल लॉगनॉर्मल या केवल GPD) में पूरे चित्र को पकड़ने में विफलता मिली।
- बैंकिंग फ्रॉड (Banking Fraud): उन्होंने एक इतालवी बैंक में आंतरिक धोखाधड़ी के नुकसान का विश्लेषण किया। यहाँ भी, डेटा अनियंत्रित और हेवी-टेल्ड (heavy-tailed) था। मिश्रण मॉडल ही एकमात्र था जिसने "गुडनेस-ऑफ-फिट" परीक्षणों को पास किया, जिसका अर्थ है कि केवल वही वास्तविक डेटा की तरह दिखता था।
उन्होंने क्या पाया (और क्या नहीं)
मुख्य निष्कर्ष यह है कि यह "जादुई मिश्रण" विषम, हेवी-टेल्ड डेटा को मॉडल करने के लिए एक लचीला, विश्वसनीय और उपयोग में आसान उपकरण है। यह सुझाव देता है कि आप अधिक जटिल, कठिन तरीकों के समान सटीकता प्राप्त कर सकते हैं, लेकिन कम कम्प्यूटेशनल सिरदर्द के साथ।
हालाँकि, लेखक अत्यधिक प्रचार करने से बचते हैं। वे बताते हैं कि जब सैंपल साइज छोटा होता है (जैसे 100 अवलोकन), तो गणित थोड़ा अस्थिर हो सकता है, और मॉडल के "जायंट" हिस्से के अनुमानों में थोड़ा उतार-चढ़ाव हो सकता है। वे यह भी नोट करते हैं कि हालांकि मॉडल डेटा को फिट करने और जोखिम (जैसे Value-at-Risk) की गणना करने के लिए बेहतरीन है, इसे मुख्य रूप से लोगों को समूहों में वर्गीकृत करने के लिए डिज़ाइन नहीं किया गया था, हालांकि गणित इस बारे में एक संकेत देता है कि किस "पेंट" ने प्रत्येक डेटा बिंदु को संभवतः बनाया होगा।
निष्कर्ष (The Bottom Line)
यह पेपर सुझाव देता है कि जो कोई भी ऐसे डेटा के साथ काम कर रहा है जिसमें चरम मानों (extreme values) की एक लंबी पूंछ (long tail) है—जैसे बीमा हानि या वित्तीय जोखिम—उसके लिए यह नया मिश्रण मॉडल एक मजबूत दावेदार है। यह पूरे समूह को, औसत से लेकर चरम तक, बिना किसी कटिंग पॉइंट के सिरदर्द के, एक सुचारू और थ्रेशोल्ड-मुक्त तरीके से मॉडल करने का एक तरीका प्रदान करता है। यह कोई जादुिक छड़ी नहीं है जो हर समस्या को तुरंत हल कर देती है, लेकिन यह वर्तमान में उपलब्ध विकल्पों की तुलना में एक मजबूत, तेज़ और अधिक लचीला उपकरण है।
ये सभी विधियां lognGPD नामक एक R पैकेज में मुफ्त में उपलब्ध हैं, इसलिए कोई भी अपना खुद का पेंट मिला सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।