A unified approach to outlier identification for mixed-type data
यह शोध पत्र मिश्रित प्रकार के डेटा (सतत और क्रमिक) के लिए एक सुदृढ़ आउटलेयर पहचान पद्धति प्रस्तावित करता है जो एक लेटेंट गॉसियन मॉडल और मिनिमम कोवेरिएंस डिटरमिनेंट एस्टिमेटर का उपयोग करता है ताकि कम फाल्स पॉजिटिव दरों को बनाए रखते हुए प्रभावी ढंग से विसंगतियों का पता लगाया जा सके, जैसा कि सिमुलेशन और एक वास्तविक एयरबीएनबी (Airbnb) डेटासेट अनुप्रयोग के माध्यम से मान्य किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो लोगों के एक बड़े समूह में "अजीब लोगों" (odd ones out) को खोजने की कोशिश कर रहे हैं। आमतौर पर, यह आसान होता है यदि सभी एक ही प्रकार की वर्दी (जैसे सभी टी-शर्ट पहने हुए) पहने हों। लेकिन क्या होगा यदि कुछ लोग टी-शर्ट पहने हुए हैं, कुछ सूट पहने हुए हैं, और एक तीसरा समूह टोपी पहने हुए है? आप टी-शर्ट और सूट के बीच की दूरी को स्केल से नहीं माप सकते, क्योंकि वे पूरी तरह से अलग चीजें हैं।
यही वह समस्या है जिसे लेखक, एफ्थीमियोस कोस्टा और क्रिश्चियन हेनिग हल कर रहे हैं। उन्होंने डेटासेट में मिश्रित सतत संख्याओं (continuous numbers - जैसे कीमत या तापमान) और क्रमिक श्रेणियों (ordinal categories - जैसे 1 से 5 स्टार रेटिंग, या "कम/मध्यम/उच्च") में "आउटलेयर्स" (अजीब या संदिग्ध डेटा पॉइंट्स) को पहचानने के लिए एक नया तरीका बनाया है।
उनका दृष्टिकोण कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. रेटिंग के पीछे का "भूत" (The "Ghost" Behind the Rating)
मुख्य विचार एक जादू के खेल जैसा है। जब आप "5 में से 4 स्टार" की रेटिंग देखते हैं, तो लेखक कल्पना करते हैं कि इसके पीछे एक छिपा हुआ, अदृश्य नंबर (एक "भूत") है।
- रूपक (Metaphor): क्रमिक रेटिंग (1–5) को ब्लाइंड्स (पर्दों) वाली एक खिड़की के रूप में सोचें। आप पर्दे के बीच से आती हुई रोशनी (श्रेणी) देख सकते हैं, लेकिन आप पर्दे के पीछे की सूरज की सटीक चमक (सतत मान) नहीं देख सकते।
- विधि: वे मानते हैं कि हर "कम", "मध्यम" या "उच्च" रेटिंग के पीछे वास्तव में एक सुचारू, सतत संख्या (smooth, continuous number) है जो एक सामान्य बेल कर्व (normal bell curve) का पालन करती है। वे उस छिपे हुए नंबर का अनुमान लगाने के लिए गणित का उपयोग करते हैं जो संभवतः वह है। यह उन्हें इस योग्य बनाता है कि वे "5-स्टार" रेटिंग के साथ ऐसे व्यवहार कर सकें जैसे कि वह एक नियमित संख्या हो, ताकि वे इसकी तुलना "कीमत" या "दूरी" जैसी चीजों के साथ निष्पक्ष रूप से कर सकें।
2. "विश्वसनीय बहुमत" (The "Trustworthy Majority" - MCD)
अजीब लोगों को खोजने के लिए, आपको पहले यह जानने की आवश्यकता है कि "सामान्य" क्या दिखता है।
- रूपक: कल्पना कीजिए कि 100 लोगों का एक कमरा है। आप उन 5 लोगों को खोजना चाहते हैं जो अजीब व्यवहार कर रहे हैं। यदि आप पूरे समूह से उनकी औसत ऊंचाई पूछते हैं, तो वे 5 अजीब लोग परिणाम को प्रभावित कर सकते हैं, जिससे "औसत" गलत दिखाई दे सकता है।
- विधि: लेखक मिनिमम कोवेरिएंस डिटरमिनेंट (MCD) नामक एक टूल का उपयोग करते हैं। पूरे समूह को सुनने के बजाय, यह टूल उन लोगों के सबसे बड़े समूह (मान लीजिए 100 में से 75) को खोजता है जो एक-दूसरे के साथ सहमत दिखते हैं और एक सुसंगत घेरा बनाते हैं। यह समूह के "वास्तविक" औसत और फैलाव की गणना करने के लिए आउटलेयर्स को अनदेखा कर देता है। यह भीड़ के केंद्र को खोजने और यह कहने जैसा है कि, "ठीक है, यह है कि सामान्य क्या दिखता है।"
3. "दूरी की जाँच" (The "Distance Check")
एक बार जब उन्हें पता चल जाता है कि "सामान्य" समूह कैसा दिखता है, तो वे बाकी लोगों की उस केंद्र से दूरी की जाँच करते हैं।
- रूपक: कल्पना कीजिए कि आप "सामान्य" समूह के चारों ओर एक विशाल, अदृश्य बुलबुला बना रहे हैं। यदि कोई बिल्कुल बीच में खड़ा है, तो वह ठीक है। यदि कोई 100 मील दूर खड़ा है, तो वह एक आउटलेयर है।
- मोड़ (Twist): क्योंकि उनके पास मिश्रित डेटा प्रकार (कीमतें और रेटिंग) हैं, वे एक साधारण स्केल का उपयोग नहीं कर सकते। वे एक विशेष "बहुआयामी स्केल" (जिसे महलानोबिस डिस्टेंस कहा जाता है) का उपयोग करते हैं जो यह ध्यान रखता है कि चर (variables) एक-दूसरे से कैसे संबंधित हैं। उदाहरण के लिए, यदि उच्च कीमतें आमतौर पर उच्च रेटिंग के साथ जाती हैं, तो एक लिस्टिंग जिसमें उच्च कीमत है लेकिन खराब रेटिंग है, उसे "सामान्य से दूर" के रूप में चिह्नित किया जाएगा।
4. "टूटे हुए" डेटा को संभालना (Handling the "Broken" Data)
वास्तविक दुनिया का डेटा अव्यवस्थित होता है। कभी-कभी एक श्रेणी (जैसे "कमरे का प्रकार") एक छोटे समूह में केवल एक विकल्प हो सकती है, जो गणित को बिगाड़ देती है।
- समाधान: लेखकों ने एक "सुरक्षा जाल" (regularization) जोड़ा है। यदि गणित अटक जाता है या नंबर बहुत अधिक अनियत हो जाते हैं, तो वे गणनाओं को स्थिर रखने के लिए उन्हें धीरे से दिशा देते हैं, जिससे यह सुनिश्चित होता है कि वास्तविक दुनिया के अव्यवस्थित डेटा का सामना करते समय उनका तरीका विफल न हो।
5. वास्तविक दुनिया का परीक्षण: लंदन में Airbnb
यह सिद्ध करने के लिए कि उनका तरीका काम करता है, उन्होंने लंदन में Airbnb लिस्टिंग के डेटासेट पर इसका परीक्षण किया।
- डेटा: उन्होंने सतत संख्याओं (कीमत, सबवे से दूरी) और क्रमिक रेटिंग (स्वच्छता, अतिथि संतुष्टि) को देखा।
- निष्कर्ष: उनके तरीके ने 33 लिस्टिंग को "आउटलेयर्स" के रूप में पहचाना।
- "पर्यटक जाल" (The Tourist Trap): एक विशिष्ट लिस्टिंग को चिह्नित किया गया। यह मध्य लंदन के एक इलाके (साउथवार्क) में एक निजी कमरा था जिसकी कीमत दो लोगों के लिए दो रातों के लिए लगभग €13,000 थी। इतनी ऊंची कीमत के बावजूद, स्वच्छता और संतुष्टि की रेटिंग औसत दर्जे की थी। गणित ने कहा, "यह समझ में नहीं आता; यह एक आउटलेयर है।"
- अन्य विसंगतियाँ: उन्होंने उच्च स्वच्छता स्कोर लेकिन कम अतिथि संतुष्टि (एक अजीब विरोधाभास) वाली लिस्टिंग, और "कोई बेडरूम नहीं" वाले अपार्टमेंट पाए जो पूरे घर के रूप में सूचीबद्ध थे।
यह क्यों महत्वपूर्ण है
लेखक दिखाते हैं कि आपको अपने क्रमिक डेटा (जैसे रेटिंग) को फेंकने या उन्हें साधारण नंबरों में बदलने की आवश्यकता नहीं है जिससे उनका अर्थ खो जाए। श्रेणियों के पीछे "भूत" नंबरों की कल्पना करके और "सामान्य" समूह को खोजने के एक मजबूत तरीके का उपयोग करके, आप वास्तव में अजीब डेटा पॉइंट्स को पहचान सकते हैं जिन्हें मानक तरीके मिस कर सकते हैं।
संक्षेप में, उन्होंने एक जासूसी उपकरण बनाया है जो कठोर संख्याओं और व्यक्तिपरक रेटिंग दोनों को समझ सकता है, जिससे उन "पर्यटक जालों" और डेटा त्रुटियों को खोजने में मदद मिलती है जो सामने दिख रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।