← नवीनतम पेपर
📊 statistics

Cellwise Outliers

यह शोध पत्र अनुमान (estimation), प्रतिगमन (regression) और मुख्य घटक विश्लेषण (principal component analysis) सहित विभिन्न सांख्यिकीय विधियों में सेलवाइज आउटलेयर्स (cellwise outliers)—जो डेटा मैट्रिसेस के भीतर व्यक्तिगत त्रुटिपूर्ण मान होते हैं जो पूरे केस को दूषित कर सकते हैं—का पता लगाने और उन्हें संभालने में हालिया प्रगति की समीक्षा करता है, जो उच्च-आयामी परिवेशों में पारंपरिक केसवाइज (casewise) दृष्टिकोणों पर उनके बढ़ते प्रभुत्व को रेखांकित करता है।

मूल लेखक: Mia Hubert, Jakob Raymaekers, Peter J. Rousseeuw

प्रकाशित 2026-04-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mia Hubert, Jakob Raymaekers, Peter J. Rousseeuw

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"खराब सेब" बनाम "खराब निवाला": सेलवाइज आउटलेयर्स (Cellwise Outliers) के लिए एक मार्गदर्शिका

कल्पना कीजिए कि आप 1,000 मेहमानों के लिए एक विशाल दावत तैयार कर रहे हैं। आपके पास हर व्यंजन के लिए हर सामग्री की सूची वाली एक विशाल स्प्रेडशीट है: आटा, चीनी, अंडे, मसाले, आदि।

पुराना तरीका: पूरे व्यंजन को फेंक देना (केसवाइज आउटलेयर्स - Casewise Outliers)

दशकों से, सांख्यिकीविदों (statisticians) ने डेटा के साथ ऐसा व्यवहार किया: यदि किसी एक मेहमान के व्यंजन में कोई गलती थी, तो उन्होंने माना कि पूरा व्यंजन ही खराब हो गया है।

  • परिदृश्य: यदि मेहमान संख्या #42 के लिए "अंडे" वाले कॉलम में "2" के बजाय "1,000 अंडे" लिखा था, तो पुराने तरीके ने कहा, "ओह नहीं, मेहमान #42 एक आपदा है! चलिए उनका पूरा ऑर्डर (उनकी सभी सामग्रियां) फेंक देते हैं और उन्हें पूरी तरह से अनदेखा कर देते हैं।"
  • समस्या: क्या होगा अगर मेहमान #42 ने केवल अंडों में गलती की थी, लेकिन उनका आटा, चीनी और मसाले एकदम सही थे? पूरे ऑर्डर को फेंककर, आप बहुत सारी अच्छी जानकारी खो देते हैं। उच्च-आयामी डेटा (high-dimensional data) में, जहाँ आपके पास सैकड़ों चर (variables) होते हैं, यह एक पूरी पिज्जा को फेंक देने जैसा है क्योंकि उसके एक स्लाइस का क्रस्ट थोड़ा जला हुआ है।

नया तरीका: सिर्फ खराब निवाले को ठीक करना (सेलवाइज आउटलेयर्स - Cellwise Outliers)

यह पेपर सेलवाइज आउटलेयर्स नामक सोचने के एक नए तरीके को पेश करता है। पूरी पंक्ति (पूरे मेहमान/व्यंजन) को देखने के बजाय, हम व्यक्तिगत सेल्स (व्यक्तिगत सामग्रियां) को देखते हैं।

  • परिदृश्य: हम देखते हैं कि "1,000 अंडे" वाली गलती है। पूरे ऑर्डर को फेंकने के बजाय, हम बस कहते हैं, "हे, अंडे गलत हैं। आइए उस एक सेल को ठीक करें या केवल उस एक सामग्री को अनदेखा करें, लेकिन आटा और चीनी को बरकरार रखें।"
  • चुनौती: यह बहुत कठिन है। यदि आपके पास 100 चर हैं, तो कुछ गलत सामग्रियां भी आपके अधिकांश मेहमानों के ऑर्डर को खराब कर सकती हैं। यदि आपकी 5% सामग्रियां गलत हैं, और प्रत्येक व्यंजन में 20 सामग्रियां हैं, तो सांख्यिकीय रूप से, लगभग हर मेहमान के पास कम से कम एक खराब सामग्री होगी। पुराना "पूरा व्यंजन फेंक देने वाला" तरीका यहाँ विफल हो जाता है क्योंकि आप लगभग सभी को फेंक देंगे।

मुख्य समस्या: हम पुराने उपकरणों का उपयोग क्यों नहीं कर सकते?

लेखक बताते हैं कि जो गणितीय नियम हमने "पुराने तरीके" (केसवाइज) के लिए उपयोग किए थे, वे "नए तरीके" (सेलवाइज) के लिए काम नहीं करते हैं।

कठोर रूलर (Rigid Ruler) की उपमा:
कल्पना कीजिए कि आपके पास एक कठोर रूलर है जिसे आपको हर स्थिति में बिल्कुल सीधा रहना चाहिए (इसे गणित में इक्विवेरिएंस कहा जाता है)।

  • पुराना नियम: यदि आपके पास डेटा की एक सीधी रेखा है, तो रूलर को उसी रेखा पर रहना चाहिए।
  • सेलवाइज जाल: यदि आपके पास डेटा की एक सीधी रेखा है, लेकिन किसी ने अलग-अलग जगहों पर कुछ "खराब निवाले" (आउटलेयर्स) डाल दिए हैं, तो वह कठोर रूलर टूट जाता है। इन खराब निवालों को ठीक करने के लिए बिना रूलर को तोड़े, आपको उस नियम को छोड़ना होगा कि रूलर को हर स्थिति में पूरी तरह सीधा रहना चाहिए। आपको लचीला होना पड़ेगा।

यह पेपर साबित करता है कि इन "खराब निवालों" को संभालने के लिए, हमें अपने पसंदीदा, सहज गणितीय नियमों को छोड़ना होगा। यह कष्टदायक है, लेकिन आवश्यक है।


समाधान: हम इसे कैसे ठीक करते हैं?

यह पेपर इन खराब निवालों को संभालने के लिए नए उपकरण बनाने की एक दशक की प्रगति की समीक्षा करता है। यहाँ इस कहानी के मुख्य पात्र हैं:

1. जासूस (DDC - डिटेक्ट डेविएटिंग सेल्स)

डेटा को ठीक करने से पहले, हमें खराब निवालों को ढूंढना होगा।

  • यह कैसे काम करता है: कल्पना कीजिए कि आप एक कार के स्पेसिफिकेशन की जांच कर रहे हैं। यदि एक कार की चौड़ाई बहुत कम है लेकिन टॉप स्पीड बहुत अधिक है, तो यह संदिग्ध है। DDC एल्गोरिदम एक जासूस की तरह काम करता है। यह देखता है कि चर एक-दूसरे से कैसे संबंधित हैं। यदि "चौड़ाई" आमतौर पर "टॉप स्पीड" के साथ जाती है, और एक कार उस पैटर्न को तोड़ती है, तो जासूस उस विशिष्ट सेल को संदिग्ध के रूप में चिह्नित करता है, भले ही वह चौड़ाई का नंबर अपने आप में सामान्य दिखे।
  • दृश्य: वे एक "सेलमैप" (हीट मैप की तरह) का उपयोग करते हैं। नीले सेल अपेक्षित से कम हैं, लाल सेल अधिक हैं। यह अच्छे डेटा के समुद्र में खराब निवालों को उजागर करता है।

2. सर्जन (CellMCD और CellLTS)

एक बार जब हम खराब निवालों को ढूंढ लेते हैं, तो हमें खराब निवालों को परिणामों को विकृत करने से बचाते हुए डेटा के "वास्तविक" औसत और फैलाव का अनुमान लगाना होता है।

  • CellMCD: यह विधि एक सर्जन की तरह काम करती है। यह एक साथ फिट होने वाले "साफ" सेल्स के सबसे बड़े समूह को खोजने का प्रयास करती है। यह खराब निवालों को अनदेखा करती है और केवल स्वस्थ सेल्स के आधार पर औसत की गणना करती है।
  • CellLTS (भविष्यवाणी मशीन): यह भविष्यवाणियां करने के लिए विशेष है। कल्पना कीजिए कि आप किसी कार की विशेषताओं के आधार पर उसकी कीमत का अनुमान लगा रहे हैं। एक नई कार आती है, लेकिन उसका "एक्सेलरेशन" (त्वरण) नंबर एक टाइपिंग की गलती (एक खराब निवाला) है।
    • पुराना तरीका: आप उस गलती का उपयोग करते हैं, और आपकी भविष्यवाणी बहुत अजीब हो जाती है।
    • CellLTS: यह कहता है, "रुको, वह एक्सेलरेशन नंबर अजीब है। आइए अनुमान लगाएं कि अन्य विशेषताओं के आधार पर वह क्या होना चाहिए, उसे ठीक करें, और फिर भविष्यवाणी करें।" यह परिणाम की गणना करने से पहले खराब डेटा को भर देता है (impute करता है)।

3. हाई-डायमेंशनल हीरो (विशाल डेटा के लिए)

जब आपके पास हजारों चर होते हैं (जैसे DNA डेटा या इमेज पिक्सल), तो पुराने तरीके धीमे और भ्रमित हो जाते हैं।

  • समाधान: FastDDC और CellPCA जैसे नए तरीके चालाक शॉर्टकट का उपयोग करते हैं। वे हर एक संबंध को नहीं देखते; वे खराब निवालों को जल्दी से खोजने के लिए "रैपिंग" तकनीकों और तेज़ स्क्रीनिंग का उपयोग करते हैं, भले ही डेटा में लाखों आयाम हों।
  • टेन्सर डेटा (3D ब्लॉक): कभी-कभी डेटा एक सपाट शीट (2D) नहीं बल्कि एक 3D ब्लॉक होता है (जैसे एक वीडियो, जो फ्रेम्स x ऊंचाई x चौड़ाई है)। पेपर में ROMPCA पर चर्चा की गई है, जो एक वीडियो फ्रेम को 3D ब्लॉक की तरह मानता है। यदि वीडियो के कुछ पिक्सल ग्लिच (खराब सेल्स) कर रहे हैं, तो ROMPCA पूरे वीडियो फ्रेम को फेंकने के बजाय केवल उन पिक्सल्स को ठीक करता है।

यह क्यों मायने रखता है?

अतीत में, यदि आपके डेटा में कुछ गड़बड़ नंबर थे, तो आपको एक साफ परिणाम प्राप्त करने के लिए अपने आधे डेटासेट को फेंकना पड़ सकता था। यह बर्बादी है।

यह पेपर हमें दिखाता है कि हम स्मार्ट और सर्जिकल हो सकते हैं। हम:

  1. पहचान सकते हैं कि कौन से नंबर गलत हैं।
  2. केवल उन विशिष्ट नंबरों को ठीक या अनदेखा कर सकते हैं।
  3. पंक्ति के बाकी हिस्से से सारी अच्छी जानकारी को बनाए रख सकते हैं।

यह हमें वास्तविक दुनिया के अव्यवस्थित डेटा (जो त्रुटियों से भरा होता है) का विश्लेषण करने की अनुमति देता है, बिना उसके भीतर छिपी मूल्यवान अंतर्दृष्टि को खोए। यह एक सेब के एक हिस्से में दाग होने के कारण पूरे सेब को फेंक देने के बजाय, केवल दाग को काटकर बाकी हिस्सा खाने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →