← नवीनतम पेपर
📊 statistics

A Jensen-Shannon divergence based kk--NNNN algorithm for missing value imputation in compositional data

यह शोध पत्र कंपोजिशनल डेटा में लुप्त मानों (missing values) को भरने के लिए एक नवीन नॉनपैरामीट्रिक kk-NN एल्गोरिदम प्रस्तावित करता है जो शून्य मानों को संभालने और हाइपर-पैरामीटर्स को स्व-अनुकूलित करने के लिए जेन्सन-शैनन डाइवर्जेंस (Jensen-Shannon divergence) और फ्रेचेट मीन (Fréchet mean) का लाभ उठाता है, जो मौजूदा विधियों की तुलना में बेहतर सटीकता और गणनात्मक दक्षता प्रदर्शित करता है।

मूल लेखक: Michail Tsagris, Connie Stewart, Abdulaziz Alenazi

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michail Tsagris, Connie Stewart, Abdulaziz Alenazi

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक गुप्त पारिवारिक रेसिपी को फिर से बनाने की कोशिश कर रहे हैं। आपके पास रेसिपी कार्डों का एक ढेर है, लेकिन कुछ फटे हुए हैं या उनमें कुछ सामग्री (ingredients) लिखी ही नहीं गई है। आपका लक्ष्य यह अनुमान लगाना है कि वे गायब सामग्री क्या हैं ताकि आप व्यंजनों को पूरा कर सकें।

डेटा साइंस की दुनिया में, इसे इम्प्यूटेशन (imputation) (खाली जगहों को भरना) कहा जाता है। लेकिन यह पेपर एक बहुत ही विशिष्ट, जटिल प्रकार की रेसिपी के बारे में है: कंपोजिशनल डेटा (Compositional Data)

"कंपोजिशनल डेटा" क्या है?

एक पाई चार्ट (pie chart) के बारे में सोचें। पूरा पाई हमेशा 100% के बराबर होता है। यदि आपके पास "सेब" का एक टुकड़ा और "संतरे" का एक टुकड़ा है, और आप सेब का हिस्सा बढ़ाते हैं, तो संतरे का हिस्सा छोटा होना ही चाहिए ताकि कुल योग 100% बना रहे।

यह एक सामान्य किराने की सूची से अलग है जहाँ आप बिना एक-दूसरे को प्रभावित किए 5 सेब और 10 संतरे रख सकते हैं। कंपोजिशनल डेटा में, हिस्से एक नृत्य में बंधे होते हैं; यदि एक हिलता है, तो दूसरों को तालमेल बिठाना पड़ता है। यह गायब संख्याओं को भरना बहुत कठिन बना देता है क्योंकि आप केवल एक संख्या का अनुमान नहीं लगा सकते; आपको एक ऐसी संख्या का अनुमान लगाना होगा जो पूरे पाई चार्ट में पूरी तरह फिट बैठती हो।

पुराने तरीकों के साथ समस्या

वर्षों तक, वैज्ञानिकों ने इन "पाई चार्ट" में गायब हिस्सों को ठीक करने के लिए k-NN (k-Nearest Neighbors) नामक एक विधि का उपयोग किया।

  • यह कैसे काम करता है: यदि आपकी रेसिपी में "नमक" गायब है, तो कंप्यूटर आपके जैसी ही अन्य रेसिपी देखता है। वह देखता है कि उन समान रेसिपी में नमक का उपयोग कैसे किया गया था और वह अनुमान लगाता है कि आपने भी शायद कुछ वैसा ही उपयोग किया होगा।
  • दोष: समानता मापने का पुराना तरीका (जिसे एिचिसन डिस्टेंस/Aitchison's distance कहा जाता है) दो शहरों के बीच की दूरी को एक सपाट मानचित्र पर स्केल से मापने जैसा है, जबकि पृथ्वी गोल है। यह कभी-कभी ठीक काम करता है, लेकिन यह तब विफल हो जाता है जब आपकी रेसिपी में कोई सामग्री शून्य (zero) हो (जैसे, "जैतून नहीं है")। पुरानी गणित में, यदि कोई संख्या शून्य है, तो आप दूरी की गणना नहीं कर सकते, जिससे पूरा सिस्टम क्रैश हो जाता है।

नया समाधान: "जेनसन-शैनन" दिशा-सूचक यंत्र (The "Jensen-Shannon" Compass)

लेखकों ने समानता मापने के लिए एक नया, स्मार्ट दिशा-सूचक यंत्र बनाया है। वे इसे जेनसन-शैनन डायवर्जेंस (Jensen-Shannon Divergence - JSD) कहते हैं।

  • उपमा (Analogy): कल्पना कीजिए कि आप दो स्मूदी (smoothies) की तुलना कर रहे हैं। पुराना तरीका भ्रमित हो सकता है यदि एक स्मूदी में स्ट्रॉबेरी शून्य है। नया JSD तरीका एक स्मार्ट ब्लेंडर की तरह है जो कहता है, "ठीक है, आपके पास स्ट्रॉबेरी शून्य है, लेकिन आपके पास बहुत सारे केले हैं। आइए पूरे मिश्रण के फ्लेवर प्रोफाइल की तुलना करें, इस बात को नजरअंदाज करते हुए कि एक सामग्री गायब है।"
  • लाभ: यह नया तरीका तब भी पूरी तरह से काम करता है जब डेटा में शून्य (zeros) हों। यह टूटता नहीं है; यह बस खुद को ढाल लेता है।

"मैजिक डायल" (The "Magic Dial" - Fréchet Mean)

लेखकों ने यहीं नहीं रुकते। उन्होंने अपने एल्गोरिदम में एक "मैजिक डायल" (एक पैरामीटर जिसे α\alpha कहा जाता है) जोड़ा।

  • उपमा: कल्पना कीजिए कि आप गायब सामग्री का अनुमान लगाने के लिए अपने पड़ोसियों की राय का औसत निकाल रहे हैं।
    • यदि आप केवल अरिथमेटिक मीन (Arithmetic Mean) (मानक औसत) लेते हैं, तो आप एक सख्त शिक्षक की तरह हैं: "हर किसी को समान महत्व मिलेगा।"
    • यदि आप जियोमेट्रिक मीन (Geometric Mean) का उपयोग करते हैं, तो आप एक सतर्क संपादक की तरह हैं: "हम चरम आंकड़ों (outliers) को अनदेखा करेंगे।"
    • फ्रेच मीन (Fréchet Mean) एक लचीले मध्यस्थ की तरह है। "मैजिक डायल" (α\alpha) आपको सख्त होने, सतर्क होने, या इन दोनों के बीच कहीं भी रहने की सुविधा देता है। कंप्यूटर आपके विशिष्ट डेटा के लिए सही संतुलन खोजने के लिए इस डायल को स्वचालित रूप से ट्यून कर सकता है।

"स्व-अनुकूलन" (Self-Adapting) विशेषता

कभी-कभी, गायब डेटा यादृच्छिक (random) नहीं होता है। हो सकता है कि "नमक" केवल मसालेदार व्यंजनों में गायब हो, जबकि "चीनी" केवल मीठे व्यंजनों में गायब हो।

  • लेखकों ने अपने टूल का एक एडेप्टिव (Adaptive) संस्करण बनाया है। पूरे कुकबुक के लिए एक ही नियम लागू करने के बजाय, यह संस्करण इस बात को देखता है कि डेटा कैसे गायब है और प्रत्येक विशिष्ट पैटर्न के लिए अपनी रणनीति बदल देता है। यह हर प्रकार के व्यंजन के लिए एक अलग शेफ रखने जैसा है।

उन्हें क्या मिला?

टीम ने वास्तविक दुनिया के डेटा का उपयोग करके अपने नए टूल का पुराने तरीकों के विरुद्ध परीक्षण किया, जैसे:

  1. वाइन केमिस्ट्री: चेक (Czech) वाइन में एसिड का विश्लेषण।
  2. नदी का पानी: स्पेनिश नदियों में रासायनिक स्तर की जांच।
  3. मछलियों का आहार: मछलियों में फैटी एसिड की जांच (जहाँ कुछ मछलियाँ कुछ चीजें बिल्कुल नहीं खातीं, जिससे "शून्य" मान बनते हैं)।
  4. कृषि फसलें: ग्रीक क्षेत्रों में विशिष्ट फसलों की खेती कितनी हुई।

परिणाम:

  • सटीकता (Accuracy): उनका नया तरीका पुराने तरीकों की तुलना में लगातार अधिक सटीक था। उन्होंने गायब संख्याओं का अनुमान सच्चाई के अधिक करीब लगाया।
  • गति (Speed): यह बहुत तेज़ था। कुछ परीक्षणों में, पुराने तरीके को वही काम करने में 12 से 25 गुना अधिक समय लगा।
  • शून्य (Zeros): इसने "शून्य" मानों को बिना किसी परेशानी के संभाला, जबकि पुराने तरीके संघर्ष करते थे या विफल हो जाते थे।

मुख्य निष्कर्ष (The Bottom Line)

लेखकों ने "पाई चार्ट" डेटा के गायब हिस्सों को भरने का एक नया, तेज़ और अधिक लचीला तरीका बनाया है। यह तब भी काम करता है जब कुछ हिस्से पूरी तरह खाली (शून्य) हों, और यह सबसे अच्छे परिणामों के लिए अपनी सेटिंग्स को खुद एडजस्ट करने के लिए एक स्मार्ट "मैजिक डायल" का उपयोग करता है। हालांकि "स्व-अनुकूलन" (self-adapting) विशेषता शानदार है, उन्होंने पाया कि कभी-कभी सरल संस्करण भी उतना ही अच्छा होता है और कम जटिल होता है।

नोट: यह पेपर पूरी तरह से गणित और सिमुलेशन परिणामों पर केंद्रित है। यह दावा नहीं करता है कि यह कोई चिकित्सा उपचार या भविष्य के नैदानिक उपयोग के लिए कोई विशिष्ट उपकरण है, बल्कि यह अर्थशास्त्र, पारिस्थितिकी और रसायन विज्ञान जैसे क्षेत्रों में डेटा को संभालने के लिए एक सांख्यिकीय सुधार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →