← नवीनतम पेपर
💻 computer science

Probabilistic Multi-dimensional Classification with Incomplete Data

यह शोधपत्र मिश्रित और अपूर्ण डेटा वाले बहु-आयामी वर्गीकरण के लिए एक नवीन, स्केलेबल और सुदृढ़ संभाव्य दृष्टिकोण प्रस्तावित करता है, जो इसके एल्गोरिदम के लिए सैद्धांतिक आधार और विभिन्न लुप्तता परिदृश्यों में इसकी प्रभावशीलता के अनुभवजन्य साक्ष्य प्रदान करता है।

मूल लेखक: Thu Ha Do, Kim-Dung Tran, Vu-Linh Nguyen, Yves Grandvalet, Sébastien Destercke

प्रकाशित 2026-09-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thu Ha Do, Kim-Dung Tran, Vu-Linh Nguyen, Yves Grandvalet, Sébastien Destercke

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डेटा साइंस की दुनिया में, कंप्यूटरों से अक्सर पिछले उदाहरणों से सीखे गए पैटर्न के आधार पर भविष्यवाणियां करने के लिए कहा जाता है। कल्पना कीजिए कि एक डॉक्टर किसी मरीज के निदान (diagnosis) करने की कोशिश कर रहा है। डॉक्टर लक्षणों की एक सूची, रक्त परीक्षण के परिणाम और मेडिकल हिस्ट्री को देखता है ताकि एक साथ कई चीजों की भविष्यवाणी की जा सके: बीमारी का विशिष्ट प्रकार, उसकी गंभीरता का स्तर, और विभिन्न उपचारों के प्रति मरीज की प्रतिक्रिया कैसी हो सकती है। यह एक जटिल कार्य है क्योंकि डेटा मिश्रित है; कुछ जानकारी संख्यात्मक (numerical) है, जैसे तापमान का स्तर, जबकि अन्य जानकारी श्रेणीगत (categorical) है, जैसे कि एक निदान जो कई अलग-अलग श्रेणियों में से एक हो सकता है। इसके अलावा, वास्तविक दुनिया का डेटा शायद ही कभी पूर्ण होता है। हो सकता है कि कोई मरीज लक्षण बताना भूल जाए, या कोई लैब टेस्ट परिणाम देने में विफल रहे। जब एक कंप्यूटर मॉडल ऐसे अधूरे रिकॉर्ड से सीखने की कोशिश करता है, तो उसे अक्सर संघर्ष करना पड़ता है, विशेष रूप से तब जब वे हिस्से गायब हों जो श्रेणियों को परिभाषित करते हैं।

यह चुनौती 'मल्टी-डायमेंशनल क्लासिफिकेशन' (बहु-आयामी वर्गीकरण) नामक क्षेत्र के केंद्र में स्थित है। सरल कार्यों के विपरीत जहाँ कंप्यूटर केवल एक परिणाम की भविष्यवाणी करता है, मल्टी-डायमेंशनल क्लासिफिकेशन मशीन से एक साथ परिणामों का पूरा सेट बताने के लिए कहता है। जब डेटा अधूरा होता है, तो यह कठिनाई और बढ़ जाती है। यदि मॉडल ने अपने प्रशिक्षण (training) के दौरान गायब जानकारी के किसी विशिष्ट संयोजन को नहीं देखा है, तो वह बाद में ऐसी स्थिति आने पर विश्वसनीय अनुमान लगाने में विफल हो सकता है। शोधकर्ता लंबे समय से एक ऐसा तरीका खोजने की कोशिश कर रहे हैं जिससे वे सूचना के विभिन्न टुकड़ों के बीच सूक्ष्म संबंधों को खोजने की अपनी क्षमता खोए बिना इस अव्यवस्था को संभाल सकें।

फ्रांस के 'यूनिवर्सिटे डी टेक्नोलॉजी डी कॉम्पिएग्ने' के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है। उन्होंने एक प्रणाली बनाई जिसे 'हाइब्रिड प्रोबेबिलिस्टिक मल्टी-डायमेंशनल क्लासिफायर' कहा जाता है। इस प्रणाली को एक लचीले मानचित्र (map) के रूप में समझें जिसे कंप्यूटर यह समझने के लिए बनाता है कि सूचना के विभिन्न हिस्से एक-दूसरे से कैसे संबंधित हैं। पिछले तरीकों में, कंप्यूटर को अक्सर दो कठिन विकल्पों में से एक को चुनने के लिए मजबूर किया जाता था: या तो वह चरों (variables) के बीच जटिल संबंधों को संभाल सकता था लेकिन डेटा गायब होने पर क्रैश हो जाता था, या वह गायब डेटा को संभाल सकता था लेकिन उसे सरल रहने के लिए चरों के बीच के सूक्ष्म संबंधों को नजरअंदाज करना पड़ता था। नया तरीका इस अंतर को पाटता है। यह कंप्यूटर को तब भी डेटा से सीखने की अनुमति देता है जब प्रशिक्षण के दौरान कुछ श्रेणीगत मान (categorical values) गायब हों, और यह कंप्यूटर को भविष्यवाणी करने की अनुमति देता है जब परीक्षण के दौरान वे ही मान गायब हों।

शोधकर्ताओं ने अपने सिस्टम का परीक्षण तीन वास्तविक दुनिया के डेटासेट्स पर किया जिनमें मिश्रित प्रकार के डेटा शामिल थे। एक डेटासेट में वयस्कों से जुड़ी जानकारी शामिल थी, जैसे उनकी आय और शिक्षा का स्तर, ताकि विभिन्न जनसांख्यिकीय श्रेणियों की भविष्यवाणी की जा सके। दूसरा क्रेडिट डिफॉल्ट (ऋण चूक) पर केंद्रित था, और तीसरा थायराइड रोग के निदान से संबंधित था। अपने प्रयोगों में, उन्होंने रिकॉर्ड से जानकारी को जानबूझकर हटाया, जिससे उन परिदृश्यों का अनुकरण हुआ जहाँ श्रेणीगत विशेषताओं का 80 प्रतिशत तक गायब था, या जहाँ परिणामों की पूरी श्रेणियां अज्ञात थीं। उन्होंने अपने नए तरीके की तुलना पुराने तकनीकों से की जो गायब डेटा के लिए केवल सबसे सामान्य उत्तर का अनुमान लगाती थीं या अनुमानों से खाली जगहों को भरने की कोशिश करती थीं।

परिणामों ने दिखाया कि नया हाइब्रिड दृष्टिकोण काफी अधिक मजबूत (robust) था। जब कंप्यूटर से गायब जानकारी के साथ परिणाम बताने के लिए कहा गया, तो नए तरीके ने लगातार पुराने बेसलाइन्स से बेहतर प्रदर्शन किया। यह "ऑप्टिमिस्टिक" (आशावादी) और "एवरेजिंग" (औसत निकालने वाली) रणनीतियों को संभालने में विशेष रूप से प्रभावी था, जो अनिश्चितता से निपटने के तरीके हैं। हार मानने या अंधे होकर अनुमान लगाने के बजाय, मॉडल ने उपलब्ध डेटा से सीखे गए संबंधों का उपयोग करके सबसे संभावित गायब हिस्सों का निष्कर्ष निकाला। उदाहरण के लिए, थायराइड डेटासेट पर, जहाँ एक परिणाम अत्यधिक सामान्य था, नए तरीके ने फिर भी दुर्लभ परिणामों के लिए भविष्यवाणियों में सुधार करने में सफलता प्राप्त की, जो अक्सर सही होने के लिए सबसे महत्वपूर्ण होते हैं। शोधकर्ताओं ने पाया कि उनका सिस्टम उच्च सटीकता बनाए रख सकता है भले ही प्रशिक्षण डेटा स्वयं अधूरा हो, जो कि एक ऐसी स्थिति थी जिसे प्रबंधित करना पहले बहुत कठिन था।

एक प्रमुख निष्कर्ष यह था कि सिस्टम को अच्छा काम करने के लिए अत्यधिक जटिल होने की आवश्यकता नहीं थी। चरों के बीच सीखने के लिए मॉडल द्वारा बनाए जाने वाले कनेक्शनों की संख्या को सीमित करके, शोधकर्ताओं ने गणना को प्रबंधनीय रखा जबकि आवश्यक निर्भरताओं को भी पकड़ा। उन्होंने यह भी खोजा कि एक विशिष्ट प्रकार का गणितीय स्कोरिंग नियम, जिसे 'बायेसियन इंफॉर्मेशन क्राइटेरियन' (Bayesian Information Criterion) के रूप में जाना जाता है, मॉडल को जटिलता के सही स्तर को चुनने में मदद करता है, जिससे यह डेटा के शोर (noise) के प्रति ओवरफिट होने से बच जाता है। हालांकि यह प्रणाली पूर्ण नहीं है और जब गायब चरों की संख्या अत्यंत बड़ी हो जाती है तो अभी भी कम्प्यूटेशनल चुनौतियों का सामना करती है, फिर भी यह एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करती है। यह उन स्थितियों के लिए एक व्यावहारिक उपकरण प्रदान करती है जहाँ डेटा अव्यवस्थित और अधूरा है, जिससे मशीनें स्वास्थ्य सेवा से लेकर वित्त जैसे क्षेत्रों में बेहतर निर्णय ले सकती हैं, जहाँ गायब जानकारी एक अपवाद नहीं बल्कि एक नियम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →