← नवीनतम पेपर
📊 statistics

DeGLIF for Label Noise Robust Node Classification using GNNs

यह शोधपत्र DeGLIF का प्रस्ताव करता है, जो एक डीनॉइज़िंग तकनीक है जो शोर वाले नोड्स को मजबूती से पहचानने और पुन: लेबल करने के लिए ग्राफ न्यूरल नेटवर्क पर लीव-वन-आउट इन्फ्लुएंस फंक्शन्स का लाभ उठाता है, जिसमें शोर के मॉडल या स्तर के पूर्व ज्ञान की आवश्यकता नहीं होती है, जिससे मौजूदा बेसलाइनों की तुलना में बेहतर नोड वर्गीकरण सटीकता प्राप्त होती है।

मूल लेखक: Pintu Kumar, Nandyala Hemachandra

प्रकाशित 2026-08-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pintu Kumar, Nandyala Hemachandra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, मशीनें उदाहरणों का अध्ययन करके सीखती हैं, ठीक वैसे ही जैसे एक छात्र पाठ्यपुस्तक से सीखता है। लेकिन क्या होता है जब पाठ्यपुस्तक गलतियों (typos) से भरी हो, या इससे भी बुरा, जब पीछे दिए गए उत्तर ही गलत हों? यह 'नॉइजी लेबल्स' (noisy labels) की समस्या है। कई वास्तविक परिदृश्यों में, सोशल नेटवर्क का मानचित्रण करने से लेकर मेडिकल स्कैन से बीमारियों का निदान करने तक, डेटा को भीड़ या स्वचालित प्रणालियों द्वारा सस्ता और तेज़ी से एकत्र किया जाता है जो गलतियाँ कर सकते हैं। ये त्रुटियाँ केवल मामूली गड़बड़ियाँ नहीं हैं; उन प्रणालियों में जो सूचना के टुकड़ों के बीच संबंधों पर निर्भर करती हैं, एक गलत लेबल अफवाह की तरह फैल सकता है, जिससे उसके पड़ोसियों की समझ भ्रष्ट हो सकती है और पूरा सिस्टम विफल हो सकता है। वर्षों से, शोधकर्ता इन गलतियों के बावजूद प्रभावी ढंग से सीखने वाली मशीनें बनाने के लिए संघर्ष कर रहे हैं, अक्सर खराब डेटा को अनदेखा करने की कोशिश करते हैं या इस उम्मीद में रहते हैं कि अच्छा डेटा शोर (noise) को दबाने के लिए पर्याप्त होगा।

भारतीय प्रौद्योगिकी संस्थान बॉम्बे के शोधकर्ताओं की एक टीम ने इस समस्या को संभालने के लिए एक नया तरीका प्रस्तावित किया है, विशेष रूप से उस डेटा के लिए जो जुड़े हुए बिंदुओं के एक नेटवर्क के रूप में मौजूद है, जैसे कि सोशल मीडिया उपयोगकर्ता या रासायनिक अणु। वे अपने तरीके को DeGLIF कहते हैं। जटिल पैटर्न के आधार पर यह अनुमान लगाने के बजाय कि कौन से लेबल गलत हैं, या यह मानने के बजाय कि त्रुटि का एक विशिष्ट प्रकार है, उनका दृष्टिकोण एक सरल, प्रति-सहज (counter-intuitive) प्रश्न पूछता है: "यदि हम इस विशिष्ट डेटा पॉइंट को पूरी तरह से हटा दें तो हमारे मॉडल के प्रदर्शन पर क्या प्रभाव पड़ेगा?" एक छोटे, विश्वसनीय और साफ (clean) उदाहरणों के सेट पर एक एकल डेटा बिंदु को हटाने का अनुकरण करके और यह मापकर कि मॉडल की सटीकता कितनी सुधरती है, वे पहचान सकते हैं कि कौन से लेबल संभवतः भ्रष्ट हैं। यदि किसी नोड (node) को हटाने से मॉडल अधिक स्मार्ट बनता है, तो वह नोड शायद उसे गलत सबक सिखा रहा था।

शोधकर्ताओं ने इस प्रश्न का उत्तर देने के लिए एक गणितीय शॉर्टकट विकसित किया है, जो हर एक डेटा बिंदु के लिए हजारों बार अपने मॉडल को फिर से प्रशिक्षित करने के असंभव कार्य के बिना संभव है। उन्होंने 'लीव-वन-आउट इन्फ्लुएंस फंक्शन' (leave-one-out influence function) नामक अवधारणा का उपयोग किया, जो मॉडल की वर्तमान स्थिति को देखकर एक डेटा बिंदु के प्रभाव का अनुमान लगाता है। जुड़े हुए नेटवर्क के संदर्भ में, यह विशेष रूप से कठिन है क्योंकि एक बिंदु को हटाने से उसके पड़ोसियों के साथ संबंध भी टूट जाते हैं, जिससे सभी के लिए सूचना का प्रवाह बदल जाता है। टीम ने इन संरचनात्मक परिवर्तनों को ध्यान में रखने के लिए मौजूदा तरीकों का विस्तार किया, जिससे वे यह गणना कर सके कि एक विशिष्ट नोड मॉडल के स्वच्छ डेटा पर भविष्यवाणियों को कितना प्रभावित करता है। यदि किसी नोड की उपस्थिति मॉडल को स्वच्छ डेटा पर खराब प्रदर्शन करने के लिए मजबूर करती है, तो सिस्टम उसे 'नॉइजी' के रूप में चिह्नित करता है।

एक बार जब एक नॉइजी नोड की पहचान हो जाती है, तो सिस्टम उसे केवल फेंक नहीं देता है, जिससे मूल्यवान जानकारी बर्बाद हो जाती है। इसके बजाय, यह गलती को सुधारने का प्रयास करता है। एक नोड के लिए जिसका लेबल गलत है, सिस्टम देखता है कि मॉडल वर्तमान में उस नोड के लिए क्या भविष्यवाणी कर रहा है और लेबल को सबसे संभावित सही क्लास में बदल देता है। शोधकर्ताओं ने सैद्धांतिक रूप से सिद्ध किया कि लेबल को सुधारने की यह प्रक्रिया नोड को पूरी तरह से हटाने की तुलना में गणितीय रूप से बेहतर है, क्योंकि यह नेटवर्क में नोड के संरचनात्मक मूल्य को बनाए रखते हुए उसकी पहचान को ठीक करती है। उन्होंने वैज्ञानिक पत्रों और उत्पाद समीक्षाओं के बड़े संग्रहों सहित कई मानक डेटासेट्स पर इस दृष्टिकोण का परीक्षण किया, जिसमें लेबल में विभिन्न स्तर की रैंडम त्रुटियां डाली गईं। इन परीक्षणों में, उनके तरीके ने लगातार मौजूदा अत्याधुनिक तकनीकों को पछाड़ते हुए प्रदर्शन किया, और कुछ मामलों में सटीकता में लगभग 18 प्रतिशत तक सुधार किया।

अध्ययन ने यह भी पता लगाया कि विभिन्न परिस्थितियों में यह विधि कैसे व्यवहार करती है। उन्होंने पाया कि यह प्रणाली तब भी अच्छी तरह काम करती है जब विश्वसनीय और स्वच्छ डेटा का सेट बहुत छोटा होता है, जो कुल डेटासेट का दो प्रतिशत से भी कम होता है। उन्होंने देखा कि यह विधि विभिन्न प्रकार की नेटवर्क संरचनाओं में मजबूत है, चाहे कनेक्शन विरल (sparse) हों या सघन (dense), और इसे यह जानने की आवश्यकता नहीं है कि कितने एरर मौजूद हैं या त्रुटियों का प्रकार क्या है। वास्तव में, शोधकर्ताओं ने दिखाया कि वे इस विधि को बार-बार लागू कर सकते हैं; सफाई के पहले दौर के बाद, डेटा अधिक स्वच्छ हो जाता है, और दूसरा दौर और भी अधिक त्रुटियों को पहचान और ठीक कर सकता है। हालांकि प्रारंभिक गणना के लिए नेटवर्क की संरचना का विश्लेषण करने के लिए महत्वपूर्ण कंप्यूटिंग पावर की आवश्यकता थी, शोधकर्ताओं ने दिखाया कि यह विधि बड़े पैमाने के डेटासेट्स पर भी चल सकती है जहाँ अन्य प्रतिस्पर्धी एल्गोरिदम मेमोरी सीमाओं के कारण विफल हो जाते हैं।

परिणाम बताते हैं कि यह दृष्टिकोण शोर के स्रोत को जाने बिना अव्यवस्थित डेटा को साफ करने के लिए एक बहुमुखी उपकरण प्रदान करता है। शोर (noise) को मॉडल करने के बजाय, प्रत्येक डेटा बिंदु के वास्तविक प्रभाव पर ध्यान केंद्रित करके, सिस्टम प्रभावी रूप से सिग्नल को स्टेटिक (static) से अलग कर सकता है। शोधकर्ताओं ने उल्लेख किया कि हालांकि यह विधि गणनात्मक रूप से गहन (computationally intensive) है, फिर भी यह एक शक्तिशाली प्रीप्रोसेसिंग स्टेप के रूप में कार्य करती है जिसे प्रदर्शन को और बढ़ाने के लिए अन्य लर्निंग तकनीकों के साथ जोड़ा जा सकता है। एक ऐसे परिदृश्य में जहाँ उच्च गुणवत्ता वाला डेटा महंगा और दुर्लभ है, इस तरह के शोर भरे, अविश्वसनीय डेटासेट को एक स्वच्छ, भरोसेमंद डेटासेट में बदलने की क्षमता जुड़ी हुई डेटा पर मशीन लर्निंग के लिए एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करती है। यह कार्य एक व्यावहारिक प्रदर्शन है कि व्यक्तिगत डेटा बिंदुओं के प्रभाव को समझना अधिक लचीले और सटीक आर्टिफिशियल इंटेलिजेंस सिस्टम की ओर ले जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →