← नवीनतम पेपर
🤖 machine learning

Geometric Regularization for Long-Tailed Semi-Supervised Learning via Gaussian Feature Bridges

यह शोधपत्र गॉसियन ब्रिज कंसिस्टेंसी (GBC) प्रस्तुत करता है, जो लॉन्ग-टेल्ड सेमी-सुपरवाइज्ड लर्निंग के लिए एक नवीन ढांचा है जो अनलेबल नमूनों और विकसित होते क्लास प्रोटोटाइप्स के बीच डायनेमिक गॉसियन फीचर ब्रिजेस का निर्माण करके स्मूथ सिमेंटिक ट्रेजेक्टरीज के साथ ज्योमेट्रिक कंसिस्टेंसी को लागू करता है, जिससे कन्फर्मेशन बायस कम होता है और जनरलाइजेशन में वृद्धि होती है।

मूल लेखक: Hongyang He, Xinyuan Song, Yan Zhong, Daizong Liu, Yanbin Li, Yang-fan He, Wenqiao Zhang

प्रकाशित 2026-08-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyang He, Xinyuan Song, Yan Zhong, Daizong Liu, Yanbin Li, Yang-fan He, Wenqiao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के विशाल परिदृश्य में, मशीनें पैटर्न पहचानने में तेजी से कुशल होती जा रही हैं, चाहे वह एक तस्वीर में बिल्ली की पहचान करना हो या किसी चिकित्सीय स्थिति का निदान करना। हालाँकि, एक महत्वपूर्ण बाधा अभी भी बनी हुई है कि ये सिस्टम तब कैसे सीखते हैं जब डेटा कम या असमान रूप से वितरित होता है। वास्तविक दुनिया में, जानकारी शायद ही कभी संतुलित होती है; कुछ श्रेणियों का डेटा प्रचुर मात्रा में होता है, जबकि अन्य दुर्लभ होते हैं, जो एक "लॉन्ग-टेल्ड" (long-tailed) वितरण बनाते हैं जहाँ अधिकांश उदाहरण कुछ सामान्य समूहों से संबंधित होते हैं, और बाकी कई दुर्लभ श्रेणियों में बहुत कम बिखरे होते हैं। जब शोधकर्ता लेबल किए गए डेटा (जहाँ उत्तर ज्ञात है) और अनलेबल डेटा (जहाँ कंप्यूटर को अनुमान लगाना पड़ता है) के मिश्रण का उपयोग करके कंप्यूटर को सिखाने की कोशिश करते हैं, तो सिस्टम अक्सर अटक जाता है। यह दुर्लभ श्रेणियों को अनदेखा करने लगता है, अपना ध्यान सामान्य श्रेणियों पर केंद्रित करता है, और अज्ञात डेटा पर इसके अनुमान शोरयुक्त और अविश्वसनीय हो सकते हैं। यह एक ऐसा चक्र बनाता है जहाँ कंप्यूटर अपनी गलतियों को पुख्ता करता है, उस दुनिया की पूरी तस्वीर सीखने में विफल रहता है जिसे समझने की वह कोशिश कर रहा है।

शोधकर्ताओं की एक टीम ने इस विशिष्ट समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, जो इन लर्निंग सिस्टम को दुर्लभ और शोरयुक्त डेटा की अनिश्चितता के माध्यम से मार्गदर्शन करने का एक तरीका प्रदान करता है। उनकी विधि, जिसे वे 'गौसियन ब्रिज कंसिस्टेंसी' (Gaussian Bridge Consistency) कहते हैं, कंप्यूटर की सीखने की प्रक्रिया के लिए एक नेविगेशनल सहायता के रूप में कार्य करती है। मशीन को एक अनुमान से निष्कर्ष तक अचानक छलांग लगाने के लिए मजबूर करने के बजाय, शोधकर्ताओं ने एक सहज, निरंतर पथ बनाया है जो एक अनिश्चित डेटा को उसी श्रेणी के एक विश्वसनीय, ज्ञात उदाहरण से जोड़ता है। कल्पना कीजिए कि एक यात्री धुंधले परिदृश्य में अपना रास्ता खोजने की कोशिश कर रहा है; अचानक दूर के गंतव्य पर कूदने के बजाय, उसे स्पष्ट, स्टेपिंग स्टोन्स (stepping stones) की एक श्रृंखला दी जाती है जो उसे उसकी वर्तमान स्थिति से एक ज्ञात मील के पत्थर तक लगातार ले जाती है। कंप्यूटर को इस पथ पर लगातार सीखने के लिए मजबूर करके, शोधकर्ता यह सुनिश्चित करते हैं कि सिस्टम त्रुटि में न भटक जाए, भले ही डेटा कम हो या प्रारंभिक अनुमान अस्थिर हों।

इस नए ढांचे का मूल हिस्सा विश्वसनीय उदाहरणों का एक गतिशील पुस्तकालय है, जिसे शोधकर्ता 'प्रोटोटाइप एटलस' (Prototype Atlas) कहते हैं। जैसे-जैसे कंप्यूटर सीखता है, इस लाइब्रेरी को लेबल किए गए डेटा और अनलेबल डेटा पर कंप्यूटर द्वारा किए गए सबसे आत्मविश्वासी अनुमानों, दोनों से उच्च-गुणवत्ता वाले उदाहरणों के साथ लगातार अपडेट किया जाता है। हर नई, अनिश्चित छवि के साथ जो कंप्यूटर का सामना करती है, सिस्टम इस लाइब्रेरी से एक मेल खाने वाला, विश्वसनीय उदाहरण खोजता है। फिर यह कंप्यूटर की आंतरिक मेमोरी स्पेस में दोनों के बीच एक आभासी पुल (virtual bridge) बनाता है। इस पुल के साथ, कंप्यूटर को विभिन्न मध्यवर्ती बिंदुओं पर भविष्यवाणियां करने के लिए कहा जाता है, जिससे यह सुनिश्चित होता है कि इसकी समझ अनिश्चित शुरुआत से विश्वसनीय अंत तक सुचारू रूप से विकसित हो। यह प्रक्रिया सिस्टम को अपने तर्क में अचानक, अनियमित छलांग लगाने से रोकती है, जहाँ अक्सर त्रुटियां आती हैं, विशेष रूप से उन दुर्लभ श्रेणियों के लिए जिन्हें आसानी से अनदेखा किया जा सकता है।

इसे और भी प्रभावी बनाने के लिए, शोधकर्ताओं ने एक तकनीक पेश की जिसे 'ब्रिजमिक्स' (BridgeMix) कहा जाता है, जो इस प्रक्रिया में विश्वास का एक स्तर जोड़ती है। जब सिस्टम एक नया सीखने का परिदृश्य बनाने के लिए दो अलग-अलग उदाहरणों को मिलाता है, तो यह उन उदाहरणों पर अधिक ध्यान देता है जिनके बारे में कंप्यूटर को सबसे अधिक विश्वास है। ये आत्मविश्वासी उदाहरण मार्गदर्शक के रूप में कार्य करते हैं, जो अधिक अनिश्चित वाले उदाहरणों के सीखने को दिशा देने में मदद करते हैं। यह सुनिश्चित करता है कि कंप्यूटर डेटा के शोर से भ्रमित न हो, बल्कि स्पष्ट संकेतों का उपयोग करके कठिन, दुर्लभ श्रेणियों की अपनी समझ को मजबूत करे। परिणाम एक ऐसी सीखने की प्रक्रिया है जो स्थिर और अनुकूलन योग्य है, जो वास्तविक दुनिया के अव्यवस्थित, असंतुलित डेटा को बिना रास्ता भटके संभालने में सक्षम है।

शोधकर्ताओं ने इस पद्धति का परीक्षण कई मानक डेटासेट्स पर किया जिनका उपयोग आर्टिफिशियल इंटेलिजेंस का मूल्यांकन करने के लिए किया जाता है, जिसमें सरल रेखाचित्रों से लेकर प्राकृतिक दुनिया की जटिल तस्वीरों तक की छवियों के संग्रह शामिल हैं। इन परीक्षणों में, नया दृष्टिकोण पिछले तरीकों से लगातार बेहतर प्रदर्शन करता है, विशेष रूप से उन परिदृश्यों में जहाँ डेटा सामान्य श्रेणियों की ओर अत्यधिक झुका हुआ था और दुर्लभ श्रेणियों को पीछे छोड़ दिया गया था। छवियों के एक बड़े डेटासेट पर, इस नए तरीके ने दुर्लभ वस्तुओं को पहचानने की सटीकता में महत्वपूर्ण अंतर से सुधार किया, जो मौजूदा सर्वोत्तम तकनीकों को लगभग दो प्रतिशत अंकों से पीछे छोड़ गया। यह सुनने में एक छोटा नंबर लग सकता है, लेकिन उन्नत मशीन लर्निंग की दुनिया में, ऐसा सुधार एक बड़ी छलांग का प्रतिनिधित्व करता है, खासकर सबसे कम सामान्य वस्तुओं को पहचानने के कठिन कार्य के मामले में। शोधकर्ताओं ने पाया कि उनकी विधि विभिन्न प्रकार के कंप्यूटर आर्किटेक्चर पर अच्छी तरह से काम करती है, जो यह सुझाव देती है कि अनिश्चित और विश्वसनीय डेटा के बीच सहज पथ बनाने का अंतर्निहित विचार एक शक्तिशाली उपकरण है जिसे व्यापक रूप से लागू किया जा सकता है।

जो बात इस काम को विशेष रूप से उल्लेखनीय बनाती है, वह यह है कि यह कंप्यूटिंग शक्ति या समय में भारी वृद्धि की आवश्यकता के बिना इन परिणामों को प्राप्त करता है। इन पुलों को बनाने और रास्ते में अपनी प्रगति की जांच करने के लिए कंप्यूटर द्वारा उठाए गए अतिरिक्त कदम कुल प्रशिक्षण समय में केवल एक बहुत छोटा हिस्सा जोड़ते हैं, जिससे यह विधि वास्तविक दुनिया के उपयोग के लिए व्यावहारिक बन जाती है। शोधकर्ताओं ने इसका एक गणितीय स्पष्टीकरण भी प्रदान किया, यह दिखाते हुए कि डेटा बिंदुओं के बीच के पथ को सुचारू बनाकर, सिस्टम छोटी त्रुटियों और शोर के प्रति अधिक प्रतिरोधी हो जाता है। यह सैद्धांतिक आधार पुष्टि करता है कि यह विधि केवल एक तुक्का नहीं है, बल्कि डेटा कैसे व्यवस्थित होता है, इसके ज्यामिति (geometry) पर आधारित एक मजबूत समाधान है।

अंत में, यह शोध अपूर्ण जानकारी से सीखने के बारे में एक नया दृष्टिकोण प्रदान करता है। सीखने की प्रक्रिया को अलग-थलग अनुमानों के बजाय एक सुचारू, निर्देशित यात्रा के रूप में मानकर, शोधकर्ताओं ने कंप्यूटर को दुनिया की पूरी विविधता को समझने में मदद करने का एक तरीका खोजा है, जिसमें दुर्लभ और अक्सर अनदेखी की जाने वाली चीजें भी शामिल हैं। यह दृष्टिकोण केवल एक परीक्षण पर प्रदर्शन में सुधार नहीं करता है; यह इस मौलिक दोष को संबोधित करता है कि वर्तमान में मशीनें असमान डेटा को कैसे संभालती हैं, जिससे अधिक विश्वसनीय और निष्पक्ष आर्टिफिशियल इंटेलिजेंस सिस्टम के लिए मार्ग प्रशस्त होता है जो हमारे वास्तविक, असंतुलित संसार में प्रभावी ढंग से कार्य कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →