XMix: Combating Extremely Noisy Labels via Local Smoothness in Self-Supervised Feature Space
MixMix एक नवीन ढांचा है जो शोर की दर का अनुमान लगाने, संतुलित स्वच्छ नमूनों का चयन करने और विश्वसनीय छद्म-लेबल (pseudo-labels) उत्पन्न करने के लिए स्व-पर्यवेक्षित फीचर स्पेस में स्थानीय सहजता (local smoothness) का लाभ उठाता है, जिससे यह बिना किसी पूर्व शोर ज्ञान के अत्यधिक शोर वाले लेबल को संभालने में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जानवरों को पहचानना सिखाने की कोशिश कर रहे हैं। आप उसे हजारों तस्वीरें दिखाते हैं, लेकिन यहाँ एक पेंच है: तस्वीरों पर लेबल लिखे गए इंसान द्वारा लिखे गए हैं जो थके हुए, विचलित या यहाँ तक कि शरारती भी हैं। कभी एक बिल्ली की तस्वीर को "कुत्ता" लेबल किया जाता है, और एक कार की तस्वीर को "हवाई जहाज" लेबल किया जाता है। यह "नोइजी लेबल्स के साथ सीखने" (Learning with Noisy Labels) की अस्त-व्यस्त वास्तविकता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, मॉडल्स को आमतौर पर सीखने के लिए सटीक डेटा की आवश्यकता होती है, लेकिन वास्तविक दुनिया में, सटीक डेटा दुर्लभ और महंगा होता है। वैज्ञानिक ऐसे रोबोट बनाने की कोशिश कर रहे हैं जो खराब लेबल्स को अनदेखा कर सकें और अच्छे लेबल्स से सीख सकें, लेकिन जब शोर (noise) बहुत अधिक हो जाता है—जैसे कि जब 90% लेबल गलत हों—तो अधिकांश रोबोट हार मान लेते हैं या भ्रमित हो जाते हैं।
जिस पेपर को आप अब पढ़ने जा रहे हैं, वह ठीक इसी समस्या का समाधान करता है। यह एक नई विधि पेश करता है जिसे XMix कहा जाता है। इसे एक जासूस के रूप में समझें जो केवल फाइलों पर लिखे लेबल पर भरोसा नहीं करता है। इसके बजाय, यह तस्वीरों को खुद देखता है ताकि यह देख सके कि वे आपस में कितनी मिलती-जुलती हैं। यदि एक बिल्ली की तस्वीर रोबोट की याददाश्त में बिल्लियों की अन्य तस्वीरों के बहुत समान दिखती है, तो जासूस यह मान लेता है कि वे सभी बिल्लियाँ ही हैं, भले ही लेबल कुछ भी कहें। यह दृष्टिकोण "लोकल स्मूथनेस" (local smoothness) नामक एक अवधारणा का उपयोग करता है, जो एक फैंसी तरीका है यह कहने का कि: "जो चीजें एक जैसी दिखती हैं, वे आमतौर पर एक ही समूह से संबंधित होती हैं।" इस तर्क का उपयोग करके, XMix उस गंदगी को साफ करने की कोशिश करता है और रोबोट को पिछले तरीकों की तुलना में बहुत बेहतर तरीके से सिखाता है, विशेष रूप से तब जब डेटा पूरी तरह से खराब हो।
समस्या: शरारती तत्वों से भरा एक क्लासरूम
कल्पना कीजिए कि एक कक्षा में एक शिक्षक छात्रों को विभिन्न प्रकार के फलों को पहचानने के बारे में पढ़ा रहा है। शिक्षक के पास फ्लैशकार्डों का एक ढेर है, लेकिन शरारती तत्वों के एक समूह ने लेबल बदल दिए हैं। कुछ सेबों को "केला" लेबल किया गया है, और कुछ संतरों को "अंगूर" लेबल किया गया है।
अतीत में, स्मार्ट कंप्यूटर प्रोग्राम (जिन्हें डीप लर्निंग मॉडल्स कहा जाता है) के पास एक चाल थी जिसे "मेमोराइजेशन इफेक्ट" (memorization effect) कहा जाता था। वे कार्डों का अध्ययन करते थे और महसूस करते थे कि, "हे, मैं इस विशिष्ट कार्ड के लेबल का अनुमान लगाने में बहुत अच्छा हूँ, लेकिन मैं उसके लिए बहुत बुरा हूँ।" उन्होंने मान लिया कि जिन कार्डों का वे अच्छी तरह से अनुमान लगा सकते थे वे असली थे (साफ डेटा) और जिन पर उन्हें संघर्ष करना पड़ा वे शरारती तत्वों के झूठ थे (नोइजी डेटा)।
लेकिन यहाँ समस्या यह है: जब शरारती तत्व पागल हो जाते हैं और 90% लेबल बदल देते हैं, तो कंप्यूटर भ्रमित हो जाता है। वह यह अंतर नहीं कर पाता कि एक असली सेब और एक सेब के रूप में लेबल किया गया केला क्या है। इसके अलावा, कंप्यूटर अक्सर केवल एक प्रकार के फल का अध्ययन करने लगता है, जिससे वह अन्य विविधताओं को पहचानने में खराब हो जाता है। उसे एक ऐसी नई रणनीति की आवश्यकता है जो यह जानने पर निर्भर न हो कि कमरे में कितने शरारती तत्व मौजूद हैं।
समाधान: XMix और "एक जैसा दिखने वाला" नियम
यहाँ XMix आता है, नया जासूस। केवल फलों के लिखित लेबल को देखने के बजाय, XMix विजुअल विवरणों को देखने के लिए एक विशेष चश्मे (एक सेल्फ-सुपरवाइज्ड फीचर एनकोडर) का उपयोग करता है। वह जानता है कि लाल, गोल फल जिसमें डंठल हो, वह अन्य लाल, गोल फलों के समान ही दिखता है।
यहाँ बताया गया है कि X-Mix तीन बड़ी समस्याओं को कैसे हल करता है:
1. बिना किसी चीट शीट के शोर के स्तर का अनुमान लगाना
आमतौर पर, इन कंप्यूटर प्रोग्रामों को यह जानने की आवश्यकता होती है कि कितने लेबल गलत हैं (उदाहरण के लिए, "50% गलत हैं") ताकि वे अपने नियम सेट कर सकें। यदि वे गलत अनुमान लगाते हैं, तो वे विफल हो जाते हैं। XMix को इस चीट शीट की आवश्यकता नहीं है। यह एक फल और उसके सबसे करीबी "एक जैसे दिखने वाले" पड़ोसियों को देखता है। यदि पड़ोसी सभी अलग-अलग लेबल रखते हैं, तो XMix गणना करता है, "वाह, शोर यहाँ वास्तव में बहुत अधिक है।" यह शोर के स्तर का स्वचालित रूप से अनुमान लगाने के लिए "मैक्सिमम लाइकलीहुड" (maximum likelihood) नामक एक गणितीय ट्रिक का उपयोग करता है। यह एक जासूस की तरह है जो अपराध स्थल को देखकर कहता है, "टूटी हुई खिड़कियों की संख्या के आधार पर, मेरा अनुमान है कि यह एक दंगा था," बिना किसी पुलिस रिपोर्ट की आवश्यकता के।
2. अधिक अच्छे छात्रों को खोजना (संतुलित और विस्तारित चयन)
जब शोर चरम पर होता है, तो पुराने तरीके केवल कुछ "क्लीन" सैंपल (अच्छे छात्र) ही पाते हैं जिनका वे अध्ययन कर सकें। XMix कहता है, "रुको, अगर हमने एक अच्छा सेब ढूंढ लिया है, और यह आसपास के अन्य पांच सेबों जैसा ही दिखता है, तो चलिए उन पांचों पर भी भरोसा करते हैं!" यह उन अपने पड़ोसियों को शामिल करके विश्वसनीय नमूनों के समूह का विस्तार करता है।
महत्वपूर्ण रूप से, यह "क्लास इम्बैलेंस" (class imbalance) की समस्या को भी ठीक करता है। यदि शरारती तत्वों ने सभी "केले" के लेबल छिपा दिए, तो कंप्यूटर केले का अध्ययन करना बंद कर सकता है। XMix इसे नोटिस करता है और कहता है, "हमें और केलों की जरूरत है!" यह सुनिश्चित करने के लिए कि हर फल को अध्ययन का उचित अवसर मिले, यह केले के दिखने वाले नमूनों के लिए और दूर तक देखता है। यह सुनिश्चित करता है कि रोबोट ज्ञान के संतुलित आहार को सीखे, न कि केवल अपना पसंदीदा फल।
3. अज्ञात के लिए बेहतर अनुमान लगाना
अंत में, उन कार्डों के लिए जिनके बारे में वह अभी भी अनिश्चित है (नोइजी वाले), XMix केवल रैंडम अनुमान नहीं लगाता है। वह पड़ोसियों से पूछता है: "तुम्हें क्या लगता है कि यह क्या है?" यह सबसे भरोसेमंद पड़ोसियों (साफ नमूनों) की राय लेता है और एक "स्यूडो-लेबल" (सबसे अच्छा अनुमानित लेबल) बनाने के लिए उनका औसत निकालता है। यह विशेषज्ञों के एक समूह से किसी रहस्यमय वस्तु पर वोट लेने जैसा है। क्योंकि विशेषज्ञों को वस्तु के साथ उनकी समानता के आधार पर चुना जाता है, इसलिए उनका वोट एक रैंडम अनुमान की तुलना में बहुत अधिक विश्वसनीय होता है।
उन्होंने क्या पाया: संभावनाओं को मात देना
शोधकर्ताओं ने XMix का परीक्षण प्रसिद्ध इमेज डेटासेट्स जैसे CIFAR-10 और CIFAR-100 पर किया, जिनमें कारों, हवाई जहाजों, जानवरों और अन्य की तस्वीरें हैं। उन्होंने लेबल को जानबूझकर बिगाड़ दिया ताकि चरम स्थितियाँ बनाई जा सकें:
- 90% सिमेट्रिक नॉइज़ (Symmetric Noise): कल्पना कीजिए कि 100 में से 90 लेबल पूरी तरह से रैंडम हैं।
- 98% नॉइज़: लगभग सब कुछ एक झूठ है।
इन क्रूर स्थितियों में, पिछले तरीके (जैसे DivideMix और ProMix) टूटने लगे। उदाहरण के लिए, 90% शोर के साथ CIFAR-10 पर, पुराना सर्वश्रेष्ठ तरीका (DivideMix) केवल 76% सटीकता प्राप्त कर सका। हालाँकि, XMix ने इसे बढ़ाकर 91.2% कर दिया। 95% शोर के साथ CIFAR-100 पर, पुराने तरीके ने 19.1% प्राप्त किया, जबकि XMix ने 31.4% तक पहुँच लिया।
पेपर दिखाता है कि XMix केवल थोड़ा बेहतर काम नहीं करता है; यह तब चमकता है जब स्थिति सबसे निराशाजनक होती है। इसने सफलतापूर्वक कई अधिक "ट्रू क्लीन" सैंपल की पहचान की, जिससे रोबोट के सीखने योग्य अच्छे उदाहरणों की संख्या कभी-कभी दोगुनी या तिगुनी हो गई।
निष्कर्ष
XMix साबित करता है कि अपने डेटा को साफ करने के लिए आपको यह जानने की आवश्यकता नहीं है कि अराजकता का सटीक स्तर क्या है। छवियों के बीच दृश्य समानता (विजुअल सिमिलैरिटी) पर भरोसा करके—फीचर स्पेस के "लोकल स्मूथनेस" का उपयोग करके—यह स्वचालित रूप से अपनी रणनीति को समायोजित कर सकता है, अधिक अच्छा डेटा खोज सकता है, और रोबोट को शोर को अनदेखा करना सिखा सकता है।
लेखक सुझाव देते हैं कि यह तरीका एक महत्वपूर्ण कदम है, विशेष रूप से वास्तविक दुनिया के परिदृश्यों के लिए जहाँ डेटा अस्त-व्यस्त है और हमारे पास यह बताने वाला कोई मैनुअल नहीं है कि स्थिति कितनी खराब है। हालाँकि यह कोई जादुई छड़ी नहीं है जो सब कुछ पूरी तरह से ठीक कर देती है (यह अभी भी कुछ गलतियाँ करता है, खासकर जब शोर कम हो और विस्तार की आवश्यकता न हो), यह सबसे चुनौतीपूर्ण, उच्च-शोर वाले वातावरण में लगातार मौजूदा स्टेट-ऑफ-द-आर्ट तरीकों से बेहतर प्रदर्शन करता है। यह शरारती तत्वों के एक अराजक क्लासरूम को एक ऐसी जगह में बदल देता है जहाँ सीखना अभी भी संभव है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।