Leveraging Data Symmetries to Select an Optimal Subset of Training Data under Label Noise
यह शोध पत्र यह प्रदर्शित करता है कि उच्च-आयामी परिवेशों में, k-निकटतम पड़ोसी (k-nearest neighbor) सटीकता में सुधार के लिए डेटा समरूपताओं और अपरिवर्तनीयताओं का लाभ उठाना, इष्टतम, कम-शोर वाले प्रशिक्षण उपसमुच्चयों के चयन को महत्वपूर्ण रूप से बढ़ाता है, तब भी जब अंतर्निहित अपरिवर्तनीयता जानकारी केवल आंशिक रूप से ज्ञात हो।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को विभिन्न प्रकार के फल पहचानना सिखाने की कोशिश कर रहे हैं। आप उसे बहुत सारी तस्वीरों का एक बड़ा ढेर देते हैं, लेकिन दुर्भाग्य से, एक शरारती ग्रेमलिन (gremlin) ने उनमें से कई के लेबल बदल दिए हैं। सेब की कुछ तस्वीरों पर "केला" लिखा है, और कुछ संतरों पर "अंगूर" लिखा है।
यदि आप केवल इन सभी तस्वीरों को रोबोट को दे देते हैं, तो वह भ्रमित हो जाएगा और गलत चीजें सीख लेगा। इसे ठीक करने का मानक तरीका यह है कि रोबोट को "मजबूत" बनाया जाए ताकि वह गलत लेबलों को अनदेखा कर सके। लेकिन यह शोध पत्र एक अलग, अधिक स्मार्ट दृष्टिकोण का सुझाव देता है: रोबोट को मजबूत बनाने के बजाय, चलिए शुरू करने से पहले ही खराब तस्वीरों को फेंक देते हैं।
यहाँ वह कहानी है कि कैसे लेखकों ने यह पता लगाया कि उन "अच्छी" तस्वीरों को खोजने और रखने का सबसे अच्छा तरीका क्या है, भले ही तस्वीरों का ढेर बहुत अव्यवset और जटिल हो।
समस्या: "निकटतम पड़ोसी" (Nearest Neighbor) की गलती
शोधकर्ताओं ने CutStats नामक एक लोकप्रिय पद्धति का अध्ययन किया। CutStats को एक जासूस के रूप में समझें जो किसी फोटो के पड़ोसियों को देखकर गलत लेबल का पता लगाने की कोशिश करता है।
- यह कैसे काम करता है: यदि आपके पास सेब की एक फोटो है, तो जासूस उसके 10 सबसे करीबी फोटो देखता है। यदि उनमें से 9 फोटो "सेब" लेबल वाली हैं और 1 फोटो "केला" लेबल वाली है, तो जासूस मान लेता है कि "केला" लेबल एक गलती है और उस फोटो को बाहर निकाल देता है।
- पेंच: यह जासूस एक छोटे, सरल कमरे (लो-डायमेंशनल डेटा) में बहुत अच्छा काम करता है। लेकिन यदि आप इस जासूस को एक विशाल, बहु-आयामी गोदाम (हाई-डायमेंशनल डेटा, जैसे जटिल चित्र) में रख दें, तो "निकटता" का सिद्धांत टूट जाता है। एक विशाल गोदाम में, हर चीज़ बाकी सब से समान रूप से दूर महसूस होती है। जासूस खो जाता है, वह यह नहीं बता पाता कि वास्तव में कौन करीब है, और वह गलत फोटो को बाहर निकालना शुरू कर देता है।
समाधान: "जादुई दर्पण" (Symmetries)
लेखकों ने महसूस किया कि कई वास्तविक दुनिया की वस्तुओं में समरूपता (Symmetries) होती है।
- घूर्णन समरूपता (Rotation Symmetry): एक कॉफी मग बाएं, दाएं या उल्टा होने पर भी कॉफी मग ही दिखता है।
- क्रमपरिवर्तन समरूपता (Permutation Symmetry): पासे (dice) का एक सेट वैसा ही दिखता है चाहे आप पासे के क्रम को कितना भी इधर-उधर कर दें।
शोध पत्र का तर्क है कि यदि आप इन नियमों (समरूपता) को जानते हैं, तो आप एक जादुई दर्पण (जिसे Invariant Representation कहा जाता है) बना सकते हैं।
- दर्पण के बिना: जासूस 90 डिग्री मुड़े हुए मग को देखता है और सोचता है, "यह 0 डिग्री वाले मग से अलग वस्तु है!" जासूस की नज़र में वे बहुत दूर हैं।
- दर्पण के साथ: दर्पण उस मग को लेता है, उसे घुमाता है, और जासूस को उस मग का "सार" (essence) दिखाता है। अचानक, 0 डिग्री वाला मग और 90 डिग्री वाला मग जासूस के लिए एक जैसे दिखने लगते हैं।
इस दर्पण का उपयोग करके, जासूस एक बार फिर आसानी से "वास्तविक" पड़ोसियों को ढूंढ सकता है, भले ही वह एक विशाल गोदाम में हो। वह सटीक रूप से गलत लेबल वाली तस्वीरों की पहचान कर सकता है और उन्हें हटा सकता है।
तीन बड़ी खोजें
1. जासूस को एक मानचित्र की आवश्यकता है
लेखकों ने गणितीय रूप से सिद्ध किया कि "खराब फोटो को फेंकने" की रणनीति की सफलता पूरी तरह से इस बात पर निर्भर करती है कि जासूस (k-NN एल्गोरिदम) पड़ोसियों को खोजने में कितना अच्छा है। सरल कमरों में, जासूस स्वाभाविक रूप से अच्छा होता है। विशाल, जटिल कमरों में, जासूस विफल हो जाता है जब तक कि आप उन्हें एक मानचित्र (समरूपता के नियम) न दे दें।
2. जादुई दर्पण स्थिति को संभाल लेता है
उन्होंने दिखाया कि यदि आप एक ऐसा दर्पण उपयोग करते हैं जो वस्तु की समरूपता (जैसे रोटेशन या शफलिंग) का सम्मान करता है, तो जासूस फिर से पूरी तरह से काम करता है, यहाँ तक कि सबसे जटिल, उच्च-आयामी कमरों में भी। दर्पण प्रभावी रूप से उस विशाल गोदाम को एक प्रबंधनीय आकार में सिकोड़ देता है जहाँ "निकटता" का अर्थ फिर से समझ में आता है।
3. आपको एकदम सटीक मानचित्र की आवश्यकता नहीं है
वास्तविक दुनिया में, हो सकता है कि आपको समरूपता के सटीक नियम न पता हों (जैसे, आपको ठीक से पता न हो कि डेटा को कैसे घुमाया गया था)। लेखकों ने दिखाया कि भले ही आपको दर्पण को डेटा से स्वयं सीखना पड़े (कॉन्ट्रास्टिव लर्निंग जैसी तकनीकों का उपयोग करके), फिर भी यह अद्भुत काम करता है। यह जासूस को एक सटीक मानचित्र के बजाय थोड़ा धुंधला मानचित्र देने जैसा है; यह पूर्ण नहीं है, लेकिन यह गलत फोटो को पहचानने और डेटा को बचाने के लिए पर्याप्त अच्छा है।
परिणाम: डेटा की सफाई
टीम ने इसका परीक्षण सिंथेटिक डेटा (बनाए गए गणितीय सवाल) और वास्तविक दुनिया के डेटा (जैसे हाथ से लिखे अंकों और टेट्रिस ब्लॉक्स की घुमाई गई छवियां) पर किया।
- पुराना तरीका: अव्यवस्थित डेटा पर मानक जासूस का उपयोग करने से एक भ्रमित रोबोट बना।
- नया तरीका: डेटा को साफ करने के लिए "जादुई दर्पण" का उपयोग करने से एक ऐसा रोबोट मिला जिसने लगभग उतना ही प्रदर्शन किया जितना कि यदि उसे शुरुआत से ही पूरी तरह से साफ डेटा पर प्रशिक्षित किया गया होता।
संक्षेप में
जब आपका प्रशिक्षण डेटा शोर (noise) से भरा और अव्यवस्थित हो, तो केवल अपने AI को सख्त बनने के लिए न सिखाएं। इसके बजाय, दुनिया के छिपे हुए नियमों (समरूपता) का उपयोग करके एक विशेष फिल्टर बनाएं। यह फिल्टर आपको प्रत्येक डेटा बिंदु के "वास्तविक" पड़ोसियों को खोजने में मदद करता है, जिससे आप आसानी से दूषित लेबलों की पहचान कर सकते हैं और उन्हें हटा सकते हैं। इससे आपको एक साफ, उच्च-गुणवत्ता वाला डेटासेट मिलता है जो आपके AI को बहुत तेज़ी से और अधिक सटीकता से सीखने में मदद करता है, भले ही मूल डेटा बहुत अस्त-व्यस्त क्यों न रहा हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।