Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning
यह शोध पत्र क्लास-इन्क्रीमेंटल विद रिपिटिशन (CIR) निरंतर शिक्षण के लिए एक ऐसी विधि प्रस्तावित करता है जो मॉडल की स्थिरता और प्लास्टिसिटी को बढ़ाने के लिए मल्टी-लेवल नॉलेज डिस्टिलेशन और डायनेमिक सेल्फ-सुपरवाइज्ड लर्निंग के माध्यम से प्रचुर मात्रा में अनलेबल डेटा का लाभ उठाती है, जिससे CVPR 5वें CLVISION चैलेंज में दूसरा स्थान प्राप्त हुआ।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसे छात्र हैं जो हर हफ्ते एक नई भाषा सीखने की कोशिश कर रहे हैं, लेकिन इसमें एक ट्विस्ट है: कभी-कभी आप एक बिल्कुल नई भाषा सीख रहे होते हैं (जैसे जापानी), और कभी-कभी आपको महीनों पहले सीखी गई किसी भाषा (जैसे स्पेनिश) का अभ्यास करना होता है जबकि आप अभी भी नई भाषा सीखने की कोशिश कर रहे होते हैं।
सबसे बड़ी समस्या इस परिदृश्य में भूल जाना है। यदि आप जापानी का बहुत अधिक अध्ययन करते हैं, तो आप स्पेनिश भूलना शुरू कर सकते हैं। यदि आप स्पेनिश का बहुत अधिक अभ्यास करते हैं, तो आप जापानी को पर्याप्त तेज़ी से नहीं सीख पाएंगे। यह "कंटीन्यूअल लर्निंग" (Continual Learning) की समस्या का मूल आधार है।
यह पेपर बताता है कि योनसेई यूनिवर्सिटी और सियोल नेशनल यूनिवर्सिटी की एक टीम ने एक ऐसा AI छात्र बनाया जिसने इस समस्या को हल करके एक प्रमुख AI प्रतियोगिता में दूसरा स्थान प्राप्त किया। उन्होंने इसे कैसे किया, इसका सरल विवरण यहाँ दिया गया है:
सेटिंग: "नो-नोटबुक" नियम
आमतौर पर, पुरानी चीजों को याद रखने के लिए छात्र पुराने नोट्स की एक नोटबुक रखते हैं। AI में, इसे "मेमोरी बफर" कहा जाता है। हालाँकि, वास्तविक दुनिया में, आप गोपनीयता कानूनों या स्टोरेज सीमाओं के कारण पुराना डेटा रख नहीं सकते। आप हर वह फोटो सुरक्षित नहीं रख सकते जो आपने कभी देखी है।
प्रतियोगिता ने AI को एक विशेष लाभ दिया: "इंटरनेट" (अनलेबल डेटा) तक पहुंच।
- चुनौती: AI को पुरानी चीजों को याद रखते हुए नई क्लास (जैसे पक्षियों के विशिष्ट प्रकार) सीखनी थी, लेकिन वह पुराने फोटो को सेव नहीं कर सकता था।
- चीट कोड: यह मदद के लिए इंटरनेट से रैंडम, अनलेबल तस्वीरें डाउनलोड कर सकता था, लेकिन उसे पढ़ाई के तुरंत बाद उन्हें हटाना पड़ता था।
समाधान: दो सुपरपावर्स
टीम ने इस कठिन स्थिति को संभालने के लिए अपने AI को दो विशेष "सुपरपावर्स" दीं।
1. "टाइम-ट्रैवलिंग मेंटर" (मल्टी-लेवल नॉलेज डिस्टिलेशन)
समस्या: जब AI रैंडम इंटरनेट फोटो का उपयोग करके नई चीजें सीखने की कोशिश करता है, तो वह भ्रमित हो जाता है। इंटरनेट की तस्वीरें उन विशिष्ट पक्षियों जैसी नहीं दिखती जिन्हें उसे सीखना है, इसलिए वह जो पहले से जानता था उसे भूलने लगता है।
समाधान: केवल वर्तमान मॉडल को देखने के बजाय, AI एक "टाइम-ट्रैवलिंग मेंटर" रखता है।
- यह कैसे काम करता है: AI हर पिछले सबक के अंत में अपने दिमाग (ब्रेन) की एक कॉपी सुरक्षित रखता है।
- उपमा: कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं। केवल अपनी वर्तमान याददाश्त पर निर्भर रहने के बजाय, आपके पास आपके पिछले स्वरूपों (पिछले सप्ताह, पिछले महीने, पिछले वर्ष के) का एक पैनल बैठा है। वे आपको उत्तर फुसफुसाते हैं।
- ट्रिक: वे केवल उत्तर (लॉगिट्स/logits) ही नहीं बताते, बल्कि वे यह भी बताते हैं कि उन्होंने उस तस्वीर को कैसे देखा (फीचर्स/features)। वे चीजों के बीच के संबंधों को समझने के लिए एक विशेष गणितीय ट्रिक (ग्राम मैट्रिसेस/Gram Matrices) का भी उपयोग करते हैं, न कि केवल चीजों को।
- परिणाम: भले ही इंटरनेट की तस्वीरें अस्त-व्यस्त हों, AI कह सकता है, "रुको, मेरे पिछले स्वरूप ने यह पैटर्न देखा था," और वह पुराने सबक नहीं भूलता है।
2. "डायनामिक जिम कोच" (डायनामिक सेल्फ-सुपरवाइज्ड लर्निंग)
समस्या: AI के पास लाखों रैंडम इंटरनेट फोटो उपलब्ध हैं। यदि वह उन सभी से समान रूप से सीखने की कोशिश करता है, तो वह विचलित हो सकता है और अपने मुख्य लक्ष्य से भटक सकता है: विशिष्ट पक्षियों की पहचान करना। यह एक ऐसे छात्र की तरह है जो उपन्यास पढ़ने की कोशिश कर रहा है और साथ ही करतब (जगलिंग) सीखने की भी कोशिश कर रहा है; वे करतब में तो अच्छे हो सकते हैं लेकिन उपन्यास के टेस्ट में फेल हो सकते हैं।
समाधान: उन्होंने एक "डायनामिक जिम कोच" को काम पर रखा जो यह नियंत्रित करता है कि AI रैंडम इंटरनेट फोटो पर कितना अभ्यास करे।
- यह कैसे काम करता है:
- खेल की शुरुआत में: कोच कहता है, "खुलकर अभ्यास करो! उन सभी रैंडम इंटरनेट फोटो पर अभ्यास करो ताकि तुम्हारा दिमाग लचीला और हर चीज़ के लिए तैयार हो सके।" इससे AI तेजी से सामान्य विशेषताओं (जैसे आकार, बनावट, किनारे) को सीख पाता है।
- खेल के अंत में: जैसे-जैसे AI अंतिम परीक्षा के करीब पहुँचता है, कोच कहता है, "करतब दिखाना बंद करो! पूरी तरह से उन विशिष्ट पक्षियों पर ध्यान केंद्रित करो जिन्हें हमें पहचानना है।"
- उपमा: इसे मैराथन के लिए प्रशिक्षण लेने जैसा समझें। शुरुआत में, आप सामान्य फिटनेस बनाने के लिए क्रॉस-ट्रेनिंग (तैराकी, साइकिल चलाना) करते हैं। लेकिन रेस के दिन के करीब आते ही, आप क्रॉस-ट्रेनिंग बंद कर देते हैं और 100% दौड़ने पर ध्यान केंद्रित करते हैं। AI भी ऐसा ही करता है: वह शुरुआत में "फिट" होने के लिए इंटरनेट डेटा का उपयोग करता है, फिर बाद में विशिष्ट कार्य पर ध्यान केंद्रित करता है।
परिणाम
इन दो रणनीतियों को मिलाकर:
- मेंटर यह सुनिश्चित करता है कि AI बिना नोटबुक के भी जो उसने पहले सीखा है उसे कभी न भूले।
- कोच यह सुनिश्चित करता है कि AI विचलित हुए बिना स्मार्ट बनने के लिए मुफ्त इंटरनेट डेटा का उपयोग करे।
परिणामस्वरूप, एक ऐसा AI मिला जो पुरानी चीजों को भूले बिना नई चीजें तेजी से सीख सकता था, जिसने 42% सटीकता (बेसलाइन 19% से एक बड़ी छलांग) हासिल की और दुनिया की शीर्ष कंप्यूटर विज़न प्रतियोगिता में दूसरा स्थान सुरक्षित किया।
संक्षेप में: उन्होंने AI को बिना कुछ भी सेव किए "क्लाउड" से सीखना सिखाया, सलाह के लिए अपने पिछले संस्करणों की एक टीम रखकर और एक स्मार्ट शेड्यूल का उपयोग करके यह जानकर कि कब व्यापक रूप से अभ्यास करना है और कब संकीर्ण रूप से ध्यान केंद्रित करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।