← नवीनतम पेपर
💻 computer science

SingularClip: Preventing Spectral Collapse to Maintain Plasticity in Continual and Reinforcement Learning

यह शोधपत्र SingularClip को प्रस्तुत करता है, जो एक ऐसी विधि है जो गैर-स्थिर (nonstationary) कार्यों पर प्रशिक्षित न्यूरल नेटवर्क में स्पेक्ट्रल कोलैप्स (spectral collapse) को रोकने और प्लास्टिसिटी बनाए रखने के लिए भार मैट्रिसेस (weight matrices) के सिंगुलर मानों (singular values) को आवधिक रूप से क्लिप करती है, जो निरंतर पर्यवेक्षित (continual supervised) और डीप रिइन्फोर्समेंट लर्निंग दोनों में उत्कृष्ट प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Tyler Kastner, Nimrod De La Vega, Amir-massoud Farahmand

प्रकाशित 2026-08-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tyler Kastner, Nimrod De La Vega, Amir-massoud Farahmand

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डीप लर्निंग ने मशीनों को चेहरे पहचानने, भाषाओं का अनुवाद करने और जटिल खेल खेलने की क्षमता दी है, लेकिन ये सिस्टम संघर्ष करते हैं जब उनके आसपास की दुनिया बदल जाती है। एक स्थिर कक्षा में, एक छात्र एक पाठ्यपुस्तक को याद कर सकता है और हमेशा के लिए उपयोगी बना रह सकता है। हालाँकि, वास्तविक दुनिया में, नियम लगातार बदलते रहते हैं। एक सेल्फ-ड्राइविंग कार को नए ट्रैफिक पैटर्न के अनुकूल होना चाहिए, और एक रोबोट को चलने का तरीका भूले बिना एक नया कार्य सीखना चाहिए। जब न्यूरल नेटवर्क—जो इन प्रणालियों के पीछे के गणितीय मस्तिष्क हैं—पुराने ज्ञान के ऊपर नई चीजें सीखने की कोशिश करते हैं, तो वे अक्सर कठोर हो जाते हैं। वे नई जानकारी के अनुसार ढलने और फिट होने की अपनी क्षमता खो देते हैं, एक ऐसी समस्या जिसे वैज्ञानिक 'प्लास्टिसिटी के नुकसान' (loss of plasticity) के रूप में बुलाते हैं। इस लचीलेपन के बिना, मशीन जम जाती है, और बदलते परिवेश के प्रति अपनी समझ को अपडेट करने में असमर्थ हो जाती है।

शोधकर्ता लंबे समय से जानते थे कि नेटवर्क के आंतरिक गणनाओं के भीतर कुछ गलत हो रहा है। उन्हें संदेह था कि नेटवर्क के वेट्स (weights), जो यह निर्धारित करते हैं कि सूचना कैसे प्रवाहित होती है, एक खराब आकार में फंस रहे हैं। टोरंटो विश्वविद्यालय और पॉलिटेक्निक मॉन्ट्रियल के वैज्ञानिकों की एक टीम ने अब यह पहचान लिया है कि वह खराब आकार वास्तव में क्या है और इसे कैसे ठीक किया जाए। उन्होंने पाया कि जैसे-जैसे एक नेटवर्क सीखता है, इसकी आंतरिक संरचना तेजी से असंतुलित होती जाती है, कुछ दिशाओं में खिंचती जाती है और अन्य में ढह जाती है। यह विरूपण नेटवर्क के लिए नए कार्यों को सीखना अविश्वसनीय रूप से कठिन बना देता है। इसे हल करने के लिए, उन्होंने एक सरल, आवधिक प्रक्रिया पेश की जो इन आंतरिक संरचनाओं को नया आकार देती है, जिससे मशीन लचीली बनी रहती है और सीखना जारी रखती है।

समस्या का मूल यह है कि नेटवर्क अपने ज्ञान को कैसे व्यवस्थित करता है। नेटवर्क को पहाड़ियों और घाटियों के एक विशाल परिदृश्य के रूप में कल्पना करें। जैसे-जैसे यह सीखता है, परिदृश्य बदलता है। शोधकर्ताओं ने पाया कि समय के साथ, यह परिदृश्य एक लंबी, पतली कटक (ridge) में खिंच जाता है। अधिकांश सीखना इस एकल कटक के साथ होता है, जबकि परिदृश्य का बाकी हिस्सा एक गहरी, संकरी खाई में सपाट हो जाता है। तकनीकी शब्दों में, शोधकर्ता इसे 'बढ़ती अनिसोट्रॉपी' (growing anisotropy) कहते हैं। इसका अर्थ है कि नेटवर्क एक विशिष्ट दिशा में परिवर्तनों के प्रति अत्यधिक संवेदनशील हो जाता है लेकिन किसी अन्य दिशा में परिवर्तनों के प्रति पूरी तरह से बहरा हो जाता है। जब कोई नया कार्य आता है जिसके लिए एक अलग दिशा में सीखने की आवश्यकता होती है, तो नेटवर्क प्रतिक्रिया नहीं दे पाता क्योंकि इसकी आंतरिक संरचना उस एकल, प्रमुख कटक में ढह गई है। नया कार्य सीखने के लिए आवश्यक संकेत उस खाई की सपाटता में खो जाता है।

यह सिद्ध करने के लिए कि यही कठोरता का कारण था, शोधकर्ताओं ने ऐसे प्रयोग किए जहाँ उन्होंने कृत्रिम रूप से ऐसे नेटवर्क बनाए जिनका आकार खिंचा हुआ था। उन्होंने पाया कि ये विकृत नेटवर्क संतुलित नेटवर्क की तुलना में बहुत अधिक समय लेते हैं या सीखने में विफल रहते हैं। उन्होंने छवियों में यादृच्छिक पैटर्न को पहचानने से लेकर एक आभासी रोबोट को नियंत्रित करना सीखने तक, वास्तविक कार्यों पर प्रशिक्षित नेटवर्क में भी यही खिंचाव देखा। यह खिंचाव केवल एक दुष्प्रभाव नहीं था; यह धीमेपन का सीधा कारण था। नेटवर्क जितना अधिक खिंचता था, नई जानकारी के लिए इसके माध्यम से यात्रा करना उतना ही कठिन होता जाता था।

टीम ने एक समाधान विकसित किया जिसे वे 'सिंगुलरक्लिप' (SingularClip) कहते हैं। नाम उस गणितीय ऑपरेशन से आता है जिसका उपयोग वे समस्या को ठीक करने के लिए करते हैं। नेटवर्क को अनियंत्रित रूप से खिंचने देने के बजाय, वे प्रशिक्षण प्रक्रिया को आवधिक रूप से रोकते हैं और नेटवर्क की आंतरिक संरचनाओं के आकार की जांच करते हैं। यदि संरचना बहुत अधिक खिंच गई है, तो वे चरम मानों को 'क्लिप' (clip) कर देते हैं, जिससे आकार को एक अधिक संतुलित, गोल रूप में वापस आने के लिए मजबूर किया जा सके। यह पूर्ण रीसेट नहीं है, जो मशीन द्वारा सीखी गई हर चीज़ को मिटा देगा। इसके बजाय, यह एक कोमल सुधार है जो नेटवर्क द्वारा एकत्र की गई जानकारी को सुरक्षित रखता है और उसे बहुत अधिक कठोर होने से रोकता है। यह एक माली की तरह है जो बहुत ऊंचे और पतले पौधे की छंटाई करता है, अत्यधिक बढ़वार को काट देता है ताकि पौधा फिर से नई दिशाओं में शाखाएं निकाल सके।

इस दृष्टिकोण के परिणाम आश्चर्यजनक थे। उन परीक्षणों में जहाँ मशीनों को विभिन्न कार्यों के क्रम को सीखना था, क्लिपिंग विधि से उपचारित नेटवर्क अन्य सामान्य तकनीकों का उपयोग करने वाले नेटवर्कों की तुलना में काफी तेजी से और अधिक सटीकता से सीखे। कुछ पिछले तरीकों ने इस समस्या को ठीक करने की कोशिश की थी कि केवल यह सीमित किया जाए कि नेटवर्क एक दिशा में कितना बड़ा हो सकता है, लेकिन शोधकर्ताओं ने दिखाया कि यह अपर्याप्त था क्योंकि नेटवर्क अभी भी दूसरी दिशाओं में ढह सकता था। अन्य तरीकों में नेटवर्क को पूरी तरह से रीसेट करना शामिल था, जो नई चीजें सीखने के लिए तो अच्छा था लेकिन इससे मशीन ने पहले सीखी गई हर चीज़ को भुला दिया। नया तरीका बीच का रास्ता था: इसने मशीन को अपने पिछले ज्ञान को मिटाए बिना नए कार्यों को सीखने के लिए पर्याप्त लचीला बनाए रखा।

रिनफोर्समेंट लर्निंग की दुनिया में, जहाँ एजेंट प्रयास और त्रुटि (trial and error) से सीखते हैं, अंतर और भी नाटकीय था। एक कठिन वातावरण में, आवधिक रीसेट वाला एक मानक एजेंट कुछ भी सीखने में विफल रहा, जो कठोर रीसेट से उबरने में असमर्थ था। हालांकि, नए क्लिपिंग विधि का उपयोग करने वाला एजेंट अपने पिछले ज्ञान को पर्याप्त रूप से बनाए रखने में सफल रहा, और यहाँ तक कि बिना रीसेट वाले मानक एजेंट से भी बेहतर प्रदर्शन किया। यह सुझाव देता है कि आजीवन सीखने (lifelong learning) की कुंजी केवल नई चीजें सीखना नहीं है, बल्कि सीखने के लिए सही आंतरिक आकार बनाए रखना है। नेटवर्क की आंतरिक ज्यामिति को संतुलित रखकर, मशीन भविष्य के लिए खुली रहती है, और जो कुछ भी आगे आता है उसके अनुकूल होने के लिए तैयार रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →