← नवीनतम पेपर
🤖 machine learning

SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

यह शोध पत्र SPHERE को प्रस्तुत करता है, जो कि न्यूरल टेंगेंट कर्नेल थ्योरी से व्युत्पन्न एक व्यावहारिक पारसेवल पेनल्टी (Parseval penalty) है जो मिक्सचर-ऑफ-एक्सपर्ट्स नेटवर्क में स्पेक्ट्रल प्लास्टिसिटी लॉस को कम करता है, जिससे MetaWorld और HumanoidBench बेंचमार्क पर कॉन्टिनुअल रीइन्फोर्समेंट लर्निंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को विभिन्न प्रकार के कार्यों को करने के लिए प्रशिक्षित कर रहे हैं, जैसे चलना, कप उठाना और दरवाजा खोलना। आप चाहते हैं कि रोबोट एक के बाद एक कई चीजें सीखे बिना यह भूले कि उसने पहले क्या सीखा था। इसे कंटीन्यूअल लर्निंग (Continual Learning) कहा जाता है।

समस्या यह है कि जैसा कि यह शोध पत्र बताता है, जैसे-जैसे रोबोट अधिक सीखता है, वह "अटकने" लगता है। वह अपनी प्लास्टिसिटी (plasticity) खो देता है—यानी नई चीजों को सीखने की अपनी क्षमता, मुड़ने और अनुकूलन करने की अपनी क्षमता। वह कठोर हो जाता है, जैसे एक सूखा हुआ स्पंज जो अब पानी नहीं सोख सकता।

यहाँ इस समस्या को ठीक करने के लिए इस शोध पत्र द्वारा किए गए समाधान का सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है।

समस्या: "कोलैप्स्ड स्पेक्ट्रम" (Collapsed Spectrum)

लेखक बताते हैं कि जब एक रोबोट सीखता है, तो वह नए अनुभवों के आधार पर अपने आंतरिक "मस्तिष्क" (एक न्यूरल नेटवर्क) को अपडेट करता है। आदर्श रूप से, उसे एक साथ कई अलग-अलग दिशाओं में समायोजन करने में सक्षम होना चाहिए, जैसे कि एक लचीला जिम्नास्ट जो बाएं, दाएं, ऊपर और नीचे मुड़ सकता है।

हालाँकि, समय के साथ, रोबोट का मस्तिष्क ढहने लगता है। वह लचीला रहना छोड़ देता है और केवल एक या दो विशिष्ट दिशाओं में ही सीखना शुरू कर देता है। शोध पत्र इसे लॉस ऑफ स्पेक्ट्रल प्लास्टिसिटी (loss of spectral plasticity) कहता है।

  • उदाहरण: एक संगीत ऑर्केस्ट्रा की कल्पना करें। शुरुआत में, हर वाद्य यंत्र (तार वाले, पीतल वाले, ताल वाले) एक अनूठा स्वर बजाता है, जिससे एक समृद्ध और पूर्ण ध्वनि उत्पन्न होती है। जैसे-जैसे रोबोट अधिक कार्य सीखता है, ऑर्केस्ट्रा केवल एक ही स्वर बार-बार बजाने लगता है। संगीत सपाट और उबाऊ हो जाता है। रोबोट जटिल नए कौशल नहीं सीख पाता क्योंकि उसने अपनी "संगीत संबंधी रेंज" खो दी है।

समाधान: MoE (Mixture of Experts)

कई कार्यों को संभालने के लिए, शोधकर्ता मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts - MoE) नामक एक विशेष मस्तिष्क संरचना का उपयोग करते हैं।

  • उदाहरण: एक सामान्य विशेषज्ञ मस्तिष्क के बजाय, 10 विशेषज्ञों की एक टीम की कल्पना करें। जब रोबोट को चलने की आवश्यकता होती है, तो वह "वॉकिंग एक्सपर्ट" (चलने के विशेषज्ञ) से पूछता है। जब उसे कप उठाने की आवश्यकता होती है, तो वह "ग्रास्पिंग एक्सपर्ट" (पकड़ने के विशेषज्ञ) से पूछता है। एक "गेटकीपर" (Gatekeeper) तय करता है कि प्रत्येक स्थिति के लिए किस विशेषज्ञ का उपयोग किया जाए।

शोध में पाया गया कि इस विशेषज्ञों की टीम के बावजूद, रोबोट अभी भी अटक जाता है। विशेषज्ञ मिलकर काम करना बंद कर देते हैं, और टीम का "स्पेक्ट्रम" ढह जाता है। वे सभी एक ही चीज़ करने लगते हैं, या गेटकीपर अधिकांश को सुनना बंद कर देता है।

समाधान: SPHERE

लेखकों ने SPHERE (Spectral Plasticity via Hyperspherical Expert Regularization) नामक एक नया टूल बनाया है।

  • उदाहरण: विशेषज्ञों को नर्तकों के एक समूह के रूप में सोचें। समय के साथ, वे सभी एक तंग, भीड़भाड़ वाले घेरे में नाचने लगते हैं, बिल्कुल एक ही तरह से चलते हैं। SPHERE एक कोरियोग्राफर की तरह है जो उन्हें धीरे से एक-दूसरे से दूर धकेलता है। यह उन्हें फैलने और पूरे डांस फ्लोर को कवर करने के लिए मजबूर करता है, यह सुनिश्चित करता है कि वे सभी अलग-अलग, अनूठी दिशाओं में चल रहे हैं।

तकनीकी रूप से, SPHERE प्रशिक्षण के दौरान एक "पेनल्टी" (एक हल्का सा धक्का) लगाकर ऐसा करता है। यह विशेषज्ञों की विशेषताओं के "आकार" की जाँच करता है और यदि वे बहुत समान या बहुत सपाट हो जाते हैं, तो उन्हें दंडित करता है। यह उन्हें "गोलाकार" (गोल और पूर्ण) रहने के लिए मजबूर करता है, जिससे रोबोट का मस्तिष्क लचीला रहता है और नई चीजें सीखने के लिए तैयार रहता है।

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने इसका परीक्षण दो बहुत कठिन रोबोट सिमुलेशन वातावरणों पर किया:

  1. MetaWorld: 10 रोबोटिक आर्म कार्यों का एक सेट (जैसे बटन दबाना या वॉल्व घुमाना)।
  2. HumanoidBench: एक मानव जैसे दिखने वाले रोबोट के लिए 5 कार्यों का एक सेट (जैसे खड़े होना, चलना या फिसलना)।

परिणाम:

  • SPHERE के बिना: रोबोट की टीम (MoE) अटक गई। जैसे-जैसे उन्होंने बाद के कार्यों को सीखा, उनकी सफलता दर काफी गिर गई क्योंकि उन्होंने अनुकूलन करने की क्षमता खो दी थी।
  • SPHERE के साथ: रोबोट की टीम लचीली बनी रही।
    • MetaWorld पर, रोबोटों ने बिना मदद वाले बेसलाइन की तुलना में अपनी सफलता दर में 133% का सुधार किया।
    • HumanoidBench पर, उन्होंने 50% का सुधार किया।

शोध पत्र ने यह भी दिखाया कि जब SPHERE का उपयोग किया गया, तो प्रशिक्षण के दौरान "म्यूजिकल स्पेक्ट्रम" (लचीलेपन का गणितीय माप) उच्च बना रहा, जिससे सिद्ध हुआ कि रोबोटों ने नई दिशाओं को सीखने की अपनी क्षमता नहीं खोई।

सारांश

संक्षेप में, डीप लर्निंग रोबोट अक्सर "कठोर" हो जाते हैं और नई चीजें सीखना भूल जाते हैं। यह शोध पत्र SPHERE पेश करता है, जो एक कोच की तरह काम करता है, जो लगातार रोबोट के आंतरिक "विशेषज्ञों" को विविध और लचीला रहने की याद दिलाता रहता है। ऐसा करके, रोबोट अनुकूलन करने की अपनी क्षमता खोए बिना कार्यों के एक लंबे क्रम को सीख सकता है, जो पिछले तरीकों की तुलना में काफी बेहतर प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →