← नवीनतम पेपर
🧬 biology

Learning Options for Compositional Motor Control with Adapter Banks

यह शोधपत्र एक नवीन आर्किटेक्चर प्रस्तावित करता है जो उभरते हुए लो-रैंक परटर्बेशन्स (low-rank perturbations) के रूप में लचीले मोटर प्रिमिटिव्स को सीखने के लिए रेजिडुअल एडेप्टर्स के एक बैंक द्वारा मॉड्युलेट किए गए एक साझा रिकरेंट कोर का उपयोग करता है, जिससे एक फ्रोजन हाई-लेवल पॉलिसी इन एडेप्टर्स को अनुक्रमित करने में सक्षम होती है, जो मल्टीटास्क बेसलाइन्स की तुलना में नवीन मोटर अनुक्रमों के लिए बेहतर सामान्यीकरण (generalization) प्रदान करती है।

मूल लेखक: Sreejan Kumar, Marcelo Mattar, Lea Duncker

प्रकाशित 2026-09-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sreejan Kumar, Marcelo Mattar, Lea Duncker

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कुशल गतिशीलता, एक पियानो वादक के सुचारू स्केल्स से लेकर एक जिम्नास्ट के जटिल वॉल्ट तक, एक छिपी हुई क्षमता पर निर्भर करती है: मस्तिष्क हर नई गति को शून्य से नहीं सीखता है। इसके बजाय, यह पुन: प्रयोज्य निर्माण खंडों, या 'प्रिमिटिव्स' (primitives) का एक पुस्तकालय बनाता है, जिन्हें अनंत नई क्रियाएं बनाने के लिए मिलाया, जोड़ा और नया रूप दिया जा सकता है। कौशल के एक सीमित सेट को नवीन अनुक्रमों में पुनर्संयोजित करने की यह क्षमता मानवीय निपुणता की एक पहचान है। दशकों से, वैज्ञानिकों ने कृत्रिम एजेंटों को यही लचीलापन सिखाने की कोशिश की है, इस उम्मीद में कि रोबोट को बिना शून्य से फिर से प्रशिक्षित किए नए कार्यों के अनुकूल बनाया जा सके। चुनौती एक ऐसी सीखने वाली प्रणाली खोजने में थी जो इन निर्माण खंडों को स्वयं खोज सके और फिर पुराने कौशल नए वाले में बाधा डाले बिना उन्हें संयोजित कर सके। तंत्रिका विज्ञान के हालिया सिद्धांत सुझाव देते हैं कि मस्तिष्क इसे विभिन्न इनपुट द्वारा थोड़े से बदलाव (tweak) किए गए न्यूरॉन्स के एक साझा नेटवर्क का उपयोग करके हल कर सकता है, जिससे एक ही मूल मशीनरी बहुत अलग व्यवहार उत्पन्न कर सकती है।

कोलंबिया यूनिवर्सिटी और न्यूयॉर्क यूनिवर्सिटी के शोधकर्ताओं का एक नया अध्ययन इस जैविक सिद्धांत को एक कंप्यूटर मॉडल के माध्यम से जीवंत करता है, जो यह प्रदर्शित करता है कि कैसे एक कृत्रिम प्रणाली शून्य से जटिल गतियों की रचना करना सीख सकती है। टीम ने एक डिजिटल मस्तिष्क बनाया जिसे एक सिम्युलेटेड दो-जोड़ वाले हाथ को नियंत्रित करने के लिए डिज़ाइन किया गया था, जिसमें छह मांसपेशियां थीं, बिल्कुल एक मानव अंग की तरह। उन्होंने इस प्रणाली को विभिन्न प्रकार की गतियां सीखने के लिए कहा, जिसमें सीधा पहुंचना, वृत्तों में घूमना और आकृति-आठ (figure-eight) पैटर्न बनाना शामिल था। इन पथों को केवल याद करने के बजाय, शोधकर्ता चाहते थे कि प्रणाली प्रत्येक गति के अंतर्निहित हिस्सों को खोज ले और उन कार्यों को करने के लिए उन्हें जोड़ने का तरीका सीख ले जो उसने पहले कभी नहीं देखे थे। ऐसा करने के लिए, उन्होंने एक आर्किटेक्चर बनाया जो मस्तिष्क के मोटर कॉर्टेक्स और थैलमस (एक गहरा मस्तिष्क संरचना जो विभिन्न मोटर प्रोग्रामों के बीच चयन करने और स्विच करने में मदद करता है) के बीच के संबंध से प्रेरित था।

शोधकर्ताओं ने एक साझा "कोर" नेटवर्क वाला सिस्टम डिज़ाइन किया जो गति के बुनियादी यांत्रिकी को संभालता है, जो मोटर कॉर्टेक्स के समान है। इस कोर से विशेष मॉड्यूल, या 'एडेप्टर' (adapters) का एक बैंक जुड़ा हुआ है, जो छोटे, समायोज्य नॉब की तरह कार्य करते हैं जो कोर के व्यवहार को थोड़ा बदल सकते हैं। मस्तिष्क में, ये एडेप्टर थैलमस से आने वाले संकेतों के अनुरूप होंगे जो एक विशिष्ट गति उत्पन्न करने के लिए मोटर कॉर्टेक्स की गतिविधि को थोड़ा बदलते हैं। शोधकर्ताओं ने सिस्टम को यह प्रोग्राम नहीं किया कि कब किस एडेप्टर का उपयोग करना है; इसके बजाय, उन्होंने सिस्टम को एक विशेषज्ञ शिक्षक को कार्य करते हुए देखकर सही मॉड्यूल को पहचानने और चुनने के लिए छोड़ दिया। शिक्षक एक अलग, पूर्व-प्रशिक्षित नेटवर्क था जो जानता था कि प्रत्येक गति के लिए किस नियम का पालन करना है। हालाँकि, छात्र प्रणाली (student system) को शिक्षक के कार्यों को खंडों में तोड़ने और यह तय करने का तरीका खोजना था कि किस क्षण किस एडेप्टर को सक्रिय किया जाए, और वह भी बिना स्पष्ट रूप से नियम बताए।

जैसे ही छात्र प्रणाली ने इन मिश्रित गतियों पर प्रशिक्षण लिया, कुछ अद्भुत हुआ। भले ही एडेप्टर पूरी तरह से लचीले और जटिल होने के लिए बनाए गए थे, सिस्टम ने स्वाभाविक रूप से उन्हें सरल, 'लो-रैंक' (low-rank) समायोजन के रूप में उपयोग करना सीख लिया। सरल शब्दों में, सिस्टम ने खोजा कि उसे हर नए कार्य के लिए पूरे मस्तिष्क को फिर से लिखने की आवश्यकता नहीं है; उसे केवल साझा कोर में छोटे, सटीक बदलाव करने की आवश्यकता है। इसने सिस्टम को अपने आंतरिक राज्य के भीतर विभिन्न गतियों को अलग-अलग, विशिष्ट स्थानों में विभाजित करने की अनुमति दी। जबकि शिक्षक नेटवर्क, जो स्पष्ट नियम इनपुट पर निर्भर था, अपने सभी कार्य निरूपणों (representations) को एक साझा स्थान में उलझा हुआ रखता था, छात्र प्रणाली ने उन्हें अत्यधिक पृथक क्षेत्रों में व्यवस्थित किया। प्रत्येक गति का प्रकार, जैसे कि सीधा पहुंचना या गोलाकार चाप, सिस्टम के आंतरिक परिदृश्य के अपने विशिष्ट कोने में स्थित था, जिससे बिना किसी भ्रम के उनके बीच स्विच करना बहुत आसान हो गया।

इस दृष्टिकोण का वास्तविक परीक्षण तब आया जब शोधकर्ताओं ने सिस्टम को एक पूरी तरह से नया कार्य करने के लिए कहा: एक दो-पंखुड़ी वाला प्रक्षेपवक्र (two-petal trajectory) जो उन गतियों के हिस्सों को जोड़ता है जिन्हें उसने सीखा था, लेकिन एक ऐसे तरीके से जिसे उसने पहले कभी नहीं देखा था। इस नए पथ के लिए एक सीधी विस्तार (extension) को एक घुमावदार संकुचन (retraction) से जोड़ने और फिर एक घुमावदार विस्तार को सीधे संकुचन से जोड़ने की आवश्यकता थी, जिससे एक विच्छेदन (discontinuity) पैदा हुआ जिसका अनुभव न तो छात्र को था और न ही शिक्षक को। शोधकर्ताओं ने दोनों प्रणालियों के आंतरिक नेटवर्क को फ्रीज कर दिया और उपलब्ध निर्माण खंडों को अनुक्रमित करने का सबसे अच्छा तरीका खोजने का प्रयास किया ताकि नए लक्ष्य से मेल खा सके। छात्र प्रणाली, अपने पृथक और मॉड्यूलर आर्किटेक्चर के साथ, उच्च सटीकता के साथ सफल रही, जिसने लगभग 0.005 मीटर की त्रुटि के साथ नए पथ का अनुसरण किया। शिक्षक प्रणाली, जो अपने उलझे हुए, एकल-उपस्थान (single-subspace) दृष्टिकोण पर निर्भर थी, काफी संघर्ष करती दिखी, और दस गुना बड़ी त्रुटि के साथ रुक गई।

निष्कर्ष बताते हैं कि लचीले मोटर नियंत्रण की कुंजी केवल एक साझा नेटवर्क होना नहीं है, बल्कि उस नेटवर्क को विशिष्ट, लो-रैंक समायोजनों द्वारा नियंत्रित करना है जो विभिन्न कार्यों को अलग-अलग आंतरिक स्थानों में रखते हैं। यह ज्यामितीय अलगाव सिस्टम को अपने सीखे हुए प्रिमिटिव्स को मिलाने और नए समस्याओं को हल करने के लिए उनका पुनर्संयोजन करने की अनुमति देता है, जिससे उस हस्तक्षेप से बचा जा सके जो आमतौर पर कृत्रिम शिक्षण में होता है। यह अध्ययन एक ठोस प्रदर्शन प्रदान करता है कि कैसे मस्तिष्क के थैलेमोकोर्टिकल लूप्स (thalamocortical loops) से प्रेरित एक आर्किटेक्चर अपने स्वयं के पुन: प्रयोज्य निर्माण खंडों को खोजने और आउट-ऑफ-डिस्ट्रीब्यूशन चुनौतियों से निपटने के लिए उन्हें पुनर्संयोजित करना सीख सकता है। यह दिखाकर कि एक प्रणाली अपने व्यवहार को विशिष्ट उपस्थानों (subspaces) में विभाजित करना सीख सकती है, यह शोध मशीनों को एक मानव एथलीट की तरह आसानी और रचनात्मकता के साथ नए भौतिक कार्यों के अनुकूल बनाने की दिशा में एक आशाजनक मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →