← नवीनतम पेपर
💻 computer science

Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy

यह शोध पत्र ड्यूल-लेटेंट स्पेस रीइन्फोर्समेंट लर्निंग (DLSRL) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक फ्रोजन जनरेटर के माध्यम से प्रारंभिक-शोर स्टीयरिंग (initial-noise steering) को मध्यवर्ती विशेषता मॉड्यूलेशन (intermediate feature modulation) के साथ जोड़कर प्रीट्रेन्ड जेनरेटिव रोबोट नीतियों को बढ़ाता है, जिससे बेस पॉलिसी को अपडेट किए बिना कुशल ऑनलाइन अनुकूलन सक्षम होता है।

मूल लेखक: Pengfei Zhang, Teng Sun, Xianchao Xiu

प्रकाशित 2026-09-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengfei Zhang, Teng Sun, Xianchao Xiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो मनुष्यों को कार्य करते हुए देखकर सीख सकते हैं, वे अब केवल विज्ञान कथा (साइंस फिक्शन) नहीं रह गए हैं; वे आर्टिफिशियल इंटेलिजेंस के क्षेत्र में तेजी से बढ़ती एक वास्तविकता हैं। ये सिस्टम, जिन्हें अक्सर विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, उन छात्रों की तरह कार्य करते हैं जिन्होंने किसी भी उपकरण को छूने से पहले निर्देशों वाले वीडियो और मैनुअल की एक विशाल लाइब्रेरी पढ़ ली है। लाखों उदाहरणों का अध्ययन करके, वे अपने हाथों को हिलाने, वस्तुओं को पकड़ने और निर्देशों का पालन करने का एक सामान्य बोध सीखते हैं। हालाँकि, जिस तरह एक छात्र परिचित कार्य को थोड़े अलग कमरे में या एक नए उपकरण के साथ करने के लिए कहा जाने पर संघर्ष कर सकता है, ये रोबोट अक्सर तब लड़खड़ा जाते हैं जब वास्तविक दुनिया उस डेटा से पूरी तरह मेल नहीं खाती जिस पर उन्हें प्रशिक्षित किया गया था। जब कोई रोबोट ऐसी स्थिति का सामना करता है जो उसने पहले कभी नहीं देखी, तो उसे तेजी से अनुकूलित होने की आवश्यकता होती है। वैज्ञानिकों के लिए चुनौती यह है कि इन विशाल, पूर्व-प्रशिक्षित प्रणालियों को बिना उन्हें शुरू से फिर से प्रशिक्षित किए, नए वातावरण के अनुकूल होना कैसे सिखाया जाए, क्योंकि यह प्रक्रिया व्यावहारिक उपयोग के लिए बहुत धीमी और गणनात्मक रूप से महंगी होगी।

कुछ समय से, शोधकर्ता इन रोबोटों को उनके निर्णय लेने की प्रक्रिया के बिल्कुल शुरुआती हिस्से में बदलाव करके निर्देशित करने का प्रयास कर रहे हैं। कल्पना कीजिए कि एक रोबोट जो शोर (नॉइज़) के एक यादृच्छिक पैटर्न से शुरू होकर धीरे-धीरे इसे एक सुचारू गति में परिष्कृत करके गतिविधियों का एक क्रम उत्पन्न करता है। मौजूदा तरीके बेहतर परिणाम की ओर बढ़ने के लिए उस प्रारंभिक यादृच्छिक पैटर्न को बदलने पर ध्यान केंद्रित करते हैं। हालांकि यह मदद करता है, लेकिन यह कार को केवल पहियों की शुरुआती स्थिति को समायोजित करके मोड़ने की कोशिश करने जैसा है; एक बार जब कार चलने लगती है, तो चालक के पास वाहन को भटकने से रोकने के लिए सीधे तौर पर उसे नियंत्रित करने का कोई तरीका नहीं होता है। रोबोट की गति करने के बारे में आंतरिक "सोच" स्थिर रहती है, और प्रारंभिक समायोजन उन छोटी, सटीक त्रुटियों को आसानी से ठीक नहीं कर सकता जो गति के दौरान बाद में होती हैं। इस सीमा का अर्थ है कि मार्गदर्शन के बावजूद, रोबोट उन कार्यों में विफल हो सकता है जिनमें उच्च सटीकता की आवश्यकता होती है, जैसे कि तश्तरी पर कप रखना या बोल्ट को कसना।

इसे हल करने के लिए, शंघाई विश्वविद्यालय के शोधकर्ताओं ने 'डुअल-लेटेंट स्पेस रीइन्फोर्समेंट लर्निंग' नामक एक नया दृष्टिकोण विकसित किया है। केवल रोबлот के मूवमेंट प्लान के शुरुआती बिंदु को समायोजित करने के बजाय, उनका सिस्टम रोबोट की योजना बनते समय उसकी आंतरिक 'सोच' को प्रेरित करना सीखता है। शोधकर्ताओं ने एक हल्का नियंत्रण मॉड्यूल बनाया है जो रोबोट के जमे हुए (फ्रोजन), पूर्व-प्रशिक्षित मस्तिष्क के साथ मिलकर काम करता है। यह मॉड्यूल दो चीजें एक साथ करता है: यह प्रारंभिक शुरुआती पैटर्न का चयन करता है, जैसा कि पिछले तरीकों ने किया था, लेकिन यह एक दूसरा सिग्नल भी उत्पन्न करता है जिसे सीधे रोबोट के प्रोसेसिंग नेटवर्क की मध्य परतों (मिडल लेयर्स) में इंजेक्ट किया जाता है। इसे ऐसे समझें जैसे आपके पास एक सह-पायलट है जो न केवल गंतव्य निर्धारित करने में मदद करता है, बल्कि कार चलाने के दौरान स्टीयरिंग व्हील और पेडल पर सूक्ष्म, वास्तविक समय के समायोजन करने के लिए भी हाथ बढ़ाता है, जिससे यह सुनिश्चित होता है कि वाहन सटीक पथ पर बना रहे।

शोधकर्ताओं ने सिम्युलेटेड वातावरण में वस्तुओं को उठाने, कैन को हिलाने और ब्लॉक को स्टैक करने सहित विभिन्न रोबोटिक कार्यों पर इस पद्धति का परीक्षण किया। उन्होंने अपने नए सिस्टम की तुलना सबसे अच्छे मौजूदा तरीकों से की जो केवल शुरुआती बिंदु को समायोजित करते थे। परिणामों ने दिखाया कि डुअल-कंट्रोल सिस्टम ने रोबोटों को बहुत तेजी से सीखने में सक्षम बनाया। उच्च सटीकता वाले कार्यों में, जैसे कि कैन को एक विशिष्ट स्थान पर रखना, नए तरीके ने लगभग 99 प्रतिशत की सफलता दर हासिल की, जबकि पुराने तरीके 90 प्रतिशत को पार करने के लिए संघर्ष कर रहे थे। रोबोट ने कम प्रयासों के साथ नई चुनौतियों के अनुकूल होना सीखा, जिसका अर्थ है कि वे अपनी गलतियों से अधिक कुशलता से सीख सकते थे। अध्ययन ने यह भी प्रदर्शित किया कि यह दृष्टिकोण रोबोट के विभिन्न प्रकार के 'मस्तिष्क' के साथ काम करता है, न कि केवल एक विशिष्ट डिज़ाइन के साथ, जो रोबोटिक प्रदर्शन को सुधारने के लिए एक बहुमुखी उपकरण होने का सुझाव देता है।

इस खोज का एक प्रमुख हिस्सा यह समझना था कि यह आंतरिक प्रेरणा (नज) कितनी प्रभावशाली होनी चाहिए। शोधकर्ताओं ने पाया कि यदि वे रोबोट के आंतरिक विचारों पर बहुत अधिक दबाव डालते हैं, तो गतिविधियाँ अस्थिर और अनियंत्रित हो जाती हैं। हालाँकि, यदि वे बिल्कुल सही मात्रा में हल्का दबाव डालते हैं, तो रोबोट का प्रदर्शन लगातार और सुचारू रूप से सुधरता है। इस संतुलन ने रोबोट को अपने द्वारा पहले से सीखे गए सामान्य कौशल बनाए रखने और नए कार्य के लिए आवश्यक विशिष्ट, सूक्ष्म सुधार करने की अनुमति दी। सिस्टम ने इन परिणामों को प्राप्त किया बिना स्वयं विशाल पूर्व-प्रशिक्षित मॉडल को बदले, जिससे मूल रोबोट मस्तिष्क बरकरार रहा और केवल छोटे, हल्के नियंत्रण मॉड्यूल को अपडेट किया गया। इसका मतलब है कि रोबोट को नई स्थितियों में तैनात किया जा सकता है और वह अपनी अंतर्निहित बुद्धिमत्ता का पूर्ण ओवरहाल किए बिना ऑन-द-फ्लाई (तुरंत) अनुकूल होना सीख सकता है।

इस कार्य के निहितार्थ महत्वपूर्ण हैं। रोबोटों को उनकी गतिविधियों के निर्माण के दौरान सटीक समायोजन करने की अनुमति देकर, यह पद्धति व्यापक, सामान्य ज्ञान और वास्तविक दुनिया में आवश्यक विशिष्ट, नाजुक कार्यों के बीच के अंतर को पाटती है। शोधकर्ताओं ने अपने निष्कर्षों की पुष्टि व्यापक सिमुलेशन के माध्यम से की, जिससे पता चला कि यह दृष्टिकोण कई कार्यों में पिछले तकनीकों से लगातार बेहतर प्रदर्शन करता है। हालांकि यह कार्य कंप्यूटर सिमुलेशन में किया गया था, अनुकूलन की गति और दक्षता बताती है कि इन रोबतों को जल्द ही वास्तविक दुनिया के परिवेश में तैनात किया जा सकता है, जिससे वे उस स्तर की निपुणता के साथ नई वस्तुओं और वातावरण को संभालना सीख सकते हैं जो पहले प्राप्त करना कठिन था। अध्ययन यह निष्कर्ष निकालता है कि रोबोटों को उनके आंतरिक निरूपण (इंटरनल रिप्रेजेंटेशन) को नियंत्रित करने का तरीका देकर, हम ऐसी मशीनें बना सकते हैं जो न केवल स्मार्ट हैं, बल्कि लचीली और भौतिक दुनिया की अनिश्चित प्रकृति के लिए तैयार भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →