← नवीनतम पेपर
💻 computer science

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

SmoothRL एक ऑनलाइन रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो निष्पादन टाइमलाइन (execution timeline) को स्पष्ट रूप से मॉडल करके और वास्तविक समय की विश्वसनीयता और सुचारू नियंत्रण सुनिश्चित करने के लिए केवल नए निष्पादित एक्शन क्षेत्रों के माध्यम से ग्रेडिएंट्स को प्रसारित करके एसिंक्रोनस इन्फरेंस लूप्स के भीतर प्रीट्रेन्ड रोबोट पॉलिसियों के सैंपल-एफिशिएंट फाइन-ट्यूनिंग को सक्षम बनाता है।

मूल लेखक: Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

प्रकाशित 2026-09-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से जीवित चीजों जैसी सहज तरलता के साथ चलने के लिए संघर्ष करते रहे हैं। जबकि आर्टिफिशियल इंटेलिजेंस ने मशीनों को भाषा समझने और वस्तुओं को आश्चर्यजनक सटीकता के साथ पहचानने के योग्य बना दिया है, उस समझ को भौतिक गति में बदलना एक कठिन बाधा बनी हुई है। समस्या केवल यह नहीं है कि रोबोट को बुद्धिमान होना चाहिए; उन्हें तेज़ और सुचारू भी होना चाहिए। वास्तविक दुनिया में, एक रोबोटिक हाथ हर छोटी हरकत के बीच सोचने के लिए रुक नहीं सकता। यदि वह अपने अगले कदम की गणना करने के लिए रुक जाता है, तो गति झटकेदार हो जाती है, और कार्य विफल हो जाता है। सुचारू रूप से चलने के लिए, एक रोबोट को भविष्य की गतिविधियों की एक श्रृंखला का अनुमान लगाना चाहिए और अगली गतिविधियों की गणना करते हुए ही उन्हें निष्पादित करना चाहिए। यह एक जटिल समय संबंधी समस्या पैदा करता है: रोबोट उन निर्देशों पर कार्य कर रहा है जो एक क्षण पहले उत्पन्न किए गए थे, जबकि कंप्यूटर पहले से ही उस क्षण के निर्देशों पर काम कर रहा है जो इसके बाद आएगा। यदि रोबोट इन परिस्थितियों में काम करते हुए अपनी गलतियों से सीखने की कोशिश करता है, तो सीखने की प्रक्रिया अक्सर टूट जाती है, क्योंकि रोबोट को उन कार्यों के लिए आंका जा रहा होता है जिन्हें उसने वास्तव में कभी पूरा ही नहीं किया, या जिन्हें वह बीच में ही छोड़ने के लिए मजबूर था।

एस्ट्रिबोट (Astribot) के शोधकर्ताओं की एक टीम ने इस विशिष्ट समय संबंधी पहेली को हल करने के लिए 'स्मूथ आरएल' (SmoothRL) नामक एक नई विधि विकसित की है। उनका कार्य रोबot को वास्तविक समय में अनुभव से सीखने की अनुमति देता है, भले ही वे एक जटिल, ओवरलैपिंग शेड्यूल पर चल रहे हों जहाँ सोचना और चलना एक साथ होता है। शोधकर्ताओं ने इस बात पर ध्यान केंद्रित किया कि रोबोट को प्रशिक्षित करने के और उनके उपयोग करने के तरीके में एक मौलिक अंतर है। अतीत में, वैज्ञानिकों ने रोबोट को इस धारणा के साथ प्रशिक्षित किया था कि मशीन रुकेगी, सोचेगी और फिर एक पूर्ण, सिंक्रनाइज़ लय में चलेगी। लेकिन वास्तविक दुनिया में, गति को सुचारू बनाए रखने के लिए, रोबोट एक ऐसी प्रणाली का उपयोग करते हैं जहाँ वे भविष्य की गतिविधियों का एक "चंक" (खंड) उत्पन्न करते हैं, उसके पहले भाग को मोटरों को भेजते हैं, और तुरंत अगले चंक की गणना शुरू कर देते हैं जबकि पहला हिस्सा अभी भी निष्पादित हो रहा होता है। यह एक ऐसी स्थिति पैदा करता है जहाँ एक रोबोट लगातार अपनी ही योजनाओं के हिस्सों को त्याग देता है क्योंकि एक नया, ताज़ा प्लान आ चुका होता है। शोधकर्ताओं ने महसूस किया कि इस वातावरण में प्रभावी ढंग से सीखने के लिए, रोबोट को अपने योजना के उन हिस्सों से सीखने की कोशिश करना बंद कर देना चाहिए जिन्हें फेंक दिया गया था और केवल उन हिस्सों पर ध्यान केंद्रित करना चाहिए जिन्हें उसने वास्तव में किया।

उनके समाधान का मूल एक तरीका है जिससे रोबोट को उन "भूतिया" (ghost) क्रियाओं को अनदेखा करना सिखाया जाता है जिन्हें उसने बनाया तो था लेकिन उपयोग नहीं किया। जब रोबोट अगले कुछ सेकंड के लिए एक योजना बनाता है, तो वह उस योजना को तीन अलग-अलग क्षेत्रों में विभाजित करता है। पहले क्षेत्र में वे क्रियाएं होती हैं जो पिछले गणना चक्र द्वारा पहले ही तय की जा चुकी हैं; रोबोट अब इन्हें बदल नहीं सकता। दूसरे क्षेत्र में वे नई क्रियाएं होती हैं जिन्हें रोबोट वास्तव में तब करता है जब अगला गणना चक्र चल रहा होता है। तीसरा क्षेत्र भविष्य की शेष क्रियाओं को समाहित करता है जिन्हें अगली गणना द्वारा संभवतः बदल दिया जाएगा, इससे पहले कि रोबोट वास्तव में उन तक पहुँच सके। शोधकर्ताओं ने एक प्रशिक्षण प्रणाली बनाई जो केवल दूसरे क्षेत्र—उन क्रियाओं पर नज़र रखती है जिन्हें रोबлот ने वास्तव में निष्पादित किया—को देखती है। वे रोबोट को केवल उन गतिविधियों के परिणामों के आधार पर व्यवहार को समायोजित करना सिखाते हैं जो उसने वास्तव में की हैं, जिससे प्रभावी रूप से उस योजना के हिस्सों से मिलने वाले लर्निंग सिग्नल को काट दिया जाता है जिन्हें हटा दिया गया था। यह सुनिश्चित करता है कि रोबोट वास्तविकता से सीखता है, न कि उस काल्पनिक भविष्य से जो कभी हुआ ही नहीं।

इसका परीक्षण करने के लिए, शोधकर्ताओं ने दो भुजाओं वाले एक मोबाइल रोबोट पर तीन चुनौतीपूर्ण भौतिक कार्य आयोजित किए। पहले कार्य में एक बिन (टोकरी) में वस्तु को उछालना शामिल था, एक ऐसी गति जिसमें निरंतर, अटूट स्विंग की आवश्यकता होती है। यदि गणना चक्रों के बीच स्विच करते समय रोबोट हिचकिचाता या झटका लेता है, तो थ्रो विफल हो जाता है। दूसरे कार्य के लिए रोबोट को अत्यधिक सटीकता के साथ एक पेन का ढक्कन लगाने की आवश्यकता थी, जिसमें दो छोटी वस्तुओं को कुछ मिलीमीटर के टॉलरेंस के भीतर संरेखित करना था। तीसरा कार्य एक ब्लेड को एक बारीक सीम (जोड़) के साथ निर्देशित करके कार्डबोर्ड बॉक्स को काटकर खोलने का था, एक ऐसा काम जिसमें बॉक्स को काटने से बचने के लिए मिलीमीटर-स्तर की सटीकता की आवश्यकता होती है। इन तीनों मामलों में, रोबोट ने एक पूर्व-प्रशिक्षित मस्तिष्क के साथ शुरुआत की जो अच्छा था लेकिन पूर्ण नहीं था। जब शोधकर्ताओं ने रोबोट को उनके नए एसिंक्रोनस लर्निंग मेथड का उपयोग करके अभ्यास करने दिया, तो परिणाम नाटकीय थे। सफलतापूर्वक वस्तु उछालने की रोबोट की क्षमता तैंतीस प्रतिशत से बढ़कर चौरानवे प्रतिशत हो गई। पेन को कैप करने का उसका कौशल मात्र आठ प्रतिशत से बढ़कर तिरासी प्रतिशत हो गया, और बॉक्स खोलने की उसकी सफलता दर तीस प्रतिशत से बढ़कर नब्बे प्रतिशत हो गई।

सुधार केवल कार्य को अधिक बार पूरा करने के बारे में नहीं था; यह रोबोट की गति के बारे में था। शोधकर्ताओं ने रोबोट की गति की सुगमता को मापा और पाया कि नए तरीके ने अचानक झटकों और झटकेदार त्वरण को लगभग आधा कम कर दिया। यह सुगमता गतिशील थ्रोइंग कार्य के लिए महत्वपूर्ण थी, जहाँ गति में ठहराव होने से वस्तु लक्ष्य से कम रह जाती। सिस्टम मानवीय सहायता को संभालने के लिए भी पर्याप्त लचीला था। यदि किसी मानव ऑपरेटर को गलती सुधारने के लिए हस्तक्षेप करने की आवश्यकता होती है, तो रोबोट उस मानवीय क्रिया को सीधे अपनी सीखने की प्रक्रिया में समाहित कर सकता है बिना उसे किसी अलग कोड में अनुवादित किए। मानव का सुधार गति के सही तरीके का एक और उदाहरण बन जाता है, जिससे रोबोट अपने स्वयं के परीक्षणों और मानवीय मार्गदर्शन दोनों से एक साथ सीख सकता है।

शोधकर्ताओं ने पाया कि रोबोट की सीख हमेशा एक सीधी रेखा में नहीं थी। बॉक्स खोलने के कार्य में, प्रदर्शन में सुधार होने से पहले गिरावट आई, जो यह सुझाव देता है कि सिस्टम ने सही रास्ता खोजने से पहले ऐसे नए तरीकों का अन्वेषण किया जो शुरू में खराब लग रहे थे। यह इंगित करता है कि रोबोट वास्तव में अनुकूलन करना सीख रहा था, न कि केवल गतिविधियों के एक निश्चित सेट को याद कर रहा था। हालाँकि, शोधकर्ताओं ने अपने दृष्टिकोण की सीमाओं को भी नोट किया। रोबोट की सीखने की क्षमता अभी भी उसके प्रारंभिक पूर्व-प्रशिक्षित मस्तिष्क की गुणवत्ता से जुड़ी हुई है। यदि आधारभूत रोबोट किसी कार्य के बारे में मौलिक रूप से भ्रमित है, तो इस शिक्षण प्रणाली द्वारा किए गए छोटे समायोजन समस्या को ठीक करने के लिए पर्याप्त नहीं हो सकते हैं। इसके अलावा, सिस्टम इस बात पर निर्भर करता है कि रोबोट की गणनाएँ एक सख्त समय सीमा के भीतर पूरी हों; यदि कंप्यूटर बहुत धीमा हो जाता है, तो गतिविधियों का समय तालमेल से बाहर हो सकता है, जिससे पूरी प्रक्रिया अस्थिर हो सकती है।

अंततः, यह कार्य प्रदर्शित करता है कि रोबोटों के वास्तव में उपयोगी होने के लिए, उनके लर्निंग एल्गोरिदम को उनके चलने की अस्त-व्यस्त, ओवरलैपिंग वास्तविकता के अनुरूप होना चाहिए। रोबोट को केवल उन कार्यों पर ध्यान केंद्रित करना सिखाकर जिन्हें उसने वास्तव में पूरा किया और उन्हें अनदेखा करके जिन्हें उसने त्याग दिया, शोधकर्ताओं ने मशीनों के लिए उन जटिल, उच्च-गति वाले कार्यों को सीखने का मार्ग प्रशस्त किया है जिन्हें करने के लिए सुगमता की आवश्यकता होती है। परिणाम एक ऐसा रोबोट है जो उस स्तर की विश्वसनीयता और तरलता के साथ फेंक सकता है, कैप लगा सकता है और काट सकता है जो पहले पहुंच से बाहर था, यह सिद्ध करते हुए कि बेहतर रोबोट लर्निंग की कुंजी योजना के वास्तविकता बनने के सटीक क्षण को समझने में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →