← नवीनतम पेपर
💻 computer science

Stay Seated: Learning Omnidirectional Humanoid Locomotion on a Passive Mobile Chair with Casters

यह शोध पत्र एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो एक मानव सदृश रोबोट (humanoid robot) को विशेष पुरस्कारों और संपर्क सेटिंग्स के साथ मानक वेग-ट्रैकिंग वातावरण का विस्तार करके एक निष्क्रिय मोबाइल कुर्सी पर सुदृढ़, ज़ीरो-शॉट सिम-टू-रियल सर्वदिशीय (omnidirectional) बैठे हुए लोकोमोशन प्राप्त करने में सक्षम बनाता है, जबकि यह प्रदर्शित करता है कि फुट-स्लिप नियमितीकरण (foot-slip regularization) को समरूपता या पाठ्यक्रम शिक्षण (curriculum learning) के साथ जोड़ना ऊर्जा दक्षता और ट्रैकिंग प्रदर्शन के बीच प्रभावी ढंग से संतुलन बनाता है।

मूल लेखक: Kango Yanagida, Kazuki Miyazawa, Takato Horii

प्रकाशित 2026-08-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kango Yanagida, Kazuki Miyazawa, Takato Horii

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे रोबोट की कल्पना करें जो इंसानों की तरह डेस्क पर बैठकर काम कर सके। वर्षों से, इंजीनियरों ने रोबोट को दो पैरों पर चलना सिखाया है, लेकिन स्थिर खड़े रहने के लिए निरंतर ऊर्जा की आवश्यकता होती है; गुरुत्वाकर्षण के विरुद्ध अपना संतुलन बनाए रखने के लिए रोबोट के मोटरों को कड़ी मेहनत करनी पड़ती है, जिससे गर्मी पैदा होती है और शक्ति खर्च होती है। हालाँकि, लंबे कार्यों के लिए मनुष्यों के पास एक सरल समाधान है: हम बैठ जाते हैं। कुर्सी पर अपना वजन रखकर, हम अपनी मांसपेशियों को मुक्त कर देते हैं और बिना कभी खड़े हुए कार्यालय में इधर-उधर घूम सकते हैं। इस सरल अवलोकन ने रोबोटिक्स शोधकर्ताओं के लिए एक नया प्रश्न खड़ा कर दिया: क्या एक मानव रूपी (humanoid) रोबोट एक पहियों वाली कुर्सी और अपने स्वयं के पैरों का उपयोग करके खुद को आगे, पीछे और बगल की ओर धकेलते हुए, बैठे-बैठे घूमना सीख सकता है?

शोधकर्ताओं की एक टीम ने एक निष्क्रिय गतिशील कुर्सी (passive mobile chair) पर बैठकर नेविगेट करना सिखाकर इसका उत्तर देने का प्रयास किया। एक स्व-चालित व्हीलचेयर के विपरीत, जो अपने आप चलती है, इस कुर्सी में कोई मोटर नहीं है; यह पहियों पर एक साधारण सीट है। चलने के लिए, रोबोट को खुद को और कुर्सी दोनों को किसी भी दिशा में धकेलने के लिए अपने पैरों से फर्श पर धक्का देना होगा। यह चुनौती जटिल है क्योंकि रोबोट अपने शरीर को सीट से सीधे लॉक नहीं कर सकता। उसे एक नाजुक, बदलते संतुलन को बनाए रखना होगा, अपने कूल्हों को कुर्सी के संपर्क में रखते हुए और अपने पैरों को जमीन पर पकड़ बनाने देना होगा ताकि गति उत्पन्न की जा सके। यदि रोबोट सीट के संपर्क से बाहर हो जाता है या बहुत अधिक फिसलता है, तो कार्य विफल हो जाता है।

इसे हल करने के लिए, शोधकर्ताओं ने 'डीप रीइन्फोर्समेंट लर्निंग' (deep reinforcement learning) नामक एक विधि का उपयोग किया, जो एक ऐसी प्रक्रिया है जहाँ एक कंप्यूटर प्रोग्राम आभासी दुनिया में परीक्षण और त्रुटि (trial and error) के माध्यम से सीखता है। उन्होंने एक मानक प्रशिक्षण वातावरण से शुरुआत की जिसे खड़े होने वाले रोबोटों के लिए डिज़ाइन किया गया था और इसे बैठे हुए परिदृश्य को शामिल करने के लिए संशोधित किया। उन्होंने रोबोट को मनुष्यों के हिलने-डुलने के वीडियो नहीं दिखाए और न ही उसे कैसे चलना है, इसके बारे में निर्देशों का कोई पूर्व-लिखित सेट दिया। इसके बजाय, उन्होंने केवल रोबोट को बताया कि उसे किस गति और दिशा में चलना चाहिए, और बाकी चीज़ खुद समझने के लिए छोड़ दिया। रोबोट के "मस्तिष्क" को केवल अपने शरीर की स्थिति और दिए गए कमांड के बारे में बुनियादी जानकारी मिली, बिना किसी विशेष सेंसर के जिससे वह कुर्सी या फर्श को महसूस कर सके।

शोधकर्ताओं ने सीखने की प्रक्रिया को निर्देशित करने के विभिन्न तरीकों का परीक्षण किया। वे यह देखना चाहते थे कि क्या पैरों को हिलाने के तरीके या अपने बाएं और दाएं पैरों के साथ व्यवहार करने के विशिष्ट नियमों को जोड़ने से मदद मिलेगी। एक नियम ने रोबोट को दंडित किया यदि उसके पैर फर्श पर फिसलते थे, इस उम्मीद में कि इससे सुचारू गति को बढ़ावा मिलेगा। एक अन्य नियम ने रोबोट को अपने बाएं और दाएं पैरों का समान रूप से उपयोग करने के लिए प्रोत्साहित किया, जबकि तीसरे नियम ने रोबोट को आसान, धीमी कमांड के साथ शुरू किया और धीरे-धीरे कठिनाई बढ़ाई।

परिणामों ने यह खुलासा किया कि रोबोट ने कैसे सीखा, यह एक आश्चर्यजनक सत्य था। जब शोधकर्ताओं ने केवल पैर फिसलने के विरुद्ध नियम का उपयोग किया, तो रोबोट अक्सर एक अजीब तरीके से विफल हुआ। खुद को आगे धकेलने के बजाय, रोबले के कुछ संस्करणों ने बस हार मान ली और बिल्कुल स्थिर रहे, और तिरछे (diagonally) चलने के कमांड्स को अनदेखा कर दिया। उसने एक "लोकल ट्रैप" (local trap) खोज लिया था, एक ऐसा समाधान जो तकनीकी रूप से फिसलने से बचता है लेकिन वास्तविक कार्य में विफल रहता है। हालाँकि, जब शोधकर्ताओं ने फिसलन रोकने वाले नियम को समरूपता (symmetry) नियम या कठिनाई-क्रमिक (difficulty-gradual) नियम के साथ जोड़ा, तो रोबोट सफलतापूर्वक सीख गया। उसने बिना अटके सभी दिशाओं में खुद को धकेलने का तरीका खोज लिया।

सबसे प्रभावी दृष्टिकोण वह था जिसने गति में क्रमिक वृद्धि को संतुलित पैर संचालन के नियम के साथ जोड़ा। इस संयोजन ने रोबोट को उच्च सटीकता के साथ कमांड का पालन करने में सक्षम बनाया, और अक्सर एक समान रोबोट से बेहतर प्रदर्शन किया जिसे खड़े होकर चलने के लिए प्रशिक्षित किया गया था। शोधकर्ताओं ने विश्लेषण किया कि रोबोट वास्तव में कैसे चलता है और पाया कि यात्रा की दिशा उसके पैरों के उपयोग के तरीके को बदल देती है। पीछे या बगल की ओर चलते समय, रोबोट एक पैर को मजबूती से टिकाता है और कुर्सी को दूर धकेलने के लिए अपने घुटने को फैलाता है। आगे बढ़ते समय, वह इसके विपरीत करता है: वह पहले अपनी एड़ी को जमीन से छूता है और फिर खुद को और कुर्सी को उस पैर की ओर खींचने के लिए अपने घुटने को मोड़ता है।

इस गति के अंतर का ऊर्जा दक्षता पर सीधा प्रभाव पड़ा। रोबोट पीछे की ओर चलते समय सबसे कुशल था, उसके बाद बगल की ओर चलना। आगे की ओर जाना सबसे अधिक ऊर्जा-गहन कार्य था, जिसमें उच्च गति पर पार्श्व गति की तुलना में लगभग दोगुना प्रयास लगा। यह संभवतः इसलिए था क्योंकि आगे की गति के लिए पैर के जमीन छूने के बाद घुटने को मोड़ने की आवश्यकता थी, एक ऐसी गति जो अधिक घर्षण उत्पन्न करती है और गति बनाए रखने के लिए अधिक बल की आवश्यकता होती है।

अध्ययन ने वास्तविक दुनिया में एक सफल परीक्षण के साथ समापन किया। शोधकर्ताओं ने कंप्यूटर प्रोग्राम जिसे उन्होंने सिमुलेशन में प्रशिक्षित किया था, उसे बिना किसी और समायोजन के सीधे एक भौतिक रोबोट पर स्थापित किया। रोबोट, पहियों वाली एक वास्तविक कुर्सी पर बैठा, तुरंत आगे, पीछे और बगल की ओर बढ़ने लगा, और यहाँ तक कि मुड़ने में भी सक्षम रहा, ठीक वैसे ही जैसे उसने आभासी प्रशिक्षण में किया था। वह केवल अपने आंतरिक सेंसरों का उपयोग करके बैठने में सक्षम रहा और कमांड का पालन किया, यह साबित करते हुए कि एक रोबोट बिना कुर्सी को देखे या फर्श को महसूस किए, एक जटिल, बैठे हुए वातावरण में नेविगेट करना सीख सकता है। यह कार्य सुझाव देता है कि रोबोट जल्द ही हमारे डेस्क पर हमारे साथ शामिल हो सकते हैं, औजार उठाने या खुद को पुनर्गठित करने के लिए इधर-उधर घूम सकते हैं, जबकि बैठे रहकर ऊर्जा बचा सकते हैं और काम करने के एक बहुत ही मानवीय तरीके की नकल कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →