← नवीनतम पेपर
🤖 AI

Robust Fall Recovery for Armless Bipedal-Wheeled Robots Via Force-Guided Learning

यह शोधपत्र FTSR प्रस्तुत करता है, जो एक फोर्स-गाइडेड टीचर-स्टूडेंट सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो सिमुलेशन-आधारित सहायक बलों और चरण-वार पुरस्कारों का उपयोग करके बिना किसी बाहरी सहायता के आंतरिक स्थिरीकरण रणनीतियों को विकसित करने के लिए बांहहीन द्विपाद-पहिए वाले रोबोटों को मजबूत रूप से गिरने से उबरने और निरंतर गतिमान होने में सक्षम बनाता है।

मूल लेखक: Haidong Hou, Zhangguo Yu, Tao Han, Hengbo Qi, Khaleel Ghazal, Yu Zhang, Yidong Du, Xuechao Chen, Fei Meng

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haidong Hou, Zhangguo Yu, Tao Han, Hengbo Qi, Khaleel Ghazal, Yu Zhang, Yidong Du, Xuechao Chen, Fei Meng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे रोबोट की कल्पना करें जो इंसान जैसा दिखता है लेकिन उसके हाथ नहीं हैं और वह पैरों के बजाय दो पहियों पर चलता है। अगर यह रोबोट लड़खड़ाकर गिर जाता है, तो यह बड़ी मुसीबत में पड़ जाता है। एक इंसान के विपरीत जो ज़मीन से खुद को धकेलने के लिए अपने हाथों का उपयोग कर सकता है, या एक कुत्ते के विपरीत जो ऊपर उठने के लिए अपने अन्य पैरों का उपयोग कर सकता है, इस "बिना हाथ वाले, पहिये वाले" रोबोट के पास सारा काम करने के लिए केवल अपने दो पैर ही हैं। यह फर्श पर पीठ के बल लेटे हुए बिना हाथ या घुटनों के उपयोग के खड़े होने की कोशिश करने जैसा है—आपको केवल अपने टखनों और कूल्हों का उपयोग करके खुद को ऊपर खींचना होगा।

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे FTSR (Force-guided Teacher-student framework with Stage-wise Rewards) कहा जाता है, ताकि इन रोबोट्स को यह सिखाया जा सके कि गिरने के बाद कैसे वापस खड़ा होना है, चाहे वे किसी भी तरह से गिरे हों।

यह विधि कैसे काम करती है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: एक "डेड एंड" (बंद रास्ते) में फंस जाना

जब आप एक रोबोट को 'ट्रायल एंड एरर' (प्रयास और त्रुटि) के माध्यम से सीखना सिखाते हैं (Reinforcement Learning का उपयोग करके), तो वह अक्सर सबसे आसान शॉर्टकट खोजने की कोशिश करता है। यदि रोबोट गिर जाता है, तो वह एक अजीब, अजीबोगरीब मुद्रा पा सकता है जो तकनीकी रूप से "ऊपर" तो मानी जाती है लेकिन वास्तव में बेकार है। इस पेपर में इसे "डेड पॉइंट" कहा गया है। यह एक ऐसे हाइकर (पर्वतारोही) की तरह है जो एक छोटी गुफा में फंस गया है; वे तकनीकी रूप से खड़े हैं, लेकिन वे आगे नहीं बढ़ सकते। पारंपरिक तरीके अक्सर यहाँ फंस जाते हैं, खासकर जब रोबोट के पास हाथ नहीं होते।

2. समाधान: एक "जादुई अदृश्य हाथ" (Force-Guided Learning)

रोबोट को फंसने से रोकने के लिए, शोधकर्ता कंप्यूटर सिमुलेशन प्रशिक्षण के दौरान एक चतुर तरकीब का उपयोग करते हैं। वे कल्पना करते हैं कि एक अदृश्य हाथ रोबोट को धीरे से ऊपर उठा रहा है।

  • ट्विस्ट: आमतौर पर, शोधकर्ता समय के साथ इस "हाथ" को धीरे-धीरे बंद कर देते हैं। लेकिन यह पेपर इस हाथ को एक सख्त नियम की तरह मानता है। रोबोट को बताया जाता है: "तुम्हें इस हाथ की मदद से ऊपर उठना है, लेकिन तुम्हें इसका बहुत कम हिस्सा इस्तेमाल करने की अनुमति है।"
  • लक्ष्य: रोबोट हाथ की मदद लेते हुए खड़ा होना सीखता है, लेकिन नियम उसे हाथ की सहायता का कम से कम उपयोग करने के लिए मजबूर करते हैं। अंततः, हाथ गायब हो जाता है, और रोबोट ने खुद खड़ा होना सीख लिया होता है क्योंकि उसे एक वास्तविक, भौतिक तरीका खोजने के लिए मजबूर किया गया था, न कि कोई शॉर्टकट लेने के लिए।

3. प्रशिक्षण योजना: एक तीन-चरणीय सीढ़ी (Stage-wise Rewards)

आप रोबोट से एक सेकंड में "फर्श पर लेटने" से "मैराथन दौड़ने" तक जाने की उम्मीद नहीं कर सकते। शोधकर्ताओं ने रिकवरी को तीन अलग-अलग चरणों में विभाजित किया है, जैसे एक सीढ़ी चढ़ना:

  • चरण 1: सिट-अप (Sit-Up)। रोबोट को केवल अपने ऊपरी शरीर को सीधा करने के लिए पुरस्कृत किया जाता है। लक्ष्य कम है।
  • चरण 2: स्टैंड (Stand)। एक बार जब रोबोट काफी हद तक ऊपर आ जाता है, तो लक्ष्य ऊंचा हो जाता है। अब, उसे अपने पैरों को अंदर खींचना होगा और पूरी तरह से खड़े होने के लिए अपने पैरों को अपने नीचे लाना होगा।
  • चरण 3: वॉक (Walk)। एक बार जब वह खड़ा हो जाता है, तो लक्ष्य फिर से बदल जाता है। अब उसे चलना शुरू करना होगा।
  • यह क्यों मायने रखता है: यह रोबोट को भ्रमित होने से बचाता है। वह चलने की कोशिश करने से पहले खड़ा होना सीखता है। वह अगले चरण पर जाने से पहले एक चरण में महारत हासिल करता है।

4. शिक्षक और छात्र (Teacher-Student Architecture)

सीखने को तेज़ और स्मार्ट बनाने के लिए, वे "शिक्षक और छात्र" प्रणाली का उपयोग करते हैं:

  • शिक्षक (Teacher): यह रोबोट का एक सुपर-स्मार्ट संस्करण है जो सिमुलेशन के बारे में सब कुछ जानता है (जैसे गुरुत्वाकर्षण का सटीक बल, फर्श का घर्षण, और रोबोट का आंतरिक संतुलन)। वह जानता है कि "अदृश्य हाथ" उसकी मदद कैसे कर रहा है।
  • छात्र (Student): यह वह रोबोट है जो वास्तव में वास्तविक दुनिया में जाएगा। वह "अदृश्य हाथ" और अतिरिक्त भौतिक डेटा के प्रति "अंधा" है। वह केवल वही देखता है जो उसके अपने सेंसर देखते हैं।
  • सबक: शिक्षक जटिल भौतिकी को सीखता है और फिर छात्र को अपने सीमित संवेदों का उपयोग करके उन गतिविधियों की नकल करने के लिए सिखाता है। यह एक मास्टर शेफ (शिक्षक) द्वारा एक प्रशिक्षु (छात्र) को व्यंजन पकाने का तरीका सिखाने जैसा है, लेकिन प्रशिक्षु को गुप्त सामग्री सूची देखे बिना खाना बनाना सीखना पड़ता है।

5. परिणाम: वास्तविक दुनिया में सफलता

शोधकर्ताओं ने इस परीक्षण को एक वास्तविक रोबोट पर किया जिसका नाम JiaRan (एक बिना हाथ वाला, पहिये वाला द्विपद/biped) है।

  • परीक्षण: उन्होंने रोबोट को कई अलग-अलग तरीकों से ज़मीन पर गिराया—पेट के बल, एक तरफ, एक ढलान पर, घास पर, और यहाँ तक कि सीढ़ियों पर भी।
  • परिणाम: रोबोट लगभग हर प्रयास में सफलतापूर्वक खड़ा हुआ और चलने लगा, यहाँ तक कि अव्यवस्थपूर्ण बाहरी वातावरण में भी।
  • बोनस: उन्होंने इसे एक अधिक जटिल, 23-जोड़ों वाले ह्यूमनाइड रोबोट (Unitree) पर भी परखा और यह वहाँ भी काम आया, जो साबित करता है कि यह विधि लचीली है।

सारांश

संक्षेप में, यह पेपर बिना हाथ वाले रोबोट को गिरने के बाद कैसे उठना है, यह सिखाता है:

  1. एक "आभासी सहायक" का उपयोग करके जिस पर रोबोट को धीरे-धीरे कम निर्भर रहने के लिए मजबूर किया जाता है जब तक कि उसे उसकी आवश्यकता न रहे।
  2. कार्य को छोटे, प्रबंधनीय चरणों (सिट अप, स्टैंड अप, वॉक) में तोड़कर।
  3. एक "शिक्षक" रोबोट का उपयोग करके जो सभी रहस्यों को जानता है ताकि वह एक "छात्र" रोबोट को सिखा सके जो केवल वही जानता है जो वह महसूस कर सकता है।

परिणामस्वरूप, एक ऐसा रोबोट मिलता है जो एक अव्यवस्थित, अप्रत्याशित दुनिया में गिर सकता है और विश्वसनीय रूप से अपने आप वापस खड़ा हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →