← नवीनतम पेपर
⚡ electrical engineering

Guided Reinforcement Learning for Omnidirectional 3D Jumping in Quadruped Robots

यह शोध पत्र एक नवीन गाइडेड रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो बेज़ियर कर्व्स (Bezier curves) को यूनिफॉर्मली एक्सीलरेटेड रेक्टिलिनियर मोशन मॉडल के साथ एकीकृत करता है ताकि क्वाड्रुपेड रोबोट्स में कुशल, व्याख्या योग्य और सुदृढ़ सर्वदिशीय (omnidirectional) 3D जंपिंग को सक्षम बनाया जा सके, जो पारंपरिक एंड-टू-एंड दृष्टिकोणों की सैंपल इनएफिशिएंसी और सुरक्षा प्रमाणन चुनौतियों पर विजय प्राप्त करता है।

मूल लेखक: Riccardo Bussola, Michele Focchi, Giulio Turrisi, Claudio Semini, Luigi Palopoli

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Riccardo Bussola, Michele Focchi, Giulio Turrisi, Claudio Semini, Luigi Palopoli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक चार पैरों वाला रोबोट किसी खाई के ऊपर से कूदने या किसी ऊंचे शेल्फ पर चढ़ने की कोशिश कर रहा है। एक इंसान के लिए, कूदना स्वाभाविक है; लेकिन एक रोबोट के लिए, यह एक मैराथन दौड़ते समय एक जटिल भौतिकी पहेली (physics puzzle) को सुलझाने जैसा है। यदि रोबोट बहुत ज़ोर से धक्का देता है, तो वह अपने पैर तोड़ सकता है। यदि वह बहुत धीरे धक्का देता है, तो वह लक्ष्य तक नहीं पहुँच पाएगा। यदि वह गलत कोण पर धक्का देता है, तो वह अपने सिर के बल गिर जाएगा।

यह शोध पत्र इन रोबोटों को कूदना सिखाने का एक नया तरीका प्रस्तुत करता है, जिसे लेखक गाइडेड रीइन्फोर्समेंट लर्निंग (GRL) कहते हैं। यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए।

समस्या: "ट्रायल एंड एरर" (प्रयास और त्रुटि) का जाल

पारंपरिक रूप से, रोबोट को कूदना सिखाना एक बच्चे को साइकिल चलाना सिखाने जैसा है, जिसमें उसे खाई से नीचे फेंक दिया जाता है और उम्मीद की जाती है कि वह उड़ना सीख जाएगा।

  • पुराना तरीका (ऑप्टिमाइज़ेशन): इंजीनियर हर एक गणितीय समीकरण को पूरी तरह से सटीक रूप से कैलकुलेट करने की कोशिश करते हैं। यह घड़ी की सुइयों के चलते समय सुडोकू प puzzles को हल करने जैसा है। इसमें बहुत समय लगता है और यदि ज़मीन फिसलन भरी हो या रोबोट उम्मीद से थोड़ा भारी हो, तो यह अक्सर विफल हो जाता है।
  • मानक AI तरीका (एंड-टू-एंड RL): आप रोबोट को एक वीडियो गेम में लाखों बार कूदने के लिए छोड़ देते हैं। ज़्यादातर समय, वह गिर जाता है। अंततः, लाखों प्रयासों के बाद, वह शायद इसे समझ ले। यह अविश्वसनीय रूप से धीमा है और रोबोट अक्सर अजीब, अप्रत्याशित हरकतें सीख लेता है जिन्हें भरोसा करना कठिन होता है।

समाधान: "जीपीएस और भौतिकी" दृष्टिकोण

लेखक कहते हैं, "आइए रोबोट को सीखने शुरू करने से पहले थोड़ा सा सामान्य ज्ञान (common sense) दें।" रोबोट को अंधे होकर अंदाज़ा लगाने देने के बजाय, वे उसे भौतिक अंतर्ज्ञान (physical intuition) का उपयोग करके निर्देशित करते हैं।

इसे इस तरह सोचें:

  1. बेज़ियर कर्व (द रोडमैप): रोबट को यह बताने के बजाय कि "अपना बायां पैर 5 डिग्री घुमाओ, फिर दायां पैर 3 डिग्री घुमाओ," रोबोट से बेज़ियर कर्व (Bezier curve) नामक एक गणितीय उपकरण का उपयोग करके हवा में एक चिकना, अदृश्य रास्ता बनाने को कहा जाता है। कल्पना करें कि आप पेन से एक चिकना चाप (arc) बना रहे हैं। रोबोट को केवल उस चाप के शुरुआती और अंतिम बिंदुओं को तय करने की आवश्यकता है, और गणित उस बीच के चिकने रास्ते को भर देता है। यह सीखने के कार्य को बहुत छोटा और आसान बना देता है।
  2. "विस्फोटक" बूस्ट (UARM): कभी-कभी, केवल एक चिकना चाप बनाना ऊँची छलांग लगाने के लिए पर्याप्त नहीं होता है। रोबोट को एक "धक्के" की आवश्यकता होती है। लेखकों ने योजना में एक दूसरा भाग जोड़ा है: ज़मीन छोड़ने से ठीक पहले गति का एक सीधी रेखा वाला विस्फोट (Uniformly Accelerated Rectilinear Motion)। यह एक स्प्रिंटर की तरह है जो आगे की ओर झुकता है और स्टार्टिंग ब्लॉक्स से विस्फोटक गति के साथ निकलता है। यह सुनिश्चित करता है कि रोबोट इतनी ऊँचाई तक कूद सके कि उसके पैर इतने न मुड़ें कि उसका पेट ज़मीन से टकरा जाए।
  3. सेफ्टी फ़िल्टर (द बाउंसर): क्योंकि रोबोट अपनी छलांग की योजना बनाने के लिए वास्तविक भौतिकी समीकरणों का उपयोग कर रहा है, कंप्यूटर उस योजना को रोबोट के हिलने से पहले ही चेक कर सकता है। यह एक क्लब में आईडी चेक करने वाले बाउंसर जैसा है। यदि योजना कहती है, "यदि आप इस तरह कूदते हैं, तो आप अपना सिर टकरा लेंगे," तो कंप्यूटर कहता है, "नहीं, यह मान्य नहीं है," और रोबबंध को ऐसा करने से रोकता है। यह सिस्टम को सुरक्षित और अनुमानित बनाता है।

सीखना कैसे होता है

रोबोट एक "शिक्षक" (AI) और एक "छात्र" (रोबोट) का उपयोग करता है।

  • शिक्षक एक कूदने की योजना (चाप का आकार और गति) का सुझाव देता है।
  • छात्र उस योजना का पालन करने की कोशिश करता है।
  • यदि रोबोट लक्ष्य के करीब उतरता है और कुछ भी तोड़ता नहीं है, तो उसे एक "हाई फाइव" (पुरस्कार) मिलता है।
  • यदि वह खराब तरीके से उतरता है या सुरक्षा नियमों का उल्लंघन करता है (जैसे कि जोड़ को बहुत तेज़ी से हिलाना), तो उसे "टाइम आउट" (दंड) मिलता है।

क्योंकि रोबोट बेज़ियर कर्व की भौतिकी और "विस्फोटक" बूस्ट द्वारा निर्देशित है, उसे लाखों बार प्रयास करने की आवश्यकता नहीं है। वह केवल 2,000 प्रयासों में सीख जाता है, जबकि अन्य तरीकों को लाखों प्रयासों की आवश्यकता हो सकती है। यह गहरे पानी में फेंक दिए जाने के बजाय लाइफ जैकेट और कोच के साथ तैरना सीखने के बीच का अंतर है।

परिणाम: रोबोट क्या कर सकता है

टीम ने इसका परीक्षण दो वास्तविक रोबोटों (Unitree Go1 और Aliengo) और सिमुलेशन पर किया।

  • ओम्नीडायरेक्शनल (सर्वदिशीय): रोबोट आगे, पीछे, बगल में कूद सकता है, और कूदते समय हवा में घूम भी सकता है।
  • ऊपर और नीचे: यह एक ऊंचे बॉक्स पर ऊपर कूद सकता है या एक किनारे से नीचे उतर सकता है।
  • जीरो-शॉट ट्रांसफर: उन्होंने एक छोटे रोबोट (Go1) पर AI को प्रशिक्षित किया और फिर एक बड़े, भारी रोबोट (Aliengo) को उसी सटीक निर्देशों का उपयोग करके कूदने के लिए कहा। बड़े रोबोट ने बिना सब कुछ फिर से सीखे सफलतापूर्वक छलांग लगाई। यह एक बच्चे को साइकिल चलाना सिखाने और फिर उन्हें मोटरसाइकिल पर बैठने के बाद तुरंत संतुलन बनाना सिखाने जैसा है।

यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि यह विधि पिछली विधियों की तुलना में तेज़, सुरक्षित और अधिक सटीक है। यह केवल अंदाज़ा नहीं लगाता; यह अपने अंदाज़ों को निर्देशित करने के लिए भौतिकी के नियमों का उपयोग करता है। इसका मतलब है कि हम रोबोट पर वास्तविक दुनिया की स्थितियों (जैसे खोज और बचाव) में भरोसा कर सकते हैं, बिना इस चिंता के कि वह अचानक पलट जाएगा क्योंकि उसने "गलत अंदाज़ा" लगाया था।

संक्षेप में, लेखकों ने केवल रोबोट को कूदना नहीं सिखाया; उन्होंने उसे भौतिकी के नियमों का उपयोग करके कूदने के बारे में सोचना सिखाया, जिससे वह एक बहुत अधिक स्मार्ट और सुरक्षित शिक्षार्थी बन गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →