← नवीनतम पेपर
💻 computer science

Chasing Autonomy: Dynamic Retargeting and Control Guided RL for Performant and Controllable Humanoid Running

यह शोध पत्र एक गतिशील रिटारगेटिंग और नियंत्रण-निर्देशित सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) पाइपलाइन प्रस्तुत करता है जो यूनिट्री G1 ह्यूमनॉइड रोबोट को वास्तविक दुनिया के वातावरण में स्वायत्त बाधा निवारण के साथ 3.3 मीटर/सेकेंड तक उच्च गति, सहनशक्ति वाली दौड़ प्राप्त करने में सक्षम बनाता है।

मूल लेखक: Zachary Olkin, William D. Compton, Ryan M. Bena, Aaron D. Ames

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zachary Olkin, William D. Compton, Ryan M. Bena, Aaron D. Ames

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह दौड़ना सिखा रहे हैं। यह सुनने में सरल लगता है, लेकिन धातु और मोटरों से बनी एक मशीन के लिए, दौड़ना हाथ में झाड़ू संतुलित करने जैसा है जब आप एक तूफान के बीच से तेजी से भाग रहे हों। यदि रोबोट फिसला, तो वह गिर जाएगा। यदि वह बहुत तेज़ी से मुड़ने की कोशिश करता है, तो वह टकरा जाएगा।

यह शोध पत्र एक नए "ट्रेनिंग कैंप" के बारे में है जो एक ह्यूमनॉइड रोबोट (विशेष रूप से यूनिट्री जी1 - Unitree G1) को तेज़ दौड़ने, सीधा खड़े रहने और वास्तव में अपने मानव बॉस की बात सुनने के लिए सिखाता है जब उसे तेज़ होने, धीमा होने या किसी पेड़ से बचने के लिए कहा जाता है।

यह उनकी कहानी है कि उन्होंने इसे कैसे किया, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "सख्त कोच" (डायनेमिक रिटारगेटिंग)

आमतौर पर, जब वैज्ञानिक चाहते हैं कि एक रोबोट इंसान की चाल सीखे, तो वे बस इंसान के वीडियो को फ्रेम-दर-फ्रेम कॉपी करते हैं। इसे एक छात्र द्वारा शिक्षक की लिखावट को अक्षरों के ऊपर ट्रेस करके कॉपी करने जैसा समझें। यह ठीक दिखता है, लेकिन यदि रोबक अलग गति या अलग सतह पर दौड़ने की कोशिश करता है, तो वह ट्रेसिंग बिखर जाती है क्योंकि रोबोट का शरीर इंसान के शरीर से अलग होता है।

नवाचार: केवल ट्रेस करने के बजाय, लेखकों ने एक सख्त भौतिकी कोच (physics coach) की भूमिका निभाई। उन्होंने एक इंसान के दौड़ने का वीडियो लिया और उसे एक जटिल गणितीय सिमुलेशन (ऑप्टिमाइज़ेशन) से गुजारा जिसने पूछा: "क्या यह एक रोबोट के लिए शारीरिक रूप से संभव है?"

  • उपमा: कल्पना कीजिए कि आपके पास एक छोटे ओवन के लिए केक की रेसिपी है। यदि आप उसे एक विशाल औद्योगिक ओवन में पकाने की कोशिश करते हैं, तो वह जल जाएगा। "सख्त कोच" उस रेसिपी को विशेष रूप से विशाल ओवन के लिए फिर से लिखता है, तापमान और समय को समायोजित करता है ताकि केक हर बार एकदम सही बने।
  • परिणाम: उन्होंने दौड़ने की शैलियों का एक "लाइब्रेरी" बनाया। केवल एक कठोर वीडियो के बजाय, उनके पास निर्देशों का एक लचीला सेट है जिसे रोबोट बिना गिरे, उच्च गति पर भी, वास्तव में निष्पादित कर सकता है।

2. "स्मार्ट रिवॉर्ड सिस्टम" (कंट्रोल-गाइडेड आरएल)

एक बार जब रोबोट के पास "सख्त कोच" के निर्देश आ जाते हैं, तो उसे यह सीखने की आवश्यकता होती है कि उन निर्देशों का पालन कैसे किया जाए। यह रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करके किया जाता है, जो एक कुत्ते को ट्रीट (treats) देकर प्रशिक्षित करने जैसा है।

  • पुराना तरीका (मिमिक): रोबोट को तब इनाम मिलता है जब वह इंसान के वीडियो जैसा कुछ हद तक दिखता है। यह एक कुत्ते को यह कहने जैसा है, "अच्छा लड़का, तुम अपने पिछले पैरों पर खड़े हो!" भले ही वह डगमगा रहा हो और गिरने वाला हो।
  • नया तरीका (कंट्रोल-गाइडेड/सीएलएफ): लेखकों ने प्रशिक्षण में एक "सुरक्षा गार्ड" जोड़ा। उन्होंने केवल रोबोट को इंसान जैसा दिखने के लिए पुरस्कृत नहीं किया; उन्होंने उसे स्थिर रहने के लिए पुरस्कृत किया।
  • उपमा: कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं।
    • मिमिक: "बहुत अच्छे, पेडल मारो!" (भले ही वह टकराने ही वाला हो)।
    • कंट्रोल-गाइडेड: "बहुत अच्छे पेडल मारो, और अच्छा संतुलन बनाए रखो ताकि तुम गिरो नहीं!"
      यह "सुरक्षा गार्ड" (जो स्थिरता के लिए एक फैंसी गणितीय अवधारणा, कंट्रोल ल्यपुनोव फंक्शन्स पर आधारित है) यह सुनिश्चित करता है कि रोबोट तेज़ होने के साथ-साथ सुरक्षित रूप से दौड़ना सीखे।

3. "जीपीएस नेविगेटर" (ऑटोनॉमी स्टैक)

अंतिम परीक्षण यह था: क्या यह रोबोट वास्तविक दुनिया में अपने आप दौड़ सकता है?
उन्होंने दौड़ने वाले रोबोट को एक "मस्तिष्क" से जोड़ा जो बाधाओं को देख सकता था (लिडार/LiDAR का उपयोग करके, जैसे चमगादड़ का सोनार)।

  • उपमा: रोबोट के पैरों को एक रेस कार के इंजन (रनिंग कंट्रोलर) के रूप में और "मस्तिष्क" को ड्राइवर के रूप में सोचें। ड्राइवर इंजन को बताता है, "20 मील प्रति घंटे की गति से चलो," "बाएं मुड़ो," या "ब्रेक लगाओ!"
  • परिणाम: रोबमा सीधे रेखा में नहीं दौड़ा। वह सैकड़ों मीटर तक बाहर दौड़ा, वास्तविक समय में बाधाओं से बचा, और बिना गिरे दिशा भी बदली। उसने 3.3 मीटर प्रति सेकंड (लगभग 7.4 मील प्रति घंटा) की गति प्राप्त की, जो एक इंसान के लिए एक अच्छी जॉगिंग है।

यह क्यों मायने रखता है

इससे पहले, रोबोट या तो तेज़ दौड़ सकते थे लेकिन उन्हें नियंत्रित नहीं किया जा सकता था, या उन्हें नियंत्रित किया जा सकता था लेकिन वे धीमे, अनाड़ी ज़ोंबी की तरह चलते थे।

यह शोध पत्र उस अंतर को पाटता है। यह दिखाता है कि यदि आप:

  1. मानव डेटा को साफ़ (clean up) करते हैं ताकि वह रोबोट के लिए समझ में आए (सख्त कोच)।
  2. रोबोट को केवल कूल दिखने के लिए नहीं, बल्कि स्थिर रहने के लिए पुरस्कृत (reward) करते हैं (सुरक्षा गार्ड)।
  3. इसे एक नेविगेशन सिस्टम से जोड़ते (connect) हैं (जीपीएस)।

...तो आपको एक ऐसा रोबोट मिलता है जो इंसान की तरह दौड़ सकता है, निर्देशों को सुन सकता है, और बिना गिरे वास्तविक दुनिया के अव्यवस्थित वातावरण में नेविगेट कर सकता है। यह उन रोबोटों की ओर एक बड़ा कदम है जो केवल लैब में कूल दिखने के बजाय वास्तव में वास्तविक दुनिया में हमारी मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →