← नवीनतम पेपर
💻 computer science

No More Marching: Learning Humanoid Locomotion for Short-Range SE(2) Targets

यह शोध पत्र एक नवीन कॉन्स्टलेशन-आधारित रिवॉर्ड फंक्शन के साथ एक सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण प्रस्तुत करता है जो मानवोइड्स को कुशलतापूर्वक और मजबूती से अल्प-दूरी के SE(2) लक्ष्य पोज तक पहुँचने में सक्षम बनाता है, जो सिमुलेशन और वास्तविक हार्डवेयर दोनों में पारंपरिक वेग-ट्रैकिंग विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Pranay Dugar, Mohitvishnu S. Gadde, Jonah Siekmann, Yesh Godse, Aayam Shrestha, Alan Fern

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pranay Dugar, Mohitvishnu S. Gadde, Jonah Siekmann, Yesh Godse, Aayam Shrestha, Alan Fern

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। लंबे समय तक, रोबोट को चलना सिखाने का सबसे अच्छा तरीका यह था कि उन्हें कहें, "1 मीटर प्रति सेकंड की गति से आगे बढ़ें।" यह तब बहुत अच्छा काम करता है जब रोबोट को एक पूरे मैदान को पार करने की आवश्यकता हो। लेकिन क्या होगा यदि रोबोट को कॉफी का कप उठाने के लिए बस दो कदम बाईं ओर लेने की आवश्यकता हो?

यदि आप रोबोट को "आगे बढ़ें" कहते हैं जब उसे केवल कुछ इंच चलने की आवश्यकता होती है, तो वह कुछ अजीब सा करने लगता है: वह एक ही जगह पर मार्च करता है, रुकता है, टैंक की तरह घूमता है, फिर से मार्च करता है और रुक जाता है। यह अक्षम है, भद्दा है, और बहुत अधिक ऊर्जा बर्बाद करता है। यह एक कार को पार्क करने की कोशिश करने जैसा है जहाँ आप आगे बढ़ते हैं, रुकते हैं, स्टीयरिंग को 90 डिग्री घुमाते हैं, पीछे की ओर चलते हैं, और ऐसा तब तक दोहराते हैं जब तक कि आप सही जगह पर फिट न हो जाएं।

यह पेपर मानव सदृश रोबोटों (जैसे "Digit" रोबोट) को कम दूरी कुशलतापूर्वक चलना सिखाने का एक नया तरीका पेश करता है। उन्हें मार्च करने के आदेश देने के बजाय, शोधकर्ताओं ने रोबोट को एक विशिष्ट स्थान और कोण (angle) को निशाना बनाना सिखाया, ठीक वैसे ही जैसे एक इंसान कुर्सी की ओर चलते समय करता है।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "मार्च करने वाला" रोबोट

अधिकांश रोबोट को गति कमांड (जैसे कार का क्रूज कंट्रोल) का पालन करने के लिए प्रशिक्षित किया जाता है। जब आप उनसे किसी पास के स्थान पर जाने के लिए कहते हैं, तो उन्हें स्मूथ तरीके से रुकना या मुड़ना नहीं आता। वे बस तब तक "मार्च" करते रहते हैं जब तक कि वे लक्ष्य से आगे न निकल जाएं, फिर उन्हें पीछे हटना और मुड़ना पड़ता है।

  • उपमा: एक परेड में खड़े सैनिक की कल्पना करें। यदि आप उन्हें 3 फीट दूर एक स्थान पर जाने के लिए कहते हैं, तो वे शायद तीन बड़े, लयबद्ध कदम उठाएंगे, लक्ष्य से आगे निकल जाएंगे, और फिर अजीब तरह से मुड़ने की कोशिश करेंगे। यह कठोर और अप्राकृतिक है।

2. समाधान: "कॉन्स्टलेशन" (Constellation) रिवॉर्ड

शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (पुरस्कार के साथ परीक्षण और त्रुटि/trial and error) नामक तकनीक का उपयोग किया। असली जादू यह था कि उन्होंने उस "रिवॉर्ड" (पुरस्कार) को कैसे डिजाइन किया जो रोबोट को अच्छा काम करने के लिए मिलता है।

आमतौर पर, आप एक रोबोट को सही स्थिति (position) के लिए पुरस्कार दे सकते हैं और अलग से सही दिशा (direction) के लिए पुरस्कार दे सकते हैं। लेकिन शोधकर्ताओं ने पाया कि इन दोनों के बीच संतुलन बनाना कार चलाते समय रेडियो ट्यून करने जैसा है; यह बहुत जटिल है और इससे बुरी आदतें विकसित होती हैं।

इसके बजाय, उन्होंने कॉन्स्टलेशन रिवॉर्ड का आविष्कार किया।

  • उपमा: कल्पना कीजिए कि रोबोट के चारों ओर चमकते हुए, अदृश्य "हेलो" (halo) के बिंदुओं का एक समूह (जैसे सितारों का एक नक्षत्र या कॉन्स्टलेशन) तैर रहा है। लक्ष्य का भी एक समान "हेलो" है।
  • यह कैसे काम करता है: रोबोट को केवल आगे बढ़ने या केवल मुड़ने के लिए पुरस्कार नहीं मिलता है। उसे इस आधार पर पुरस्कार मिलता है कि उसका "हेलो" लक्ष्य के "हेलो" से कितनी अच्छी तरह मेल खाता है।
    • यदि रोबोट बहुत दूर है, तो बिंदु मेल नहीं खाते।
    • यदि वह गलत दिशा में देख रहा है, तो बिंदु मेल नहीं खाते।
    • यदि वह सही स्थान पर है लेकिन गलत दिशा में देख रहा है, तो भी बिंदु मेल नहीं खाते।

यह रोबोट को अपने पैरों को इस तरह चलाने के लिए मजबूर करता है कि बिंदु पूरी तरह से मिल सकें। यह स्वाभाविक रूप से उसे चलते समय ही मुड़ना सिखाता है, न कि रुककर मुड़ना। यह एक डांसर की तरह है जो किसी मुद्रा (pose) तक पहुँचने के लिए अपने पैरों और शरीर को एक साथ घुमाता है, न कि पहले एक जगह रुककर फिर घूमने की तरह।

3. परिणाम: "GoTo" कंट्रोलर

उन्होंने इस नई पद्धति का उपयोग करके Digit नामक रोबोट को प्रशिक्षित किया।

  • सिमुलेशन में (वीडियो गेम): रोबोट ने पुराने "मार्चिंग" तरीकों की तुलना में आधे समय में, आधी ऊर्जा का उपयोग करके और कम कदमों में लक्ष्यों तक पहुँचना सीख लिया। यह बहुत सहज और मानव जैसा दिखता था।
  • वास्तविक दुनिया में: उन्होंने इस कोड को एक वास्तविक रोबोट पर लगाया। भले ही फर्श फिसलन भरा हो और सेंसर शोर (noisy) पैदा कर रहे हों, रोबोट वीडियो गेम की तरह ही लगभग उतना ही अच्छा काम करता रहा। वह सफलतापूर्वक लक्ष्यों तक पहुँचा, मुड़ा और बिना गिरे या बिना उस अजीब "मार्च-टर्न-मार्च" वाले नृत्य के रुका।

यह क्यों महत्वपूर्ण है

यह पेपर एक व्यावहारिक समस्या का समाधान करता है। वास्तविक दुनिया के रोबोट (गोदामों, घरों या कारखानों में) को शायद ही कभी एक पूरे मैदान को पार करने की आवश्यकता होती है। उन्हें ज्यादातर बस एक डिब्बा उठाने के लिए कुछ फीट खिसकने, मुड़ने और उसे रखने की आवश्यकता होती है।

"चलते रहो" के बजाय "कॉन्स्टलेशन को मैच करो" के माध्यम से रिवॉर्ड बदलकर, रोबोट ने चपलता (agility) सीखी। उसने मार्च करने वाले सैनिक की तरह व्यवहार करना बंद कर दिया और एक ऐसे व्यक्ति की तरह व्यवहार करना शुरू कर दिया जो बस कुशलता से फ्रिज तक पहुँचना चाहता है।

संक्षेप में: उन्होंने रोबोट को मार्च करना सिखाना बंद किया और उन्हें निशाना लगाना सिखाया, जिसके परिणामस्वरूप एक ऐसा रोबोट मिला जो मानव की तरह स्वाभाविक और कुशल गति से चलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →