← नवीनतम पेपर
🤖 AI

LadderMan: Learning Humanoid Perceptive Ladder Climbing

यह शोधपत्र लैडरमैन (LadderMan) प्रस्तुत करता है, जो एक एकीकृत प्रणाली है जो दो-चरणीय शिक्षण पाइपलाइन, सिम-टू-रियल ट्रांसफर के लिए विजन फाउंडेशन मॉडल्स और एक ड्यूल-एजेंट मैनिपुलेशन पॉलिसी का लाभ उठाकर ह्युमनॉइड रोबोट्स को वास्तविक दुनिया के वातावरण में विविध सीढ़ियों पर मजबूती से चढ़ने और मैनिपुलेशन करने में सक्षम बनाती है।

मूल लेखक: Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सीढ़ी चढ़ना सिखा रहे हैं। यह सुनने में सरल लगता है, लेकिन एक मानव जैसे शरीर वाले रोबोट के लिए (दो हाथ, दो पैर, एक धड़), यह रस्सी पर चलने और साथ ही जग्लिंग करने जैसा है। एक गलत चाल, धारणा (perception) में एक छोटी सी चूक, या पकड़ का गलत अनुमान, और सब कुछ धराशायी हो सकता है।

यह शोध पत्र LadderMan को पेश करता है, जो एक नया सिस्टम है जो एक ह्यूमनाइड रोबोट (विशेष रूप से एक Unitree G1) को हर तरह की सीढ़ियाँ चढ़ना और यहाँ तक कि एक सीढ़ी पर लटककर कार्य करना भी सिखाता है, जैसे कि लाइट बल्ब बदलना या पेंटिंग को ठीक करना।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "एक संदर्भ" वाली ट्रिक (डांस इंस्ट्रक्टर)

आमतौर पर, एक रोबोट को अलग-अलग सीढ़ियों पर चढ़ना सिखाने के लिए, आपको हर संभव सीढ़ी के प्रकार के लिए हजारों वीडियो की आवश्यकता होगी। यह एकत्र करना असंभव है।

  • समाधान: टीम ने हाइब्रिड मोशन ट्रैकिंग (Hybrid Motion Tracking) नामक एक तकनीक का उपयोग किया। कल्पना कीजिए कि एक डांस इंस्ट्रक्टर एक विशिष्ट सीढ़ी पर रोबोट को एक आदर्श डांस रूटीन दिखा रहा है।
  • ट्विस्ट: रोबोट को उस डांस की हुबहू नकल करने के लिए मजबूर करने के बजाय, उन्होंने रोबोट से कहा: "पैरों की मूवमेंट (footwork) को पूरी तरह से कॉपी करो (क्योंकि वही सबसे कठिन हिस्सा है), लेकिन अपने हाथों को अपनी जरूरत के अनुसार वैसे ही घुमाओ जिससे वह सीढ़ी में फिट हो सकें।"
  • परिणाम: केवल उस एक संदर्भ वीडियो से, रोबोट ने विभिन्न सीढ़ी कोणों और डंडों (rung) की दूरी के लिए विशेषज्ञ चढ़ने की शैलियों की एक "लाइब्रेरी" बनाना सीख लिया।

2. "डिस्टिलेशन" (मास्टर शेफ)

अब रोबोट के पास विशेषज्ञों की एक लाइब्रेरी है, लेकिन उसे वास्तविक दुनिया में दिखने वाली किसी भी सीढ़ी को संभालने के लिए एक एकल मस्तिष्क की आवश्यकता है।

  • समाधान: उन्होंने इमिटेशन लर्निंग (Imitation Learning - नकल सीखना) और रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - प्रयास और त्रुटि) के मिश्रण का उपयोग किया।
  • उपमा: इसे एक कुकिंग क्लास की तरह समझें। पहले, रोबोट मास्टर शेफ की रेसिपी की हूबहू नकल करता है। फिर, रोबोट को प्रयोग करने और स्वाद चखने (trial and error) की अनुमति दी जाती है ताकि वह यह पता लगा सके कि यदि सामग्री (सीढ़ी) थोड़ी अलग भी हो, तो भी व्यंजन कैसे बनाया जाए। यह एक "यूनिफाइड पॉलिसी" (Unified Policy) बनाता है जो आश्चर्यजनक स्थितियों को संभालने के लिए पर्याप्त मजबूत है।

3. "नकली बनाम असली" के अंतर को पाटना (विज़न फ़िल्टर)

रोबोट आमतौर पर वीडियो गेम सिमुलेशन में प्रशिक्षित होते हैं। लेकिन एक वास्तविक सीढ़ी, सिमुलेशन वाली सीढ़ी से अलग दिखती है (प्रकाश, सेंसर शोर, अजीब कोण)। यदि रोबोट उस डंडे को पकड़ने की कोशिश करता है जिसे वह वहां मौजूद समझता है लेकिन वास्तव में वहां नहीं है, तो वह गिर जाता है।

  • समस्या: इस समस्या को ठीक करने के लिए मानक "रैंडम नॉइज़" ट्रिक्स पतली, छड़ी जैसी सीढ़ी के डंडों के लिए पर्याप्त प्रभावी नहीं थे।
  • समाधान: उन्होंने एक विज़न फाउंडेशन मॉडल (VFM) का उपयोग किया। इसे एक सुपर-स्मार्ट AI फ़िल्टर के रूप में समझें। रोबोट को कच्चा, अव्यवस्थित कैमरा फीड दिखाने के बजाय, VFM इसे साफ करता है और पृष्ठभूमि के शोर को हटाकर सीढ़ी के डंडों को स्पष्ट रूप से उभार देता है।
  • परिणाम: रोबोट अपने कैमरे से वास्तविक दुनिया की सीढ़ी को देख सकता है और उसे लगभग वैसा ही देखता है जैसा वह सिमुलेशन में देखता है, जिससे वह बिना दोबारा प्रशिक्षण के वास्तविक दुनिया में चढ़ने में सक्षम होता है। इसे जीरो-शॉट सिम-टू-रियल ट्रांसफर (Zero-Shot Sim-to-Real Transfer) कहा जाता है।

4. कार्यों के लिए "दो-मस्तिष्क" प्रणाली (टाइटरोप वॉकर)

एक बार जब रोबोट सीढ़ी पर चढ़ जाता है, तो वह लाइट बल्ब कैसे बदलता है बिना गिरे?

  • समस्या: यदि आप रोबोट को बल्ब पकड़ने के लिए अपना हाथ चलाने के लिए कहते हैं, तो उसका पूरा शरीर डगमगा सकता है और वह पलट सकता है।
  • समाधान: उन्होंने एक डुअल-एजेंट (Dual-Agent) दृष्टिकोण का उपयोग किया। कल्पना कीजिए कि रोबोट के दो मस्तिष्क मिलकर काम कर रहे हैं:
    • मस्तिष्क A (पैर): इसका एकमात्र काम रोबोट को संतुलित रखना और सीढ़ी से चिपके रहना है। यह हाथों की गतिविधियों की परवाह नहीं करता।
    • मस्तिष्क B (हाथ): इसका एकमात्र काम मानव ऑपरेटर द्वारा VR के माध्यम से किए जा रहे निर्देशों के आधार पर वस्तु (जैसे पेंटिंग या बॉक्स) तक पहुँचना है।
  • परिणाम: पैर स्थिर रहते हैं जबकि हाथ स्वतंत्र रूप से कार्य करते हैं। यह रोबोट को सीढ़ी पर लटकते हुए नाजुक कार्य करने की अनुमति देता है, जो सामान्य रोबोट कंट्रोलर्स आमतौर पर करने में विफल रहते हैं।

उन्होंने वास्तव में क्या हासिल किया

  • वास्तविक दुनिया में सफलता: उन्होंने इसे वास्तविक रोबोट और वास्तविक सीढ़ियों (लकड़ी, धातु, विभिन्न कोणों) पर परखा। रोबोट बिना किसी अतिरिक्त सेंसर या हार्डवेयर संशोधन के सफलतापूर्वक ऊपर और नीचे चढ़ा।
  • गति: रोबोट लगभग 3.4 सेकंड प्रति रंंग (rung) की गति से चढ़ा, जो लगभग एक इंसान (3.2 सेकंड प्रति रंंग) के बराबर है।
  • बहुमुखी प्रतिभा: यह उन सीढ़ियों पर भी काम कर गया जिन्हें उसने पहले कभी नहीं देखा था, जिनमें अलग-अलग डंडों की दूरी और कोण शामिल थे।
  • मैनिपुलेशन (वस्तु संचालन): इसने सीढ़ी पर खड़े होकर पेंटिंग को ठीक करने, लाइट बल्ब बदलने और एक बॉक्स को सौंपने का कार्य सफलतापूर्वक किया।

उन्होंने क्या नहीं किया (सीमाएं)

  • उन्होंने अभी तक इसे लंबवत (vertical) सीढ़ियों (दीवार के सीधे ऊपर) पर चढ़ना नहीं सिखाया है; यह केवल 75 डिग्री तक की झुकी हुई सीढ़ियों पर काम करता है।
  • रोबोट के पास अभी तक "डेक्सट्रस" (मानव जैसे) उंगलियां नहीं हैं, इसलिए वह गांठ बांधने जैसे सूक्ष्म मोटर कार्यों को नहीं कर सकता, लेकिन वह वस्तुओं को पकड़ और हिला सकता है।

संक्षेप में, LadderMan एक ऐसा सिस्टम है जो एक उदाहरण से सीखकर, वास्तविक दुनिया को संभालने के लिए अपनी दृष्टि को साफ करके, और संतुलन और क्रिया मोड में अपने मस्तिष्क को विभाजित करके एक रोबोट को सीढ़ियाँ चढ़ना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →