← नवीनतम पेपर
💻 computer science

Partial Motion Imitation for Learning Cart Pushing with Legged Manipulators

यह शोध पत्र एक आंशिक इमिटेशन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो कार्ट धकेलने (cart pushing) के लिए लेग्ड रोबोट्स में एक सुदृढ़ लोकोमोशन पॉलिसी को स्थानांतरित करता है, जिससे केवल निचले शरीर की गतियों की नकल करने के लिए एक लोको-मैनिप्युलेशन पॉलिसी को प्रशिक्षित किया जाता है, जिससे विविध भूभागों और सिम्युलेटर्स में स्थिर और सटीक मोबाइल मैनिपुलेशन प्राप्त होता है।

मूल लेखक: Mili Das, Morgan Byrd, Donghoon Baek, Sehoon Ha

प्रकाशित 2026-03-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mili Das, Morgan Byrd, Donghoon Baek, Sehoon Ha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक चार पैरों वाला रोबोट कुत्ता है जो एक हाथ (arm) भी है। आपका लक्ष्य इस रोबोट को एक गलियारे में शॉपिंग कार्ट को एक विशिष्ट घुमावदार रास्ते पर धकेलना सिखाना है, बिना अपने ही पैरों में उलझे या कार्ट के हैंडल को छोड़े।

यह एक कठिन काम है। यदि रोबोट धकेलने पर बहुत अधिक ध्यान केंद्रित करता है, तो वह लड़खड़ा सकता है। यदि वह चलने पर बहुत अधिक ध्यान केंद्रित करता है, तो वह कार्ट गिरा सकता है। यह शोध पत्र उन्हें एक साथ ये दोनों काम करने का एक चतुर नया तरीका प्रस्तुत करता है।

यहाँ उनके समाधान का विवरण दिया गया है, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

समस्या: "बहुत सारे रसोइयों" की दुविधा (The "Too Many Cooks" Dilemma)

आमतौर पर, जब इंजीनियर रोबोट को नए करतब सिखाते हैं, तो वे एक विधि का उपयोग करते हैं जिसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है। इसे एक कुत्ते को इनाम (treats) देकर प्रशिक्षित करने की तरह समझें। आप रोबोट को कहते हैं, "अगर तुम कार्ट को धकेलो तो बहुत अच्छे," और "अगर तुम गिर जाओ तो बुरा काम।"

लेकिन एक रोबोट के लिए जिसे चलना और धकेलना दोनों करना है, यह एक कुत्ते को रस्सी पर चलते हुए करतब दिखाने (juggling) की तरह है। यदि आप इसे केवल सामान्य निर्देश देते हैं, तो यह भ्रमित हो जाता है। यह चलना सीख सकता है, लेकिन यह कार्ट गिरा देगा। या यह धकेलना सीख सकता है, लेकिन यह एक नशे में धुत पेंगुइन की तरह चलेगा और गिर जाएगा।

समाधान: "आंशिक नकल" की ट्रिक (The "Partial Imitation" Trick)

लेखकों ने महसूस किया कि चलना और धकेलना वास्तव में दो अलग-अलग कौशल हैं जिन्हें एक ही समय में होना चाहिए। रोबोट को शुरू से सब कुछ सिखाने के बजाय, उन्होंने एक दो-चरणीय "नकल करने वाली" रणनीति का उपयोग किया।

चरण 1: चलने का उस्ताद (The Walking Master)
सबसे पहले, उन्होंने रोबोट को केवल चलना सिखाया। उन्होंने उसे फिसलन भरे फर्श, ऊबड़-खाबड़ जमीन और यादृच्छिक बाधाओं वाले एक आभासी जिम में डाल दिया। रोबोट ने पूरी तरह से चलना सीखा, जिससे उसने एक सुचारू और स्थिर "चाल" (gait) विकसित की।

  • उदाहरण: इसे एक पेशेवर डांसर को प्रशिक्षित करने के रूप में सोचें। वे मंच पर सही संतुलन, फुटवर्क और लय सीखते हैं।

चरण 2: "निचले शरीर" का भूत (The "Lower-Body" Ghost)
इसके बाद, वे चाहते थे कि रोबोट कार्ट को धकेले। रोबोट को एक साथ चलना और धकेलना सिखाने के बजाय, उन्होंने उसे बताया: "तुम्हें फिर से चलने की ज़रूरत नहीं है। बस चरण 1 में सीखे गए 'डांसिंग मास्टर' के फुटवर्क की नकल करो। लेकिन तुम्हारे हाथ? तुम्हारे हाथ स्वतंत्र हैं कि वे कार्ट को धकेलने के लिए जो भी आवश्यक हो, कर सकें।"

उन्होंने "पार्शियल एडवर्सैरियल मोशन प्रायर" (Partial Adversarial Motion Prior) नामक एक विशेष AI टूल का उपयोग किया।

  • उदाहरण: कल्पना करें कि रोबोट ने चलने वाले उस्ताद का एक "भूतिया सूट" (ghost suit) पहना हुआ है। यह भूतिया सूट रोबोट के पैरों को ठीक उसी तरह चलाने के लिए मजबूर करता है जैसे उस्ताद के पैर चलते हैं। हालाँकि, रोबोट के हाथ यह सूट नहीं पहने हुए हैं। हाथ स्वतंत्र हैं कि वे आगे बढ़ें, कार्ट हैंडल को पकड़ें और धकेलें। रोबोट को संतुलन की चिंता करने की ज़रूरत नहीं है; "भूतिया पैर" संतुलन संभाल लेते हैं। रोबोट बस धकेलने पर ध्यान केंद्रित करता है।

यह अन्य तरीकों से बेहतर क्यों है?

इस शोध पत्र ने तीन अन्य तरीकों के विरुद्ध इसका परीक्षण किया:

  1. "कोई मदद नहीं" विधि (The "No Help" Method): बिना किसी नकल के रोबोट को केवल धकेलने और चलने के लिए कहना।
    • परिणाम: रोबोट ने धकेलना सीख लिया, लेकिन वह एक नशे में धुत पेंगूइन की तरह चला। जब उन्होंने इसे एक अलग सिमुलेशन (एक अलग "दुनिया") में आजमाया, तो वह तुरंत गिर गया।
  2. "पूर्ण नकल" विधि (The "Full Copy" Method): रोबोट को उस्ताद के हर काम की नकल करने के लिए कहना, जिसमें हाथ भी शामिल हैं।
    • परिणाम: यह बहुत सख्त था। रोबोट के हाथों को उस्ताद की स्थिति में बिल्कुल वैसे ही रहने के लिए मजबूर किया गया, जिसका अर्थ था कि वह कार्ट हैंडल तक ठीक से नहीं पहुँच सका। यह वैसा ही था जैसे अपने हाथों को बगल में चिपकाकर करतब दिखाने की कोशिश करना।
  3. "पदानुक्रमित" विधि (The "Hierarchical" Method): चलने के लिए एक मस्तिष्क और धकेलने के लिए एक अलग मस्तिष्क का उपयोग करना, लेकिन वे आपस में ठीक से संवाद नहीं करते।
    • परिणाम: यह ठीक था, लेकिन जब रोबोट फिसला, तो चलने वाले मस्तिष्क को धकेलने वाले मस्तिष्क को कैसे समायोजित करना है, यह पता नहीं चला। यह ऐसा था जैसे ड्राइवर और नेविगेटर एक ही रेडियो चैनल पर न हों।

विजेता: "आंशिक नकल" विधि (केवल पैरों के लिए भूतिया सूट) सबसे अच्छी रही। रोबोट ने एक पेशेवर डांसर की स्थिरता के साथ चला लेकिन कार्ट को सुचारू रूप से धकेलने के लिए अपने मुक्त हाथों का उपयोग किया।

परिणाम

उन्होंने दो अलग-अलग वीडियो गेम इंजन (IsaacLab और MuJoCo) में इसका परीक्षण किया।

  • प्रशिक्षण की दुनिया में: रोबोट ने घुमावदार रास्तों पर कार्ट को पूरी तरह से धकेला।
  • नई दुनिया में (Sim-to-Sim transfer): जब उन्होंने रोबोट को पूरी तरह से अलग भौतिकी इंजन (जैसे किसी वीडियो गेम चरित्र को Mario से Grand Theft Auto में ले जाना) में स्थानांतरित किया, तो अन्य तरीके विफल हो गए और वे गिर पड़े। "आंशिक नकल" वाला रोबोट लगातार चलता रहा और कार्ट को धकेलता रहा, जिससे साबित हुआ कि उसने एक मजबूत कौशल सीखा है, न कि केवल एक छोटा सा करतब।

निष्कर्ष (The Bottom Line)

यह शोध पत्र दिखाता है कि यदि आप चाहते हैं कि कोई रोबोट एक साथ दो कठिन काम करे (चलना और धकेलना), तो उसे शुरू से सब कुछ सिखाने की कोशिश न करें। इसके बजाय, उसे एक चीज़ पूरी तरह से सिखाएं (चलना), और फिर उसे नई चीज़ (धकेलना) सीखने के दौरान उस कौशल को "उधार" लेने दें।

यह एक भारी बॉक्स उठाने वाले पेशेवर Walker (चलने वाले) को काम पर रखने जैसा है। आप Walker को बॉक्स कैसे उठाना है यह नहीं सिखाते; आप बस उन्हें अपना बेहतरीन चलना जारी रखने देते हैं जबकि वे यह समझने की कोशिश करते हैं कि बॉक्स को कैसे पकड़ना है। परिणाम एक स्थिर, कुशल और सफल डिलीवरी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →