← नवीनतम पेपर
💻 computer science

Direct Dynamic Retargeting for Humanoid Imitation Learning from Videos

यह शोध पत्र डायरेक्ट डायनेमिक रिटारगेटिंग (DDR) को प्रस्तुत करता है, जो एक नवीन सिंगल-स्टेज फ्रेमवर्क है जो पारंपरिक पाइपलाइनों के ज्यामितीय पूर्वाग्रहों (geometric biases) को दरकिनार करते हुए, मोनोकुलर वीडियो से सीधे उच्च-निष्ठा वाले, गतिशील रूप से व्यवहार्य ह्यूमनॉइड प्रक्षेप पथ (humanoid trajectories) उत्पन्न करता है, जिससे अनुकरण सटीकता में सुधार होता है और सुदृढीकरण लर्निंग (reinforcement learning) अभिसरण में तेजी आती है।

मूल लेखक: Constant Roux, Ludovic De Matteïs, Armand Jordana, Valentin Guillet, Nicolas Mansard, Olivier Stasse, Philippe Souères

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Constant Roux, Ludovic De Matteïs, Armand Jordana, Valentin Guillet, Nicolas Mansard, Olivier Stasse, Philippe Souères

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को नृत्य करना या मार्शल आर्ट्स करना सिखाना चाहते हैं। इसका सबसे आसान तरीका यह है कि आप उसे किसी इंसान द्वारा की जा रही गतिविधि का वीडियो दिखाएं। लेकिन यहाँ एक समस्या है: इंसान और रोबोट बहुत अलग तरह से बने होते हैं। एक इंसान में लचीली रीढ़ और कोमल जोड़ होते हैं; एक रोबोट धातु की कठोर छड़ों और मोटरों से बना होता है। यदि आप बस रोबोट को कहते हैं, "इंसान की बांह की स्थिति की ठीक से नकल करो," तो रोबोट अपने धातु के शरीर को इस तरह मोड़ने की कोशिश कर सकता है जिससे वह टूट जाए, गिर जाए, या ऐसा कुछ कर दे जो वह कर ही न सके क्योंकि उसके मोटर इतने शक्तिशाली नहीं हैं।

यह पेपर एक नई विधि पेश करता है जिसे डायरेक्ट डायनेमिक रिटारगेटिंग (DDR) कहा जाता है ताकि इस "अनुवाद" की समस्या को हल किया जा सके। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

समस्या: "खराब अनुवादक" (The Bad Translator)

वर्तमान में, अधिकांश रोबोट वीडियो से सीखने के लिए दो-चरणीय प्रक्रिया का उपयोग करते हैं, जिसकी तुलना लेखक एक ऐसे अनुवादक से करते हैं जो वाक्य के बीच में ही अटक जाता है।

  1. चरण 1 (ज्यामिति चरण - The Geometry Step): पहले, सिस्टम मानव वीडियो को देखता है और पूछता है, "मानव के हाथ और पैर की स्थिति से मेल खाने के लिए रोबोट के पास सबसे करीबी कौन सी मुद्रा (pose) संभव है?" यह इस बात की अनदेखी करता है कि क्या रोबोट वास्तव में उस मुद्रा में संतुलन बना पाएगा। यह वैसा ही है जैसे किसी इंसान को एक भारी बॉक्स पकड़े हुए एक पैर पर खड़े होने के लिए कहना, लेकिन केवल यह देखना कि उनके पैरों का आकार सही है या नहीं, यह नहीं कि वे गिर जाएंगे या नहीं।
  2. चरण 2 (भौतिकी चरण - The Physics Step): फिर, एक दूसरा सिस्टम पहले चरण को ठीक करने की कोशिश करता है। यह उस "लगभग सही" मुद्रा को लेता है और कंप्यूटर सिमुलेशन के भीतर इसे भौतिक रूप से संभव बनाने का प्रयास करता है।

दोष: लेखकों का तर्क है कि पहला चरण एक "पूर्वाग्रह" (bias) पैदा करता है। क्योंकि रोबोट को पहले चरण में एक विशिष्ट आकार में रहने के लिए मजबूर किया गया था, दूसरा चरण फंस जाता है। यह सबसे अच्छा तरीका नहीं खोज सकता क्योंकि यह उस आकार को ठीक करने में फंसा हुआ है जो पहले से ही गलत था। यह बिल्कुल वैसा ही है जैसे आप एक पूर्ण वृत्त (circle) बनाने की कोशिश कर रहे हों, लेकिन आपने एक वर्गाकार रूपरेखा (square outline) से शुरुआत की हो; आप किनारों को कितना भी चिकना करने की कोशिश करें, वह कभी भी वास्तविक वृत्त नहीं बन पाएगा।

समाधान: "प्रत्यक्ष वास्तुकार" (The Direct Architect)

लेखकों की नई विधि, DDR, बीच के व्यक्ति (middleman) को पूरी तरह से हटा देती है।

"मानव की मुद्रा के सबसे करीब रोबोट की मुद्रा क्या है?" पूछने और फिर उसे ठीक करने के बजाय, DDR एक अलग प्रश्न पूछता है: "रोबोट के हिलने का सबसे अच्छा तरीका क्या है जो इंसान जैसा दिखे, लेकिन साथ ही भौतिकी के नियमों का पालन भी करे?"

  • उपमा (The Analogy): कल्पना कीजिए कि आप एक पुल बनाने की कोशिश कर रहेกัน एक प्रसिद्ध सस्पेंशन ब्रिज (suspension bridge) की तरह जो अलग सामग्रियों (पत्थर के बजाय स्टील) का उपयोग करता है।
    • पुरानी विधि: आप पत्थर के पुल के आकार की हुबहू नकल करते हैं, फिर उसे स्टील से मजबूत करने की कोशिश करते हैं। यह डगमगाता हुआ या असंभव सपोर्ट की आवश्यकता वाला हो सकता है।
    • DDR विधि: आप पत्थर के पुल के कार्य (कि वह अंतर को कैसे पाटता है) को देखते हैं और स्टील से एक नया पुल डिजाइन करते हैं जो वही परिणाम प्राप्त करता है लेकिन स्टील के लिए पूरी तरह स्थिर है। आप स्टील को पत्थर जैसा दिखने के लिए मजबूर नहीं करते; आप स्टील के भौतिक विज्ञान को डिजाइन को निर्देशित करने देते हैं जबकि समग्र लुक को बनाए रखते हैं।

व्यवहार में यह कैसे काम करता है

सिस्टम एक भौतिकी सिम्युलेटर के भीतर एक "स्मार्ट गेसर" (sampling-based solver) का उपयोग करता है। यह केवल एक पथ की गणना नहीं करता है; यह हजारों अलग-अलग तरीकों को आज़माता है जिनसे रोबोट हिल सकता है। यह उन रास्तों को चुनता है जो:

  1. वीडियो में दिख रहे इंसान की तरह दिखते हैं।
  2. गिरते नहीं हैं।
  3. रोबोट की मोटरों को तोड़ते नहीं हैं।
  4. रोबोट के पैरों को जमीन पर मजबूती से टिकाए रखते हैं (फिसलना नहीं)।

परिणाम

टीम ने एक वास्तविक रोबोट (Unitree H1-2) पर इसका परीक्षण किया और पुराने तरीकों से तुलना की।

  • कम गिरना: पुराने तरीके अक्सर ऐसे निर्देश उत्पन्न करते थे जिससे रोबोट गिर जाता या उसके पैर फिसल जाते। DDR ने ऐसे निर्देश दिए जो 99% समय भौतिक रूप से सुरक्षित थे।
  • बेहतर सटीकता: क्योंकि DDR एक "खराब" शुरुआती आकार को ठीक करने में फंसा नहीं था, इसलिए रोबोट मानव की गतिविधियों को अधिक बारीकी से ट्रैक कर सका।
  • तेजी से सीखना: जब उन्होंने इन नए निर्देशों का उपयोग करके रोबोट को प्रशिक्षित करने के लिए आर्टिफिशियल इंटेलिजेंस (Reinforcement Learning) का उपयोग किया, तो रोबोट ने पुराने निर्देशों की तुलना में बहुत तेजी से सीखा और बेहतर प्रदर्शन किया।
  • वास्तविक दुनिया में सफलता: उन्होंने वास्तविक दुनिया में "पिस्तौल स्क्वाट" (एक पैर पर झुककर खड़ा होना) और "कुंग फू" मुद्रा जैसे जटिल मूव्स को सफलतापूर्वक प्रदर्शित किया, जिसके लिए प्रत्येक विशिष्ट मूव के लिए कोड को मैन्युअल रूप से बदलने की आवश्यकता नहीं पड़ी।

सारांश

संक्षेप में, यह पेपर कहता है: रोबोट को इंसान के आकार की हूबहू नकल करने के लिए मजबूर करना बंद करें, और फिर बाद में भौतिकी को ठीक करने की कोशिश न करें। इसके बजाय, रोबोट को शुरू से ही गतिशील रूप से (dynamically) हिलना सीखने दें, जिसमें मानव वीडियो का उपयोग केवल सामान्य लुक के लिए एक मार्गदर्शक के रूप में किया जाए। इसके परिणामस्वरूप रोबोट अधिक सुरक्षित, अधिक सटीक और तेजी से सीखने वाले बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →