← नवीनतम पेपर
💻 computer science

DynaRetarget: Dynamically-Feasible Retargeting using Sampling-Based Trajectory Optimization

यह शोध पत्र DynaRetarget प्रस्तुत करता है, जो एक नवीन पाइपलाइन है जो मानव गतियों को सुदृढ़, गतिशील रूप से व्यवहार्य ह्यूमनॉइड नियंत्रण नीतियों में गतिशील रूप से परिष्कृत करने के लिए सैंपलिंग-आधारित प्रक्षेपवक्र अनुकूलन (SBTO) ढांचे का लाभ उठाती है, जिससे बड़े पैमाने पर सिंथेटिक लोको-मैनिपुलेशन डेटासेट का निर्माण सक्षम होता है।

मूल लेखक: Victor Dhedin, Ilyass Taouil, Shafeef Omar, Dian Yu, Kun Tao, Angela Dai, Majid Khadiv

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Victor Dhedin, Ilyass Taouil, Shafeef Omar, Dian Yu, Kun Tao, Angela Dai, Majid Khadiv

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली मानव नर्तक है जो लात मारने, उठाने और एक भारी बक्से को धकेलने वाले एक जटिल रूटीन को प्रदर्शित कर सकता है। अब, आप चाहते हैं कि एक अनाड़ी, भारी रोबोट उसकी नकल बिल्कुल वैसे ही करे।

समस्या यह है कि इंसान और रोबोट बहुत अलग तरह से बने होते हैं। यदि आप केवल रोबोट को मानव के जोड़ों के कोणों (जिसे "रिटारगेटिंग" कहा जाता है) की नकल करने के लिए कहते हैं, तो रोबोट उस पैर से बक्से को मारने की कोशिश कर सकता है जो वहां मौजूद ही नहीं है, या वह उस बक्से को उठाने की कोशिश कर सकता है जो उसकी विशिष्ट मोटर शक्ति के लिए बहुत भारी है। परिणाम एक "काइनेमैटिक" (kinematic) योजना होगी जो कागज पर तो सही दिखती है लेकिन उसे निष्पादित करना शारीरिक रूप से असंभव है—रोबोट गिर जाएगा, फिसल जाएगा, या टकरा जाएगा।

यह शोध पत्र DynaRetarget पेश करता है, जो इन टूटी हुई योजनाओं को ठीक करने और उन्हें वास्तविक, काम करने वाली रोबोटिक गतिविधियों में बदलने के लिए डिज़ाइन किया गया एक नया सिस्टम है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "खराब मानचित्र" (The "Bad Map")

शुरुआती रोबोट योजना को एक ऐसे व्यक्ति द्वारा बनाए गए मानचित्र के रूप में सोचें जिसने कभी इलाके को देखा ही न हो। यह रास्ता तो दिखाता है, लेकिन इसमें छेद हैं (लुप्त फुट कॉन्टैक्ट्स) या यह खाइयों की ओर ले जाता है (असंभव भौतिकी)। यदि कोई रोबोट इस मानचित्र का आँख मूंदकर पालन करने की कोशिश करता है, तो वह विफल हो जाता है।

पिछले तरीकों ने इस मानचित्र को छोटे चरणों में सुधारने की कोशिश की। कल्पना करें कि एक हाइकर (पगडंडी पर चलने वाला) केवल अपने पैरों के ठीक सामने की जमीन को देखता है। यदि मानचित्र कहता है "कूदें," तो हाइकर कूद जाता है। लेकिन यदि कूद बहुत लंबी है, तो वह गिर जाता है, और क्योंकि उसने केवल एक कदम आगे देखा था, वह अपना निर्णय बदलने के लिए पीछे नहीं जा सकता कि वह दौड़कर शुरुआत करे। वे "मायोपिक" (निकट दृष्टिदोष वाले/दूरदर्शी न होने वाले) हैं।

2. समाधान: "सीढ़ी चढ़ना" (The "Climbing Ladder" - SBTO)

लेखकों ने सैंपलिंग-बेस्ड ट्राजेक्टरी ऑप्टिमाइज़ेशन (SBTO) नामक एक नई विधि बनाई है।

केवल एक कदम देखने या पूरे 10 मिनट के नृत्य को एक साथ हल करने की कोशिश करने के बजाय (जो बहुत कठिन और भ्रमित करने वाला है), SBTO एक पर्वतारोही की तरह काम करता है जो एक समय में एक सीढ़ी का डंडा (rung) बनाता है:

  • चरण 1: यह नृत्य के पहले कुछ सेकंड को अनुकूलित (optimize) करता है।
  • चरण 2: एक बार जब पहले कुछ सेकंड ठोस हो जाते हैं, तो यह अगले कुछ सेकंड जोड़ता है, पहले भाग को एक स्थिर आधार के रूप में उपयोग करता है।
  • चरण 3: यह समय जोड़ना जारी रखता है, जैसे-जैसे वह आगे बढ़ता है, पूरे प्लान को परिष्कृत करता है।

यह एक लंबे वाक्य को पहले शब्द को पूर्ण करके, फिर पहले वाक्यांश को, और फिर पूरे वाक्य को पूर्ण करके ठीक करने जैसा है। जब तक यह नृत्य के अंत तक पहुँचता है, पूरी श्रृंखला भौतिक रूप से सुसंगत होती है। यह केवल अगले कदम को नहीं देखता; यह पूरे भविष्य को ध्यान में रखता है, यह सुनिश्चित करता है कि शुरुआत में की गई "लात" अंत में "लैंडिंग" के लिए एकदम सही तैयारी करती है।

3. परिणाम: एक "पॉलिश किया हुआ" प्रदर्शन

यह सिस्टम मानव-से-रोबोट की कच्ची, अपूर्ण नकल को सुचारू बनाता है।

  • यह भौतिकी को ठीक करता है: यदि रोबोट को जमीन को छूना चाहिए था लेकिन गणित ने कहा कि वह हवा में तैर रहा है, तो SBTO जोड़ों को इस तरह समायोजित करता है कि पैर वास्तव में फर्श से टकराए।
  • यह भारी वजन को संभालता है: इसने यह पता लगा लिया कि मूल मानव प्रदर्शन की तुलना में भारी या अलग आकार के बक्से को कैसे हिलाना है, इसके लिए इसे नए मानव के प्रदर्शन की आवश्यकता नहीं पड़ी।

4. प्रतिफल: रोबोट को सिखाना

एक बार जब DynaRetarget यह "परफेक्ट" भौतिक योजना बना लेता है, तो यह इसे एक रोबोट मस्तिष्क (Reinforcement Learning का उपयोग करके) को फीड करता है। क्योंकि योजना शारीरिक रूप से यथार्थवादी है, रोबोट का मस्तिष्क बहुत तेज़ी से सीखता है।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को गाड़ी चलाना सिखा रहे हैं। यदि आप उन्हें एक ऐसे मानचित्र के साथ भेजते हैं जिसमें एक पुल है जो अस्तित्व में ही नहीं है, तो वे दुर्घटनाग्रस्त हो जाएंगे और भ्रमित हो जाएंगे। यदि आप उन्हें एक वास्तविक सड़क का मानचित्र देते हैं, तो वे सुचारू रूप से और तेज़ी से गाड़ी चलाना सीखते हैं।
  • पेपर का दावा: लेखकों ने सैकड़ों अलग-अलग गतिविधियों (लात मारना, धकेलना, उठाना) पर इसका परीक्षण किया। उनकी विधि पिछले सर्वोत्तम तरीकों की तुलना में लगभग दोगुनी बार सफल रही। इसके अलावा, इन "परफेक्ट" योजनाओं पर प्रशिक्षित रोबोट वास्तविक दुनिया में कार्यों को करने में उन रोबोटों की तुलना में बहुत बेहतर प्रदर्शन करते हैं जिन्हें "रफ" (rough) योजनाओं पर प्रशिक्षित किया गया था।

सारांश

DynaRetarget एक पाइपलाइन है जो मानव के अव्यवकीय, अपूर्ण मोशन डेटा को लेती है, भौतिकी को ठीक करने के लिए एक स्मार्ट, चरण-दर-चरण अनुकूलन सीढ़ी का उपयोग करती है, और एक ह्यूमनॉइड रोबोट के लिए एक त्रुटिहीन, वास्तविक दुनिया के लिए तैयार निर्देश मैनुअल तैयार करती है। यह "अल्पदर्शी" नियोजन की समस्या को हल करता है और रोबोटों को जटिल, संपर्क-प्रधान कार्यों (जैसे गेंद को किक करना या शेल्फ को धकेलना) को उच्च सफलता दर के साथ सीखने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →