← नवीनतम पेपर
💻 computer science

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking

GenTrack एक ऑनलाइन जनरेटर-ट्रैकर फ्रेमवर्क पेश करता है जो प्रभावी रूप से किनेमैटिक रूप से प्रशंसनीय और रोबोट-निष्पादनीय गतियों के बीच के अंतर को कम करने के लिए निष्पादन-आधारित गति निर्माण और ट्रैकर प्रशिक्षण के बीच बारी-बारी से कार्य करता है, जिससे बिना किसी अतिरिक्त डेटा संग्रह के विविध और आउट-ऑफ-डिस्ट्रीब्यूशन संदर्भों में श्रेष्ठ ज़ीरो-शॉट ह्यूमनॉइड ट्रैकिंग प्राप्त की जा सकती है।

मूल लेखक: Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखाने की कोशिश कर रहे हैं। आपके पास इसे करने के दो मुख्य तरीके हैं। पहला तरीका है एक मानव नर्तक (human dancer) को रिकॉर्ड करना, उनके मूव्स को रोबोट पर कॉपी करना, और यह उम्मीद करना कि रोबोट के पैर और जोड़ वास्तव में उन स्टेप्स को संभाल सकें। समस्या यह है कि इंसान और रोबोट अलग तरह से बने होते हैं; एक मूव जो इंसान पर सहज दिखता है, वह रोबोट को लड़खड़ा सकता है, गिरा सकता है, या उसके जोड़ को तोड़ सकता है। दूसरा तरीका यह है कि एक कंप्यूटर प्रोग्राम को टेक्स्ट विवरणों का उपयोग करके शून्य से नए डांस मूव्स बनाने दें, जैसे कि "एक स्पिनिंग जंप करो।" लेकिन यदि कंप्यूटर ने केवल मानव डेटा से सीखा है, तो वह ऐसे मूव्स बना सकता है जो स्क्रीन पर तो शानदार दिखते हैं, लेकिन एक रोबट के लिए शारीरिक रूप से असंभव होते हैं।

एक रोबोट के लिए वास्तव में उपयोगी होने के लिए, उसे केवल एक विवरण पढ़कर तुरंत नए करतब सीखने में सक्षम होना चाहिए, बिना किसी इंसान द्वारा हर एक मूव का भौतिक प्रदर्शन किए। इसे "जीरो-शॉट" (zero-shot) लर्निंग कहा जाता है। बड़ी चुनौती "रोबोट को क्या करना चाहिए" (योजना) और "रोबोट वास्तव में क्या कर सकता है" (भौतिकी/physics) के बीच के अंतर को पाटने की है। यदि योजना बहुत कठिन है, तो रोबोट क्रैश हो जाएगा। यदि योजना बहुत आसान है, तो वह कुछ भी नया नहीं सीख पाएगा। वैज्ञानिक लगातार ऐसे डांस मूव्स जेनरेट करने की कोशिश कर रहे हैं जो रचनात्मक भी हों और रोबोट के लिए निष्पादित करने हेतु शारीरिक रूप से सुरक्षित भी हों।

यहीं पर GenTrack नामक एक नई विधि काम आती है। GenTrack को एक हाई-टेक डांस स्टूडियो के रूप में समझें जहाँ दो बहुत अलग रोबोट एक निरंतर लूप में एक-दूसरे से सीख रहे हैं। एक तरफ, आपके पास एक जेनरेटर (Generator) है, जो एक रचनात्मक AI है जो टेक्स्ट प्रॉम्प्ट के आधार पर नए डांस मूव्स बनाता है। दूसरी ओर, एक ट्रैकर (Tracker) है, जो एक कुशल रोबोट है जो उन मूव्स को एक सिमुलेशन में भौतिक रूप से करने की कोशिश करता है।

पुराने तरीके में, ये दोनों अलग-अलग काम करते थे। जेनरेटर मानव डेटा के आधार पर मूव्स बनाता था, और ट्रैकर उनका पालन करने की कोशिश करता था। यदि ट्रैकर विफल हो जाता, तो जेनरेटर को यह पता नहीं चलता कि वह क्यों विफल हुआ, और ट्रैकर बस खराब निर्देशों का पालन करने की कोशिश करता रहता। यह एक ऐसे डांस इंस्ट्रक्टर की तरह था जो अपने छात्र का अभ्यास कभी नहीं देखता; वे बस नए मूव्स चिल्लाते रहते हैं बिना यह समझे कि छात्र अपने ही पैरों से लड़खड़ा रहा है।

GenTrack इस खेल को बदल देता है क्योंकि यह उन्हें वास्तविक समय में एक टीम के रूप में साथ मिलकर सीखने में सक्षम बनाता है। यह लूप इस प्रकार काम करता है:

  1. जेनरेटर एक टेक्स्ट प्रॉम्प्ट के आधार पर एक नया डांस मूव बनाता है।
  2. ट्रैकर एक वास्तविक रोबोट (विशेष रूप से, Unitree G1 रोबोट) पर उस मूव को करने की कोशिश करता है (सिमुलेशन में)।
  3. फीडबैक: यदि ट्रैकर लड़खड़ाता है, फिसलता है, या गिर जाता है, तो वह जेनरेटर को एक सिग्नल भेजता है। यह एक छात्र की तरह है जो कहता है, "अरे, वह स्पिन मेरे पैरों के लिए बहुत तेज़ था!"
  4. अपडेट: जेनरेटर इस फीडबैक को सुनता है और अपने भविष्य के मूव्स को रोबोट के अनुकूल बनाने के लिए उनमें बदलाव करता है। साथ ही, ट्रैकर इन नए, थोड़े आसान (लेकिन फिर भी चुनौतीपूर्ण) मूव्स से सीखता है, जिससे वह उन निर्देशों का पालन करने में बेहतर बनता है जिन्हें उसने पहले कभी नहीं देखा है।

शोधकर्ताओं ने इस प्रणाली का परीक्षण करने के लिए ट्रैकर के दो अलग-अलग "मस्तिष्क" (जिन्हें ProtoMotions और SONIC कहा जाता है) का उपयोग किया और पाया कि यह आगे-पीछे की लर्निंग अद्भुत काम करती है। उनके सिमुलेशन में, GenTrack सिस्टम ने पहले की तुलना में बहुत अधिक विविध डांस मूव्स को सफलतापूर्वक फॉलो करने वाले रोबोट तैयार किए। उदाहरण के लिए, SONIC मस्तिष्क के साथ, कठिन, अनदेखे मूव्स को फॉलो करने की रोबोट की सफलता दर लगभग 85% से बढ़कर 90% हो गई, और निर्धारित पथ के साथ मिलान करने की त्रुटियां काफी कम हो गईं।

महत्वपूर्ण रूप से, यह पेपर दो अन्य सामान्य दृष्टिकोणों के विरुद्ध तर्क देता है। पहला, केवल पहले से बने मूव्स की एक निश्चित सूची का पुन: उपयोग करना (static replay) उतना अच्छा काम नहीं करता क्योंकि मूव्स रोबोट के बेहतर होने के साथ अनुकूलित नहीं होते हैं। दूसरा, केवल एक स्थिर (frozen) रोबोट ब्रेन के माध्यम से मूव्स को फ़िल्टर करना (one-way filtering) कारण बनता है कि जेनरेटर केवल सबसे आसान मूव्स बनाता है जिन्हें रोबोट पहले से ही कर सकता है, जिससे रचनात्मकता और विविधता कम हो जाती है। GenTrack इन जालों से बचता है क्योंकि यह जेनरेटर और ट्रैकर दोनों को एक साथ विकसित होने देता है।

परिणाम दिखाते हैं कि यह "ऑनलाइन को-ट्रेनिंग" (online co-training) रोबोट को यह समझने में मदद करती है कि कागज पर अच्छा दिखने वाले मूव और वास्तव में निष्पादनीय मूव के बीच क्या अंतर है। जेनरेटर ने सीखा कि रोबोट के लिए शारीरिक रूप से व्यवहार्य (physically plausible) मूव कैसे बनाए जाएं, जबकि ट्रैकर ने व्यापक और नए निर्देशों को संभालने के लिए खुद को बेहतर बनाया। हालांकि यह अध्ययन सिमुलेशन में किया गया था, इसके निष्कर्ष बताते हैं कि यह सहयोगात्मक लूप रोबोट को लाखों घंटों के महंगे, वास्तविक दुनिया के मानव प्रदर्शनों के बिना नए कौशल सिखाने का एक शक्तिशाली तरीका है। यह उन रोबोटों की ओर एक कदम है जो वास्तव में किसी भी धुन पर नाचने के लिए सच में सीख सकते हैं, न कि केवल उन्हीं पर जिन्हें उन्हें शुरुआत में सिखाया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →