← नवीनतम पेपर
💻 computer science

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

यह शोध पत्र एक पुनरावृत्ति क्लोज्ड-लूप फ्रेमवर्क प्रस्तावित करता है जो स्वचालित रूप से उच्च-गुणवत्ता वाला, विविध मोशन डेटा उत्पन्न करता है और कार्य की कठिनाई को क्रमिक रूप से बढ़ाता है, जिससे ह्यूमनॉइड कंट्रोल पॉलिसीज़ काफी कम प्रशिक्षण डेटा के साथ बेसलाइन्स से काफी बेहतर प्रदर्शन करने में सक्षम होती हैं।

मूल लेखक: Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

प्रकाशित 2026-03-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डांस करना, लड़ना या जिम्नास्टिक्स करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप ऐसा करने के लिए उसे इंसानों द्वारा ये चीजें करते हुए हजारों वीडियो दिखाते हैं। लेकिन इस दृष्टिकोण के साथ दो बड़ी समस्याएं हैं:

  1. "ईज़ी मोड" का जाल (The "Easy Mode" Trap): हमारे पास मौजूद अधिकांश वीडियो लोगों के चलने, हाथ हिलाने या साधारण दैनिक कार्य करने के होते हैं। रोबोट इनमें बहुत अच्छा हो जाता है, लेकिन जब आप उसे बैकफ्लिप या जटिल मार्शल आर्ट्स किक करने के लिए कहते हैं, तो वह गिर जाता है क्योंकि उसने अपने प्रशिक्षण में वे मूव्स कभी देखे ही नहीं थे।
  2. "महंगे कोच" की समस्या (The "Expensive Coach" Problem): विशेषज्ञों द्वारा किए जाने वाले शानदार, उच्च-कठिनाई वाले मूव्स के वीडियो प्राप्त करने के लिए, आपको महंगे मोशन-कैप्चर सूट और पेशेवर स्टूडियो की आवश्यकता होती है। आप ऐसे लाखों घंटे की रिकॉर्डिंग नहीं कर सकते; इसमें बहुत अधिक पैसा और समय खर्च होता है।

समाधान: एक स्व-सुधार करने वाला "वीडियो गेम" लूप

इस पेपर के लेखकों ने CLAIMS बनाया है, जो एक ऐसे सिस्टम की तरह काम करता है जैसे कि एक वीडियो गेम जहाँ रोबोट और गेम का लेवल दोनों एक साथ विकसित होते हैं।

यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) का उपयोग करते हैं:

1. रोबोट (खिलाड़ी)

रोबोट को एक वीडियो गेम के पात्र के रूप में सोचें। उसका काम एक विशिष्ट मूवमेंट की हुबहू नकल करना है।

2. एआई डायरेक्टर (गेम डिज़ाइनर)

नए मूव्स की शूटिंग करने के लिए किसी इंसान के बजाय, टीम एक एआई "डायरेक्टर" (एक मोशन जनरेशन मॉडल) का उपयोग करती है। यह डायरेक्टर टेक्स्ट विवरण (जैसे "हाई स्पीड पर एक ट्रिपल पिरुएट") को पढ़कर नए डांस मूव्स, मार्शल आर्ट्स कॉम्बो या जिम्नास्टिक्स रूटीन का आविष्कार कर सकता है।

3. "कोच" (फीडबैक लूप)

यही सबसे जादुई हिस्सा है। सिस्टम एक लूप में चलता है:

  • स्टेप 1: डायरेक्टर एक नया, थोड़ा कठिन मूव जेनरेट करता है।
  • स्टेप 2: रोबोट उसकी नकल करने की कोशिश करता है।
  • स्टेप 3: एक "कोच" (एक स्मार्ट एआई जो वीडियो देख और समझ सकता है) रोबोट को देखता है। वह पूछता है: "क्या रोबोट गिर गया? क्या मूव बहुत आसान था? क्या यह विवरण के अनुरूप लग रहा था?"
  • स्टेप 4: कोच की रिपोर्ट के आधार पर, डायरेक्टर को एक नया निर्देश मिलता है: "रोबोट ने आसान जंप में महारत हासिल कर ली है। अब, एक ऐसा मूव जेनरेट करें जो 20% कठिन हो और जिसमें स्पिन (घूमना) शामिल हो।"

4. परिणाम: एक "लेवल-अप" सिस्टम

ठीक वैसे ही जैसे एक वीडियो गेम में जहाँ आप एक लेवल जीतते हैं और अगला लेवल कठिन हो जाता है, यह सिस्टम रोबोट को लगातार आगे धकेलता रहता है।

  • इटरेशन 1: रोबोट चलना और साधारण टर्न लेना सीखता है।
  • इटरेशन 2: सिस्टम को एहसास होता है कि वह इसमें अच्छा है, इसलिए वह कठिन मूव्स (जैसे कार्टव्हील) जेनरेट करता है।
  • इटरेशन 3: रोबोट कार्टव्हील में महारत हासिल कर लेता है, इसलिए सिस्टम "ट्विस्ट के साथ बैकफ्लिप" जेनरेट करता है।

क्योंकि यह सिस्टम स्वचालित रूप से अपने स्वयं के "कठिन लेवल्स" बनाता है, इसे महंगे मानव कोचों या पहले से रिकॉर्ड किए गए वीडियो के विशाल पुस्तकालयों की आवश्यकता नहीं होती है। यह अपना स्वयं का प्रशिक्षण पाठ्यक्रम (curriculum) बनाता है।

उन्होंने क्या हासिल किया?

टीम ने इसे शून्य से सीखने की कोशिश कर रहे एक रोबोट पर टेस्ट किया।

  • दक्षता (Efficiency): उन्होंने सामान्य डेटासेट्स (जैसे AMASS) की तुलना में केवल 1/10वें डेटा आकार का उपयोग किया।
  • प्रदर्शन (Performance): अपने "गेम" के अंत तक, पारंपरिक तरीकों पर प्रशिक्षित रोबोट की तुलना में, उनके सिस्टम ने कठिन, पेशेवर मूव्स (जैसे कुंग फू या जटिल डांस) पर 45% कम बार विफलता दर्ज की।
  • बहुमुखी प्रतिभा (Versatility): उन्होंने दिखाया कि यह मार्शल आर्ट्स, डांस, कॉम्बैट, स्पोर्ट्स और जिम्नास्टिक्स सहित कई प्रकार के कठिन मूव्स के लिए काम करता है।

निचोड़ (The Bottom Line)

किसी लाइब्रेरी में हर संभव कठिन मूव को खोजने के बजाय (जो असंभव और महंगा है), यह पेपर एक सेल्फ-ड्राइविंग ट्रेनिंग लूप का प्रस्ताव करता है। यह उन कठिन मूव्स को बनाता है जिन्हें सीखने की रोबोट को ज़रूरत है, रोबोट का परीक्षण करता है, और फिर तुरंत और भी कठिन मूव्स बनाता है जो उसने अभी-अभी सीखा है। यह एक तरीका है जिससे आप एक रोबोट को पेशेवर एथलीट बनने के लिए सिखा सकते हैं, बिना स्टेडियम में मौजूद मानव विशेषज्ञों के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →