← नवीनतम पेपर
🤖 AI

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

ह्यूमनॉइड-जीपीटी (Humanoid-GPT) एक बिलियन-स्केल, जीपीटी-शैली का ट्रांसफॉर्मर है जिसे 2 बिलियन-फ्रेम के एकीकृत मोशन कॉर्पस पर प्रशिक्षित किया गया है, जो अभूतपूर्व ज़ीरो-शॉट सामान्यीकरण और अत्यधिक गतिशील होल-बॉडी व्यवहारों की सुदृढ़ ट्रैकिंग प्राप्त करता है, जो डेटा की कमी और चपलता-सामान्यीकरण ट्रेड-ऑफ से बाधित पूर्ववर्ती शैलो एमएलपी ट्रैकर्स से कहीं बेहतर है।

मूल लेखक: Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखाने की कोशिश कर रहे हैं। अतीत में, शोधकर्ता रोबोट को कुछ विशिष्ट डांस मूव्स दिखाकर उन्हें सिखाते थे और उम्मीद करते थे कि वे बाकी चीजें खुद समझ लेंगे। यह एक बच्चे को पूल में तैरना (float करना) दिखाकर समुद्र में तैरना सिखाने जैसा था; यदि आप उनसे समुद्र में तैरने के लिए कहते, तो वे घबरा जाते।

यह पेपर Humanoid-GPT पेश करता है, जो एक नया सिस्टम है जो खेल बदल देता है। रोबोट को कुछ मूव्स दिखाने के बजाय, उन्होंने इसे अरबों (billions) अलग-अलग गतिविधियाँ दिखाईं। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

1. "सब कुछ का पुस्तकालय" (डेटा स्केलिंग - Data Scaling)

पिछले रोबोट ट्रेनर्स को एक छोटी किताब की तरह समझें जिसमें 10,000 डांस मूव्स हों। Humanoid-GPT के रचनाकारों ने एक विशाल पुस्तकालय बनाया जिसमें 2 अरब मोशन क्लिप्स हैं।

  • मिश्रण (The Mix): उन्होंने केवल एक प्रकार का डांस नहीं इस्तेमाल किया। उन्होंने प्रसिद्ध मोशन-कैप्चर डेटासेट्स (जैसे पेशेवर नर्तकों का एक पुस्तकालय) को वास्तविक लोगों की अपनी रिकॉर्डिंग के साथ मिलाया।
  • सफाई (The Cleaning): उन्होंने उन चीजों को हटा दिया जो रोबोट नहीं कर सकता था (जैसे कुर्सी पर बैठना या तैरना) और रोबोट को अलग-अलग गति पर हिलना सिखाने के लिए गतिविधियों को तेज या धीमा किया।
  • परिणाम: रोबोट ने केवल "चलना" नहीं सीखा; उसने गति (movement) का अहसास सीखा।

2. "स्मार्ट ब्रेन" बनाम "सिंपल रिफ्लेक्स" (मॉडल स्ट्रक्चर - Model Structure)

पुराने रोबोट एक "उथले" दिमाग (जिसे MLP कहा जाता है) का उपयोग करते थे। इसकी कल्पना एक रिफ्लेक्स (प्रतिवर्त) के रूप में करें: यदि आप एक गेंद देखते हैं, तो आप उसे पकड़ लेते हैं। यह सरल चीजों के लिए अच्छा काम करता है, लेकिन अगर गेंद अजीब तरीके से फेंकी जाए या अगर रोबोट डांस करते हुए गेंद पकड़ रहा हो, तो वह भ्रमित हो जाता है।

Humanoid-GPT एक ट्रांसफॉर्मर (Transformer) का उपयोग करता है (वही प्रकार का AI दिमाग जो चैटबॉट्स में उपयोग किया जाता है)।

  • कॉज़ल अटेंशन (Causal Attention): यह कहने का एक तकनीकी तरीका है कि रोबोट अगले कदम को तय करने के लिए केवल इस बात पर ध्यान देता है कि अतीत में क्या हुआ था। वह भविष्य में झाँक नहीं सकता।
  • उपमा (The Analogy): यदि पुराना रोबोट एक रिफ्लेक्स था, तो Humanoid-GPT एक कोरियोग्राफर है। यह डांस के पिछले कुछ स्टेप्स को याद रखता है, लय (rhythm) को समझता है, और अगले कदम को सुचारू रूप से प्रेडिक्ट करता है, भले ही डांस जटिल हो या संगीत अचानक बदल जाए।

3. "मास्टर क्लास" ट्रेनिंग (डिस्टिलेशन - Distillation)

आप अरबों क्लिप्स को एक साथ एक ही दिमाग में नहीं डाल सकते; वह अभिभूत (overwhelmed) हो जाएगा। इसलिए, शोधकर्ताओं ने दो-चरणीय शिक्षण पद्धति का उपयोग किया:

  1. विशेषज्ञ (The Specialists): पहले, उन्होंने सैकड़ों "विशेषज्ञ" रोबोटों को प्रशिक्षित किया। प्रत्येक विशेषज्ञ ने मूव्स के एक विशिष्ट क्लस्टर को सीखा (जैसे, एक विशेषज्ञ ने केवल कूदना सीखा, दूसरे ने केवल घूमना सीखा)।
  2. सामान्यज्ञ (The Generalist): फिर, उन्होंने इन सभी विशेषज्ञों को एक ही, विशाल "मास्टर रोबोट" (Humanoid-GPT) को उन्हें देखकर सिखाया। मास्टर रोबोट ने इन सभी कौशलों को एक सुचारू दिमाग में संयोजित करना सीख लिया।

4. "जीरो-शॉट" जादू (Zero-Shot Magic)

सबसे प्रभावशाली हिस्सा जीरो-शॉट जनरलाइजेशन (Zero-Shot Generalization) है।

  • परीक्षण (The Test): उन्होंने रोबोट को ऐसे डांस मूव्स दिखाए जो उसने पहले कभी नहीं देखे थे (जैसे कोई विशिष्ट कुंग फू मूव या वीडियो से कोई जटिल डांस रूटीन)।
  • परिणाम: रोबोट को अभ्यास करने या फिर से प्रशिक्षित होने की आवश्यकता नहीं पड़ी। उसने बस इंसान को देखा और तुरंत उस मूव की सटीक नकल की।
  • क्यों? क्योंकि इसने केवल विशिष्ट मूव्स नहीं, बल्कि गति के सिद्धांतों को उस विशाल पुस्तकालय से सीखा था। यह एक ऐसे संगीतकार की तरह है जिसने वर्षों तक स्केल (scales) का अभ्यास किया है और वह तुरंत एक नया गाना बजा सकता है जिसे उसने पहले कभी नहीं सुना, न कि एक ऐसे रोबोट की तरह जो केवल एक विशिष्ट गाना जानता है।

5. वास्तविक दुनिया की गति (Real-World Speed)

आमतौर पर, बड़े AI दिमाग धीमे होते हैं। लेकिन टीम ने कोड को अनुकूलित किया ताकि Humanoid-GPT एक मानक कंप्यूटर कार्ड (GPU) पर 1.5 मिलीसेकंड से कम में चल सके।

  • उपमा (The Analogy): यह एक धीमी, भारी ट्रक को फॉर्मूला 1 कार में अपग्रेड करने जैसा है। भले ही कार विशाल और शक्तिशाली है, फिर भी यह बिना लैग के रियल-टाइम में चलाने के लिए पर्याप्त तेज़ है।

सारांश (Summary)

Humanoid-GPT साबित करता है कि रोबोटों के इंसानों की तरह हिलने-डुलने के लिए, आपको स्केल (Scale) की आवश्यकता होती है।

  • अधिक डेटा: गतिविधियों का एक विशाल पुस्तकालय।
  • स्मार्ट आर्किटेक्चर: एक ऐसा दिमाग जो संदर्भ (context) को याद रख सकता है और अतीत के आधार पर भविष्य की भविष्यवाणी कर सकता है।
  • बेहतर संतुलन: यह सुनिश्चित करना कि रोबोट गतिविधियों की एक विस्तृत विविधता सीखे, न कि केवल आसान वाली।

परिणामस्वरूप, एक ऐसा रोबोट मिलता है जो इंसान को नाचते, कूदते या बॉक्सिंग करते देख सकता है, और बिना कभी भी उस विशिष्ट ट्रिक को सीखे, तुरंत उनकी नकल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →