Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary
यह शोध पत्र Humanoid-LLA को प्रस्तुत करता है, जो एक बड़ा भाषा क्रिया मॉडल (large language action model) है जो एक एकीकृत गति शब्दावली (unified motion vocabulary), एक डिस्टिल्ड कंट्रोलर (distilled controller) और भौतिकी-आधारित सुदृढीकरण शिक्षण (physics-informed reinforcement learning) को एकीकृत करके मानव रूपी रोबोटों को मुक्त-रूप भाषा कमांड से शारीरिक रूप से व्यवहार्य और विविध संपूर्ण-शरीर की गतियां निष्पादित करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखाना चाहते हैं। अतीत में, आपको एक रोबोट प्रोग्रामर होना पड़ता था, जो रोबोट को यह बताने के लिए हज़ारों लाइनों का कोड लिखता कि उसे अपना बायां पैर कैसे हिलाना है, फिर अपना दाहिना हाथ कैसे हिलाना है, इत्यादि। यदि आप केवल कहते, "एक डिस्को किंग की तरह नाचो," तो रोबोट या तो गिर जाता या बस भ्रमित होकर खड़ा रहता।
यह पेपर Humanoid-LLA पेश करता है, जो एक नया सिस्टम है जो एक सुपर-स्मार्ट ट्रांसलेटर और कोरियोग्राफर की तरह काम करता है। यह आपको एक ह्यूमनॉइड रोबोट से सामान्य, सहज अंग्रेजी में बात करने की अनुमति देता है (जैसे "एक घुमावदार आठ के आकार में चलो" या "एक दोस्त की तरह हाथ मिलाओ"), और रोबोट बिना गिरे बिल्कुल समझ जाता है कि उसे क्या करना है।
यह कैसे काम करता है, इसे रोजमर्रा के उपमाओं (analogies) का उपयोग करके तीन सरल भागों में विभाजित किया गया है:
1. सार्वभौमिक शब्दकोश (यूनिफाइड मोशन वोकैबुलरी - Unified Motion Vocabulary)
समस्या: इंसान और रोबोट अलग-अलग तरह से बने होते हैं। यदि आप किसी इंसान को "लहराने" (wave) के लिए कहते हैं, तो वह अपने कंधे और कोहनी का उपयोग करता है। यदि आप एक रोबोट को "लहराने" के लिए कहते हैं, तो उसे मोटर एंगल्स की गणना करनी पड़ती है। आमतौर पर, कंप्यूटर मानव गतिविधियों को सीधे रोबोट की गतिविधियों में अनुवाद करने की कोशिश करते हैं, लेकिन यह एक गोल छेद में चौकोर खूँटा फिट करने जैसा है—रोबोट अजीब तरह से या गलत तरीके से हिलता है।
समाधान: शोधकर्ताओं ने एक यूनिवर्सल मोशन डिक्शनरी बनाई।
- उपमा: एक ऐसे शब्दकोश की कल्पना करें जहाँ शब्द "कूदना" (Jump) का अर्थ "मानव पैर" या "रोबोट मोटर" नहीं है। इसके बजाय, इसका अर्थ एक विशिष्ट, अमूर्त "जंप टोकन" (Jump Token) है।
- यह कैसे काम करता है: उन्होंने मनुष्यों के हिलने-डुलने के हज़ारों वीडियो और रोबोट्स के हिलने-डुलने के हज़ारों वीडियो लिए। उन्होंने दोनों को इन अमूर्त टोकन्स की एक ही "भाषा" बोलने के लिए मजबूर किया। अब, जब रोबोट "Jump" के टोकन को देखता है, तो वह जानता है कि उस कूद को प्राप्त करने के लिए उसके शरीर को कैसे हिलना चाहिए, ठीक वैसे ही जैसे एक इंसान जानता है कि उसके शरीर को कैसे हिलना चाहिए। यह मानव शैली और रोबोट भौतिकी (physics) के बीच के अंतर को पाटता है।
2. रिहर्सल कोच (वोकैबुलरी-डायरेक्टेड डिस्टिलेशन - Vocabulary-Directed Distillation)
समस्या: भले ही रोबोट के पास शब्दकोश हो, लेकिन उसे यह नहीं पता हो सकता कि बिना लड़खड़ाए वह चाल कैसे चले। एक गिर जाने वाला रोबोट बेकार है, चाहे उसने आपके शब्दों को कितनी भी अच्छी तरह समझा हो।
समाधान: उन्होंने एक "टीचर" (शिक्षक) रोबोट और एक "स्टूडेंट" (छात्र) रोबोट को प्रशिक्षित किया।
- उपमा: एक टीचर के बारे में सोचें जो एक मास्टर जिम्नास्ट है (लेकिन केवल एक परफेक्ट, सुरक्षित वीडियो गेम सिमुलेशन में)। टीचर जानता है कि संतुलन बनाए रखने के लिए कैसे हिलना है। फिर, वे एक स्टूडेंट (असली रोबोट) को टीचर की नकल करने के लिए प्रशिक्षित करते हैं, लेकिन एक ट्विस्ट के साथ: स्टूडेंट को टीचर की पूरी, जटिल दिनचर्या देखने की अनुमति नहीं है। स्टूडेंट केवल यूनिवर्सल डिक्शनरी टोकन्स (जैसे, "कदम", "मुड़ना", "संतुलन") देख सकता है।
- यह कैसे काम करता है: स्टूडेंट उन सरल टोकन्स को जटिल, संतुलित शारीरिक गतिविधियों में बदलना सीखता है। यह सुनिश्चित करता है कि जब असली रोबोट को निर्देश मिलते हैं, तो वह केवल अनुमान नहीं लगाता; वह ऐसी गतिविधियाँ करता है जो शारीरिक रूप से संभव हैं और जिससे वह क्रैश नहीं होगा।
3. क्रिएटिव डायरेक्टर (लार्ज लैंग्वेज एक्शन मॉडल - The Large Language Action Model)
समस्या: आप चाहते हैं कि रोबोट केवल "आगे चलो" जैसे सरल आदेशों के बजाय जटिल, रचनात्मक चीजें करे।
समाधान: उन्होंने एक "दिमाग" (एक लार्ज लैंग्वेज मॉडल) बनाया है जो एक क्रिएटिव डायरेक्टर के रूप में कार्य करता है।
- उपमा: कल्पना कीजिए कि आप निर्देशक को स्क्रिप्ट देते हैं: "परेड में मार्च करता हुआ एक सैनिक।" निर्देशक केवल "पैर हिलाओ" नहीं कहता। वह इसे तोड़ता है: "पहले, सीधे खड़े हो जाओ। फिर, अपने दाहिने हाथ को ऊपर की ओर झुलाओ। फिर, सख्त घुटने के साथ मार्च करो।"
- यह कैसे काम करता है:
- सोचना (Thinking): AI आपके कमांड को पढ़ता है और बड़े विचार को छोटे, तार्किक चरणों में तोड़ने के लिए "चेन ऑफ थॉट" (Chain of Thought) के माध्यम से जोर से सोचता है।
- बोलना (Speaking): यह उन चरणों को स्टेप 1 के यूनिवर्सल मोशन टोकन्स में अनुवादित करता है।
- प्रशिक्षण (Training): उन्होंने केवल AI को अनुमान लगाने के लिए नहीं छोड़ा। उन्होंने एक "रिवॉर्ड सिस्टम" (जैसे वीडियो गेम स्कोर) का उपयोग किया। यदि AI टोकन्स का ऐसा क्रम बनाता है जिससे सिमुलेशन में रोबोट गिर जाता है, तो उसे कम स्कोर मिलता है। यदि यह रोबोट को सुचारू रूप से और स्वाभाविक रूप से चलाता है, तो इसे उच्च स्कोर मिलता है। यह AI को रचनात्मक होने के साथ-साथ शारीरिक रूप से सुरक्षित होने के लिए प्रशिक्षित करता है।
यह एक बड़ी बात क्यों है?
- कोई "रोबोट भाषा" नहीं: आपको इंजीनियर होने की आवश्यकता नहीं है। आप बस स्वाभाविक रूप से रोबोट से बात कर सकते हैं।
- यह गिरता नहीं है: पिछले तरीकों के विपरीत जो फिल्मों में अच्छे लगते थे लेकिन वास्तविक जीवन में विफल हो जाते थे, यह सिस्टम भौतिकी (physics) पर प्रशिक्षित है। यह जानता है कि "डांस की तरह दिखने" और "बिना पैर तोड़े वास्तव में डांस करने में सक्षम होने" के बीच क्या अंतर है।
- वास्तविक दुनिया का प्रमाण: उन्होंने वास्तविक दुनिया में वास्तविक रोबोट्स (Unitree G1 और Booster T1) पर इसका परीक्षण किया, और रोबोटों ने सरल वाक्यों के आधार पर मार्च करने, गले लगाने और ट्रैफिक निर्देशित करने जैसे जटिल कार्यों को सफलतापूर्वक पूरा किया।
संक्षेप में: Humanoid-LLA वह लापता कड़ी है जो एक रोबोट को एक क्लम्बी मशीन से बदलकर एक मददगार साथी में बदल देती है जिसे आपकी बातें समझ आती हैं और जो गरिमा के साथ चलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।