ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video
ZeroWBC एक नवीन ढांचा है जो मानव एगोसेंट्रिक (egocentric) वीडियो से सीधे विसुओमोटर (visuomotor) नीतियों को सीखकर ह्युमनॉइड रोबोटों के लिए स्वाभाविक, बहुमुखी पूर्ण-शरीर नियंत्रण को सक्षम बनाता है, जिससे महंगे और समय लेने वाले टेलीऑपरेशन डेटा संग्रह की आवश्यकता समाप्त हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह व्यवहार करना सिखाना चाहते हैं। पारंपरिक रूप से, यह एक बच्चे को साइकिल चलाना सिखाने जैसा था, जिसमें उनके सिर पर कैमरा लगाकर उनके हर डगमगाहट को रिकॉर्ड किया जाता था और फिर घंटों तक रोबोट के हाथ-पैर को उस रिकॉर्डिंग से मिलाने के लिए मैन्युअल रूप से हिलाया जाता था। यह महंगा है, धीमा है, और अक्सर रोबोट एक सख्त, अजीब कठपुतली की तरह हिलता-डुलता है।
ZeroWBC इसे करने का एक नया, स्मार्ट तरीका है। इसे एक "दो-चरणीय नृत्य पाठ" (two-step dance lesson) के रूप में सोचें जो एक रोबोट को केवल वीडियो में इंसानों को देखकर स्वाभाविक रूप से हिलना-डुलना सिखाता है, बिना इसके कि एक बार भी किसी इंसान को रोबोट को शारीरिक रूप से नियंत्रित करने की आवश्यकता हो।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: "टेलीऑपरेशन" (Teleoperation) की बाधा
आमतौर पर, रोबोट को सोफे पर बैठने या गेंद को किक मारने के लिए सिखाने हेतु, इंजीनियरों को एक विशेष सूट पहनना पड़ता है और प्रदर्शन करने के लिए रोबोट के जोड़ों को शारीरिक रूप से हिलाना पड़ता है। इसे टेलीऑपरेशन कहा जाता है।
- उपमा: यह एक नई भाषा सीखने के समान है जहाँ एक शिक्षक आपके कान में हर शब्द फुसफुसाता है जबकि आप उसे लिख रहे होते हैं। यह धीमा, थकाऊ है, और आप केवल वही सीख सकते हैं जो शिक्षक दिखाने का समय निकाल पाता है।
- परिणाम: रोबots के पास गतिविधियों की एक बहुत छोटी शब्दावली होती है और वे नई स्थितियों (जैसे दूसरे कमरे में रखे सोफे) के अनुकूल होने में संघर्ष करते हैं।
2. समाधान: ZeroWBC (द "ह्यूमन वीडियो" अप्रोच)
लेखकों ने महसूस किया कि इंसानों ने पहले से ही अरबों घंटों के वीडियो रिकॉर्ड किए हैं जिनमें हमें वही करते हुए दिखाया गया है जो हम रोबोट से करवाना चाहते हैं: चलना, बैठना, किक मारना और बाधाओं से बचना। ZeroWBC इन वीडियो का उपयोग महंगे रोबोट प्रदर्शनों के बजाय करता है।
यह सिस्टम दो चरणों में काम करता है, जैसे एक निर्देशक (director) और एक स्टंट डबल (stunt double):
चरण 1: "कल्पनाशील निर्देशक" (Multimodal Motion Generation)
सबसे पहले, रोबोट को यह समझना होगा कि क्या करना है।
- यह कैसे काम करता है: आप रोबोट को एक टेक्स्ट कमांड देते हैं (जैसे, "गेंद को किक मारो") और उसकी अपनी आँखों से मिलने वाला एक लाइव वीडियो फीड (वह क्या देख रहा है)।
- जादू: रोबोट एक सुपर-स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग करता है जिसे लाखों मानव वीडियो पर प्रशिक्षित किया गया है। यह एक फिल्म निर्देशक की तरह कार्य करता है। जब आप कहते हैं "गेंद को किक मारो," तो निर्देशक केवल पैरों के बारे में नहीं सोचता; वह पूरे शरीर की कल्पना करता है: दौड़ना, स्विंग करना, फॉलो-थ्रू करना, और यह भी कि आँखें गेंद को कैसे ट्रैक करती हैं।
- आउटपुट: निर्देशक अभी रोबोट को मांसपेशियों के निर्देश नहीं देता। इसके बजाय, वह मानव गतिविधियों का एक "स्क्रिप्ट" (गति टोकन का एक क्रम) लिखता है।
चरण 2: "स्टंट डबल" (General Motion Tracking)
अब रोबोट को वह गति वास्तव में करनी होगी।
- यह कैसे काम करता है: रोबोट निर्देशक से प्राप्त "स्क्रिप्ट" लेता है और उसकी नकल करने की कोशिश करता है।
- जादू: यहीं पर जनरल मोशन ट्रैकिंग आती है। एक अत्यधिक कुशल स्टंट डबल की कल्पना करें जिसने हजारों अलग-अलग डांस मूव्स, मार्शल आर्ट्स और चालों का अभ्यास किया है। यह स्टंट डबल इतना अच्छा है कि निर्देशक चाहे जो भी कहे, वह उसकी सटीक नकल कर सकता है।
- प्रशिक्षण: इस स्टंट डबल को एक "करिकुलम" (जैसे स्कूल) का उपयोग करके प्रशिक्षित किया गया था। इसने आसान कार्यों (चलना) से शुरुआत की, फिर मध्यम कार्यों (दौड़ना) पर बढ़ी, और अंत में कठिन कार्यों (नाचना या लुढ़कना) पर पहुँची। यह सुनिश्चित करता है कि रोबोट अभिभूत न हो जाए और स्थिर रहना सीख सके।
3. यह एक बड़ी बात क्यों है?
- "रोबोट टेलीऑपरेशन" का अंत: आपको रोबोट को सिखाने के लिए किसी इंसान को शारीरिक रूप से रोबोट के अंगों को हिलाने की आवश्यकता नहीं है। आपको बस एक कैमरा और एक घूमता हुआ इंसान चाहिए।
- स्वाभाविक गति: क्योंकि रोबोट मानव वीडियो से सीखता है, इसलिए वह एक मशीन की तरह नहीं, बल्कि इंसान की तरह चलता है। वह जानता है कि मुड़ते समय कैसे झुकना है या बैठते समय वजन कैसे बदलना है।
- जीरो-शॉट लर्निंग (The "Magic" Trick): पेपर दिखाता है कि रोबोट ऐसी चीजें भी करता है जिनके लिए उसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था।
- उदाहरण: रोबोट को सोफे पर बैठने के वीडियो पर प्रशिक्षित किया गया था। उसे कभी कुर्सी के बारे में नहीं दिखाया गया। लेकिन "कुर्सी पर बैठो" कहे जाने पर, उसने इसे समझ लिया! उसने बैठने के कॉन्सेप्ट को समझ लिया और इसे एक नए ऑब्जेक्ट पर लागू कर दिया। ऐसा इसलिए है क्योंकि "डायरेक्टर" AI भाषा और अवधारणाओं को समझता है, न कि केवल विशिष्ट निर्देशांकों (coordinates) को।
4. वास्तविक दुनिया का परीक्षण
टीम ने इसे एक Unitree G1 (एक वास्तविक ह्यूमनॉइड रोबोट) पर परखा।
- उन्होंने इसे चलना, बाधाओं से बचना, गेंद को किक मारना और सोफे पर बैठना सिखाया।
- परिणाम: रोबोट ने यह सब सुचारू रूप से किया। यहाँ तक कि उसने उन बाधाओं को भी संभाला जिन्हें उसने पहले कभी नहीं देखा था और उस कुर्सी पर बैठा जिसे उसने पहले कभी नहीं देखा था।
सारांश उपमा
ZeroWBC को एक मानव अभिनेता (विज़न-लैंग्वेज मॉडल) को हायर करने के रूप में सोचें जो एक स्क्रिप्ट देखता है और दृश्य की कल्पना करता है, और फिर एक प्रोफेशनल मिमिक (ट्रैकिंग पॉलिसी) को हायर करने के रूप में जो उस अभिनेता की गतिविधियों की सटीक नकल करता है।
- पुराना तरीका: आप हर कार्य के लिए रोबोट के हाथों को पकड़ते हैं और उन्हें हिलाते हैं।
- ZeroWBC तरीका: आप रोबोट को किसी इंसान द्वारा कार्य करने का एक मूवी दिखाते हैं, और रोबोट खुद इसे करना सीख जाता है।
यह दृष्टिकोण ऐसे रोबोटों के द्वार खोलता है जो इंटरनेट पर मौजूद मानव वीडियो के विशाल पुस्तकालय से सीख सकते हैं, जिससे वे बहुमुखी, स्वाभाविक और वास्तविक दुनिया में मदद के लिए तैयार हो जाते हैं, बिना इसके कि उन्हें हर कदम पर किसी इंसान के हाथ पकड़ने की आवश्यकता हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।