Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
Qwen-RobotManip एक सामान्यीकरण योग्य विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है जो प्रतिनिधित्व, गति और व्यवहार संबंधी आयामों में एक एकीकृत संरेखण ढांचे का लाभ उठाता है ताकि लगभग 38,100 घंटों के ओपन-सोर्स कॉर्पस पर बड़े पैमाने पर प्रशिक्षण सक्षम किया जा सके, जिससे विविध रोबोटिक प्लेटफॉर्म और आउट-ऑफ-डिस्ट्रीब्यूशन बेंचमार्क में अत्याधुनिक प्रदर्शन और उभरती हुई सामान्यीकरण क्षमताएं प्राप्त होती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ Qwen-RobotManip तकनीकी रिपोर्ट का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।
मुख्य विचार: रोबोट को इंसानों की तरह "सोचना" सिखाना
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाना चाहते हैं। अतीत में, वैज्ञानिकों ने रोबोट को विशिष्ट कार्य करते हुए अन्य रोबोटों के हज़ारों वीडियो दिखाकर सिखाने की कोशिश की। लेकिन यह एक कुत्ते को शतरंज खेलने के वीडियो दिखाकर उसे शतरंज खेलना सिखाने जैसा है। यह महंगा है, डेटा दुर्लभ है, और यदि नया रोबोट थोड़ा अलग दिखता है (जैसे उसके हाथ का आकार अलग हो), तो वह भ्रमित हो जाता है।
Qwen-RobotManip की टीम ने एक अलग सवाल पूछा: क्या हम रोबोट को उसी "स्केलिंग रेसिपी" से सिखा सकते हैं जिसने AI चैटबॉट्स को इतना स्मार्ट बनाया?
चैटबॉट्स इसलिए स्मार्ट हुए क्योंकि उन्होंने इंटरनेट पर मौजूद सब कुछ पढ़ा—किताबें, फ़ोरम, लेख और वीडियो। उन्होंने विचारों को जोड़ना सीखा क्योंकि वह सारा टेक्स्ट "एलाइन" (एक ही भाषा का उपयोग करता) था। टीम यह देखना चाहती थी कि क्या वे रोबंतु के लिए भी ऐसा ही कर सकते हैं: उपलब्ध सारा रोबोट डेटा (भले ही वह अलग-अलग रोबोटों का हो) और उपलब्ध सभी मानव हाथ की गति के वीडियो को एक साथ मिला दें, और एक रोबोट को केवल एक विशिष्ट कार्य के बजाय दुनिया को सामान्य रूप से समझना सिखाएं।
समस्या: रोबोटों के बीच "भाषा की बाधा"
टीम को एहसास हुआ कि एक बड़ी समस्या है। टेक्स्ट को एलाइन करना आसान है; हर किताब में "बिल्ली" (cat) का मतलब "बिल्ली" ही होता है। लेकिन रोबोट का डेटा अव्यवस्थित होता है।
- अलग-अलग शरीर: एक रोबोट की भुजा लंबी है; दूसरे की छोटी है। एक के पास दो हाथ हैं; दूसरे के पास एक है।
- अलग-अलग दृश्य (Views): एक कैमरा ऊपर से देखता है; दूसरा बगल से।
- अलग-अलग भाषाएँ: एक रोबोट गति को "जॉइंट एंगल्स" (कोहनी कितनी मुड़ी है) में रिकॉर्ड करता है; दूसरा इसे "3D स्पेस" (कमरे में हाथ कहाँ है) में रिकॉर्ड करता है।
यदि आप इस पूरे डेटा को एक ब्लेंडर में डाल देंगे, तो रोबोट को सिरदर्द हो जाएगा। यह एक साथ फ्रेंच, जापानी और स्पेनिश बोलने वालों को बिना किसी अनुवादक के सुनने और भाषा सीखने जैसा है। संकेत आपस में टकराते हैं, और रोबोट कुछ भी नहीं सीख पाता।
समाधान: "यूनिवर्सल ट्रांसलेटर" (सार्वभौमिक अनुवादक)
इसे ठीक करने के लिए, टीम ने Qwen-RobotManip बनाया, जो एक रोबोट मस्तिष्क है और एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है। उन्होंने केवल डेटा नहीं डाला; उन्होंने रोबोट को सिखाने से पहले सब कुछ एक सामान्य भाषा में अनुवाद करने के लिए नियमों का एक सख्त सेट बनाया।
उन्होंने तीन चीजों को एलाइन किया:
- शरीर (प्रतिनिधित्व/Representation): उन्होंने एक "मानकीकृत शरीर मानचित्र" (standardized body map) बनाया। चाहे रोबोट एक इंसान जैसा हाथ हो या एक साधारण ग्रिपर, मस्तिष्क उसकी गतिविधियों को एक एकल, साझा प्रारूप में अनुवादित करता है।
- दृश्य (गति/Motion): रोबोट को यह बताने के बजाय कि "अपनी कोहनी 30 डिग्री घुमाओ," वे उसे सिखाते हैं कि "अपना हाथ उस कप की ओर ले जाओ।" वे सभी गतिविधियों को कैमरे के दृश्य से जोड़ देते हैं। यदि कैमरा देखता है कि कप बाईं ओर गया है, तो रोबोट बाईं ओर जाना सीखता है, चाहे उसके अपने जोड़ (joints) कुछ भी कर रहे हों। यह सड़क को देखकर गाड़ी चलाना सीखने जैसा है, न कि यह रटने जैसा कि स्टीयरिंग व्हील को कितना घुमाना है।
- संदर्भ (व्यवहार/Context): उन्होंने रोबोट को एक "मेमोरी विंडो" दी। कोई भी चाल चलने से पहले, रोबोट देखता है कि उसने एक सेकंड पहले क्या किया था। यह उसे मौके पर अनुकूलित होने में मदद करता है, जैसे कि एक इंसान अपनी पकड़ को तब समायोजित करता है जब उसे महसूस होता है कि बॉक्स फिसल रहा है।
डेटा: "इंसान-से-रोबोट" का जादू
इस मस्तिष्क को प्रशिक्षित करने के लिए टीम को भारी मात्रा में डेटा की आवश्यकता थी। उनके पास महंगे रोबोट रिकॉर्डिंग के लाखों घंटे नहीं थे। इसलिए, उन्होंने एक चतुर तरकीब का इस्तेमाल किया: Human-to-Robot Synthesis (मानव-से-रोबोट संश्लेषण)।
- स्रोत: उन्होंने इंसानों द्वारा कार्य करते हुए (जैसे खाना बनाना या सफाई करना) हजारों घंटों के वीडियो एकत्र किए, जो प्रथम-व्यक्ति परिप्रेक्ष्य (जैसे GoPro पहनकर) से फिल्माए गए थे।
- जादू: उन्होंने AI का उपयोग करके वीडियो में मानव हाथों को रोबोटिक भुजाओं के साथ "बदलने" (swap) के लिए किया।
- उपमा: कल्पना कीजिए कि एक मानव शेफ सब्जी काट रहा है। AI मानव के हाथ की गति को देखता है, पता लगाता है कि चाकू कहाँ होगा, और फिर डिजिटल रूप से मानव हाथ को रोबोटिक हाथ से बदल देता है, जिससे रोबोटिक हाथ ठीक उसी तरह से कटाई करता है।
- परिणाम: उन्होंने 1,900 घंटे के मानव वीडियो को 15 विभिन्न प्रकार के रोबोटों के लिए 24,800 घंटों के रोबोट डेटा में बदल दिया।
कुल मिलाकर, उन्होंने 38,100 घंटों का प्रशिक्षण पुस्तकालय बनाया, जिसमें केवल ओपन-सोर्स डेटा का उपयोग किया गया (कोई गुप्त कॉर्पोरेट डेटा नहीं)।
परिणाम: क्या यह वास्तव में काम करता है?
टीम ने अपने रोबोट मस्तिष्क का परीक्षण दो तरीकों से किया:
- "पाठ्यपुस्तक" परीक्षण (The Textbook Test): मानक परीक्षण जहाँ रोबोट ठीक उसी कमरे और वस्तुओं को देखता है जिनके लिए उसे प्रशिक्षित किया गया था। यहाँ, रोबोट ने अच्छा प्रदर्शन किया, लेकिन अन्य मॉडलों ने भी ऐसा ही किया।
- "वास्तविक दुनिया" परीक्षण (OOD): यहीं पर असली जादू हुआ। उन्होंने रोबोट का परीक्षण नए कमरों, नई वस्तुओं, अलग रोशनी और यहाँ तक कि ऐसे रोबोटों पर किया जिन्हें उसने पहले कभी नहीं देखा था।
निष्कर्ष:
- सामान्यीकरण (Generalization): जबकि अन्य रोबोट तब विफल हो गए जब रोशनी बदली या मेज हिल गई, Qwen-RobotManip काम करता रहा। इसने कार्य के अवधारणा (concept) को समझा, न कि केवल दृश्य पैटर्न को।
- क्रॉस-बॉडी ट्रांसफर (Cross-Body Transfer): उन्होंने एक दो भुजाओं वाले रोबोट (AgileX) पर प्रशिक्षण दिया और फिर एक पूरी तरह से अलग रोबोट (जैसे Franka या UR5 आर्म) पर इसका परीक्षण किया जिसे उसने पहले कभी नहीं देखा था। यह वहां सफल रहा जहां अन्य विफल रहे।
- स्व-सुधार (Self-Correction): वास्तविक दुनिया के परीक्षणों में, यदि रोबोट ने कोई वस्तु गिरा दी, तो वह हार नहीं मान गया। उसने फिर से प्रयास किया, अपनी पकड़ को समायोजित किया, बिल्कुल वैसे ही जैसे एक इंसान करता है।
- निर्देश पालन (Instruction Following): यदि आपने इसे "लाल कप उठाओ" कहा, तो इसने लाल कप उठाया, भले ही कप अजीब जगह पर हो या रोशनी खराब हो। अन्य मॉडल अक्सर निर्देश को अनदेखा कर देते थे और जो भी पास में होता उसे पकड़ लेते थे।
निष्कर्ष (The Takeaway)
यह पेपर तर्क देता है कि स्मार्ट रोबोट बनाने का रहस्य केवल अधिक डेटा एकत्र करना नहीं है; बल्कि पहले उस डेटा को सही ढंग से एलाइन (align) करना है।
इसे एक लाइब्रेरी बनाने जैसा समझें। यदि आप अलग-अलग भाषाओं, आकारों और प्रारूपों की किताबों को एक ढेर में फेंक देंगे, तो कोई उन्हें पढ़ नहीं पाएगा। लेकिन यदि आप उन सभी को एक मानक भाषा में अनुवादित करते हैं और एक ही शेल्फ पर व्यवस्थित करते हैं, तो आप कुछ भी पढ़ सकते हैं।
Qwen-RobotManip ने सिद्ध किया कि सभी रोबोट और मानव डेटा को एक "साझा भाषा" (कैमरा-एलाइन क्रियाओं) में अनुवादित करके, आप एक रोबोट को एक सच्चा जनरलिस्ट (generalist) बनाने के लिए प्रशिक्षित कर सकते हैं—जो बिना दोबारा प्रशिक्षित किए नए कार्य सीखने और विभिन्न शरीरों पर काम करने में सक्षम है। उन्होंने यह केवल मुफ्त, ओपन डेटा का उपयोग करके हासिल किया, जो यह सुझाव देता है कि स्मार्ट रोबोट बनाने की बाधा उतनी बड़ी नहीं है जितना हम सोचते हैं, बशर्ते हमारे पास सही "अनुवाद" उपकरण हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।