← नवीनतम पेपर
🤖 machine learning

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip एक सामान्यीकरण योग्य विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है जो प्रतिनिधित्व, गति और व्यवहार संबंधी आयामों में एक एकीकृत संरेखण ढांचे का लाभ उठाता है ताकि लगभग 38,100 घंटों के ओपन-सोर्स कॉर्पस पर बड़े पैमाने पर प्रशिक्षण सक्षम किया जा सके, जिससे विविध रोबोटिक प्लेटफॉर्म और आउट-ऑफ-डिस्ट्रीब्यूशन बेंचमार्क में अत्याधुनिक प्रदर्शन और उभरती हुई सामान्यीकरण क्षमताएं प्राप्त होती हैं।

मूल लेखक: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An
प्रकाशित 2026-06-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Qwen-RobotManip तकनीकी रिपोर्ट का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

मुख्य विचार: रोबोट को इंसानों की तरह "सोचना" सिखाना

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाना चाहते हैं। अतीत में, वैज्ञानिकों ने रोबोट को विशिष्ट कार्य करते हुए अन्य रोबोटों के हज़ारों वीडियो दिखाकर सिखाने की कोशिश की। लेकिन यह एक कुत्ते को शतरंज खेलने के वीडियो दिखाकर उसे शतरंज खेलना सिखाने जैसा है। यह महंगा है, डेटा दुर्लभ है, और यदि नया रोबोट थोड़ा अलग दिखता है (जैसे उसके हाथ का आकार अलग हो), तो वह भ्रमित हो जाता है।

Qwen-RobotManip की टीम ने एक अलग सवाल पूछा: क्या हम रोबोट को उसी "स्केलिंग रेसिपी" से सिखा सकते हैं जिसने AI चैटबॉट्स को इतना स्मार्ट बनाया?

चैटबॉट्स इसलिए स्मार्ट हुए क्योंकि उन्होंने इंटरनेट पर मौजूद सब कुछ पढ़ा—किताबें, फ़ोरम, लेख और वीडियो। उन्होंने विचारों को जोड़ना सीखा क्योंकि वह सारा टेक्स्ट "एलाइन" (एक ही भाषा का उपयोग करता) था। टीम यह देखना चाहती थी कि क्या वे रोबंतु के लिए भी ऐसा ही कर सकते हैं: उपलब्ध सारा रोबोट डेटा (भले ही वह अलग-अलग रोबोटों का हो) और उपलब्ध सभी मानव हाथ की गति के वीडियो को एक साथ मिला दें, और एक रोबोट को केवल एक विशिष्ट कार्य के बजाय दुनिया को सामान्य रूप से समझना सिखाएं।

समस्या: रोबोटों के बीच "भाषा की बाधा"

टीम को एहसास हुआ कि एक बड़ी समस्या है। टेक्स्ट को एलाइन करना आसान है; हर किताब में "बिल्ली" (cat) का मतलब "बिल्ली" ही होता है। लेकिन रोबोट का डेटा अव्यवस्थित होता है।

  • अलग-अलग शरीर: एक रोबोट की भुजा लंबी है; दूसरे की छोटी है। एक के पास दो हाथ हैं; दूसरे के पास एक है।
  • अलग-अलग दृश्य (Views): एक कैमरा ऊपर से देखता है; दूसरा बगल से।
  • अलग-अलग भाषाएँ: एक रोबोट गति को "जॉइंट एंगल्स" (कोहनी कितनी मुड़ी है) में रिकॉर्ड करता है; दूसरा इसे "3D स्पेस" (कमरे में हाथ कहाँ है) में रिकॉर्ड करता है।

यदि आप इस पूरे डेटा को एक ब्लेंडर में डाल देंगे, तो रोबोट को सिरदर्द हो जाएगा। यह एक साथ फ्रेंच, जापानी और स्पेनिश बोलने वालों को बिना किसी अनुवादक के सुनने और भाषा सीखने जैसा है। संकेत आपस में टकराते हैं, और रोबोट कुछ भी नहीं सीख पाता।

समाधान: "यूनिवर्सल ट्रांसलेटर" (सार्वभौमिक अनुवादक)

इसे ठीक करने के लिए, टीम ने Qwen-RobotManip बनाया, जो एक रोबोट मस्तिष्क है और एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है। उन्होंने केवल डेटा नहीं डाला; उन्होंने रोबोट को सिखाने से पहले सब कुछ एक सामान्य भाषा में अनुवाद करने के लिए नियमों का एक सख्त सेट बनाया।

उन्होंने तीन चीजों को एलाइन किया:

  1. शरीर (प्रतिनिधित्व/Representation): उन्होंने एक "मानकीकृत शरीर मानचित्र" (standardized body map) बनाया। चाहे रोबोट एक इंसान जैसा हाथ हो या एक साधारण ग्रिपर, मस्तिष्क उसकी गतिविधियों को एक एकल, साझा प्रारूप में अनुवादित करता है।
  2. दृश्य (गति/Motion): रोबोट को यह बताने के बजाय कि "अपनी कोहनी 30 डिग्री घुमाओ," वे उसे सिखाते हैं कि "अपना हाथ उस कप की ओर ले जाओ।" वे सभी गतिविधियों को कैमरे के दृश्य से जोड़ देते हैं। यदि कैमरा देखता है कि कप बाईं ओर गया है, तो रोबोट बाईं ओर जाना सीखता है, चाहे उसके अपने जोड़ (joints) कुछ भी कर रहे हों। यह सड़क को देखकर गाड़ी चलाना सीखने जैसा है, न कि यह रटने जैसा कि स्टीयरिंग व्हील को कितना घुमाना है।
  3. संदर्भ (व्यवहार/Context): उन्होंने रोबोट को एक "मेमोरी विंडो" दी। कोई भी चाल चलने से पहले, रोबोट देखता है कि उसने एक सेकंड पहले क्या किया था। यह उसे मौके पर अनुकूलित होने में मदद करता है, जैसे कि एक इंसान अपनी पकड़ को तब समायोजित करता है जब उसे महसूस होता है कि बॉक्स फिसल रहा है।

डेटा: "इंसान-से-रोबोट" का जादू

इस मस्तिष्क को प्रशिक्षित करने के लिए टीम को भारी मात्रा में डेटा की आवश्यकता थी। उनके पास महंगे रोबोट रिकॉर्डिंग के लाखों घंटे नहीं थे। इसलिए, उन्होंने एक चतुर तरकीब का इस्तेमाल किया: Human-to-Robot Synthesis (मानव-से-रोबोट संश्लेषण)

  • स्रोत: उन्होंने इंसानों द्वारा कार्य करते हुए (जैसे खाना बनाना या सफाई करना) हजारों घंटों के वीडियो एकत्र किए, जो प्रथम-व्यक्ति परिप्रेक्ष्य (जैसे GoPro पहनकर) से फिल्माए गए थे।
  • जादू: उन्होंने AI का उपयोग करके वीडियो में मानव हाथों को रोबोटिक भुजाओं के साथ "बदलने" (swap) के लिए किया।
    • उपमा: कल्पना कीजिए कि एक मानव शेफ सब्जी काट रहा है। AI मानव के हाथ की गति को देखता है, पता लगाता है कि चाकू कहाँ होगा, और फिर डिजिटल रूप से मानव हाथ को रोबोटिक हाथ से बदल देता है, जिससे रोबोटिक हाथ ठीक उसी तरह से कटाई करता है।
  • परिणाम: उन्होंने 1,900 घंटे के मानव वीडियो को 15 विभिन्न प्रकार के रोबोटों के लिए 24,800 घंटों के रोबोट डेटा में बदल दिया।

कुल मिलाकर, उन्होंने 38,100 घंटों का प्रशिक्षण पुस्तकालय बनाया, जिसमें केवल ओपन-सोर्स डेटा का उपयोग किया गया (कोई गुप्त कॉर्पोरेट डेटा नहीं)।

परिणाम: क्या यह वास्तव में काम करता है?

टीम ने अपने रोबोट मस्तिष्क का परीक्षण दो तरीकों से किया:

  1. "पाठ्यपुस्तक" परीक्षण (The Textbook Test): मानक परीक्षण जहाँ रोबोट ठीक उसी कमरे और वस्तुओं को देखता है जिनके लिए उसे प्रशिक्षित किया गया था। यहाँ, रोबोट ने अच्छा प्रदर्शन किया, लेकिन अन्य मॉडलों ने भी ऐसा ही किया।
  2. "वास्तविक दुनिया" परीक्षण (OOD): यहीं पर असली जादू हुआ। उन्होंने रोबोट का परीक्षण नए कमरों, नई वस्तुओं, अलग रोशनी और यहाँ तक कि ऐसे रोबोटों पर किया जिन्हें उसने पहले कभी नहीं देखा था।

निष्कर्ष:

  • सामान्यीकरण (Generalization): जबकि अन्य रोबोट तब विफल हो गए जब रोशनी बदली या मेज हिल गई, Qwen-RobotManip काम करता रहा। इसने कार्य के अवधारणा (concept) को समझा, न कि केवल दृश्य पैटर्न को।
  • क्रॉस-बॉडी ट्रांसफर (Cross-Body Transfer): उन्होंने एक दो भुजाओं वाले रोबोट (AgileX) पर प्रशिक्षण दिया और फिर एक पूरी तरह से अलग रोबोट (जैसे Franka या UR5 आर्म) पर इसका परीक्षण किया जिसे उसने पहले कभी नहीं देखा था। यह वहां सफल रहा जहां अन्य विफल रहे।
  • स्व-सुधार (Self-Correction): वास्तविक दुनिया के परीक्षणों में, यदि रोबोट ने कोई वस्तु गिरा दी, तो वह हार नहीं मान गया। उसने फिर से प्रयास किया, अपनी पकड़ को समायोजित किया, बिल्कुल वैसे ही जैसे एक इंसान करता है।
  • निर्देश पालन (Instruction Following): यदि आपने इसे "लाल कप उठाओ" कहा, तो इसने लाल कप उठाया, भले ही कप अजीब जगह पर हो या रोशनी खराब हो। अन्य मॉडल अक्सर निर्देश को अनदेखा कर देते थे और जो भी पास में होता उसे पकड़ लेते थे।

निष्कर्ष (The Takeaway)

यह पेपर तर्क देता है कि स्मार्ट रोबोट बनाने का रहस्य केवल अधिक डेटा एकत्र करना नहीं है; बल्कि पहले उस डेटा को सही ढंग से एलाइन (align) करना है।

इसे एक लाइब्रेरी बनाने जैसा समझें। यदि आप अलग-अलग भाषाओं, आकारों और प्रारूपों की किताबों को एक ढेर में फेंक देंगे, तो कोई उन्हें पढ़ नहीं पाएगा। लेकिन यदि आप उन सभी को एक मानक भाषा में अनुवादित करते हैं और एक ही शेल्फ पर व्यवस्थित करते हैं, तो आप कुछ भी पढ़ सकते हैं।

Qwen-RobotManip ने सिद्ध किया कि सभी रोबोट और मानव डेटा को एक "साझा भाषा" (कैमरा-एलाइन क्रियाओं) में अनुवादित करके, आप एक रोबोट को एक सच्चा जनरलिस्ट (generalist) बनाने के लिए प्रशिक्षित कर सकते हैं—जो बिना दोबारा प्रशिक्षित किए नए कार्य सीखने और विभिन्न शरीरों पर काम करने में सक्षम है। उन्होंने यह केवल मुफ्त, ओपन डेटा का उपयोग करके हासिल किया, जो यह सुझाव देता है कि स्मार्ट रोबोट बनाने की बाधा उतनी बड़ी नहीं है जितना हम सोचते हैं, बशर्ते हमारे पास सही "अनुवाद" उपकरण हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →