← नवीनतम पेपर
💻 computer science

XRZero-G0: Pushing the Frontier of Dexterous Robotic Manipulation with Interfaces, Quality and Ratios

यह शोध पत्र XRZero-G0 को प्रस्तुत करता है, जो एक हार्डवेयर-सॉफ्टवेयर सह-डिज़ाइन किया गया सिस्टम है जो एर्गोनोमिक VR इंटरफेस और एक क्लोज्ड-लूप क्वालिटी कंट्रोल पाइपलाइन का लाभ उठाकर कुशलतापूर्वक उच्च-गुणवत्ता वाले रोबोट-मुक्त प्रदर्शन डेटा (demonstration data) को एकत्र करता है, यह प्रदर्शित करते हुए कि वास्तविक-रोबोट डेटा के एक छोटे मिश्रण के साथ बड़े पैमाने पर रोबोट-मुक्त डेटा का उपयोग करने से शुद्ध वास्तविक-रोबोट डेटासेट के समान प्रदर्शन प्राप्त होता है, जबकि अधिग्रहण लागत में काफी कमी आती है और ज़ीरो-शॉट क्रॉस-एम्बॉडमेंट ट्रांसफर सक्षम होता है।

मूल लेखक: James Wang, Primo Pu, Zephyr Fung, Alex Wang, Sam Wang, Bender Deng, Kevin Wang, Zivid Liu, Chris Pan, Panda Yang, Andy Zhai, Lucy Liang, Shalfun Li, Johnny Sun, Jacky Xu, Will Tian, Kai Yan, Kohler Y
प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Wang, Primo Pu, Zephyr Fung, Alex Wang, Sam Wang, Bender Deng, Kevin Wang, Zivid Liu, Chris Pan, Panda Yang, Andy Zhai, Lucy Liang, Shalfun Li, Johnny Sun, Jacky Xu, Will Tian, Kai Yan, Kohler Ye, Scott Li, Qian Wang, Roy Gan, Hao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जटिल काम करना सिखाना चाहते हैं, जैसे कि एक नाजुक स्वेटर को मोड़ना, बिना कुचले एक अंगूर उठाना, या फूलदान में फूल सजाना। पुराना तरीका यह था कि एक इंसान कुर्सी पर बैठकर, एक भारी हेडसेट पहनकर, रोबोट के हर एक मूवमेंट के माध्यम से उसके हाथों को शारीरिक रूप से हिलाता था। यह बिल्कुल वैसा ही था जैसे किसी बच्चे को साइकिल चलाना सिखाने के लिए घंटों तक साइकिल को पकड़कर उसके साथ चलना। यह धीमा, महंगा था और मानव ऑपरेटर जल्दी थक जाता था।

XRZero-G0 रोबोट सिखाने का एक नया, क्रांतिकारी तरीका है। इसे "रोबोट के दिमाग के लिए जिम" की तरह समझें जो वर्चुअल रियलिटी, स्मार्ट सॉफ्टवेयर और थोड़े से वास्तविक दुनिया के अभ्यास का एक चतुर मिश्रण उपयोग करता है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. इंटरफ़ेस: "सुपर-बैकपैक" (टेडर के बजाय)

समस्या: पुराने तरीकों ने इंसान को रोबोट से बांध दिया था। यदि रोबट किचन में था, तो इंसान को भी किचन में ही होना पड़ता था। यदि रोबोट के दो हाथ थे, तो इंसान को अपने शरीर से अजीब तरह से दो हाथों की नकल करनी पड़ती थी।
XRZero-G0 का समाधान: कल्पना कीजिए कि एक इंसान एक आरामदायक वीआर (VR) हेडसेट और एक छोटा कंप्यूटर वाला बैकपैक पहने हुए है। वे अपने हाथों में दो विशेष "ग्रिपर्स" (जैसे हाई-टेक चिमटे) पकड़े हुए हैं।

  • जादू: इंसान अपने लिविंग रूम में घूम सकता है, एक तौलिया उठा सकता है, उसे मोड़ सकता है और रख सकता है। सिस्टम रिकॉर्ड करता है कि उन्होंने बिल्कुल क्या किया।
  • उपमा: यह स्मार्टफोन पर डांस रूटीन रिकॉर्ड करने जैसा है। आपको स्टेज या कैमरा क्रू की जरूरत नहीं है; आप बस स्वाभाविक रूप से नाचते हैं। रोबोट फिर उस वीडियो से डांस के स्टेप्स सीखता है, भले ही रोबोट का "शरीर" (हाथ) इंसान से अलग दिखता हो।

2. गुणवत्ता नियंत्रण: "सख्त संपादक" (Strict Editor)

समस्या: जब इंसान डेटा रिकॉर्ड करते हैं, तो वे गलतियाँ करते हैं। कभी-कभी वे बहुत तेज़ी से चलते हैं (वीडियो धुंधला हो जाता है), कभी-कभी वे ऐसे तरीके से चलते हैं जो एक रोबोट शारीरिक रूप से नहीं कर सकता (जैसे जोड़ को पीछे की ओर मोड़ना), या वे बस हिलना बंद कर देते हैं। यदि आप यह "कचरा" डेटा रोबोट को खिलाते हैं, तो वह बुरी आदतें सीख लेता है।
XRZero-G0 का समाधान: सिस्टम में एक अंतर्निर्मित "सख्त संपादक" (एक क्लोज्ड-लूप पाइपलाइन) है।

  • जादू: डेटा सेव होने से पहले, कंप्यूटर स्वचालित रूप से इसकी जांच करता है।
    • विजुअल चेक: "क्या यह फ्रेम बहुत धुंधला है? इसे हटा दें।"
    • फिजिक्स चेक: "क्या इंसान ने हाथ इस तरह से हिलाया जिसे रोबोट का हाथ नहीं कर सकता? इसे हटा दें।"
    • रियल-वर्ल्ड टेस्ट: यह कुछ रैंडम मूव्स चुनता है और वास्तव में एक सैंडबॉक्स में असली रोबोट पर उन्हें आज़माता है। यदि रोबोट विफल रहता है, तो डेटा को बाहर फेंक दिया जाता है।
  • परिणाम: यह सुनिश्चित करता है कि सेव किया गया 85% डेटा एकदम सटीक और उच्च गुणवत्ता वाला "गोल्ड" है। यह एक फिल्म निर्देशक की तरह है जो केवल बेहतरीन टेक रखता है, जिससे अंतिम फिल्म सुपरहिट बनती है।

3. गुप्त नुस्खा: "10-से-1 रेसिपी" (डेटा मिक्सिंग)

समस्या: आप सोच सकते हैं, "यदि मेरे पास 1,000 घंटे का मानव डेटा है, तो मुझे किसी वास्तविक रोबोट डेटा की आवश्यकता नहीं है।" लेकिन रोबोटों की विशिष्ट विशेषताएं होती हैं (घर्षण, मोटर में देरी) जो इंसानों में नहीं होतीं। यदि आप केवल मानव डेटा का उपयोग करते हैं, तो रोबට शायद यह समझ जाएगा कि क्या करना है, लेकिन वह अपने विशिष्ट जोड़ों को कैसे हिलाना है, इसमें विफल हो सकता है।
XRZero-G0 का समाधान: उन्होंने एक जादुई अनुपात खोजा।

  • उपमा: रोबोट को प्रशिक्षित करना एक छात्र को ड्राइविंग सिखाने जैसा है।
    • रोबोट-मुक्त डेटा (वीडियो गेम): आप ड्राइविंग वीडियो के 1,000 घंटे देखते हैं। आप सड़क के नियम, पैदल यात्रियों को पहचानना और मुड़ना सीख जाते हैं। यह सस्ता और आसान है।
    • असली रोबोट डेटा (ड्राइविंग लेसन): आप इंस्ट्रक्टर के साथ केवल 50 मिनट के लिए स्टीयरिंग व्हील के पीछे बैठते हैं। यह आपको इस कार के ब्रेक और स्टीयरिंग व्हील का विशिष्ट अहसास सिखाता है।
  • खोज: पेपर में पाया गया कि यदि आप 10 भाग वीडियो गेम डेटा को 1 भाग वास्तविक ड्राइविंग लेसन के साथ मिलाते हैं, तो छात्र उतना ही अच्छा बन जाता है जितना कि कोई व्यक्ति जिसने 100% समय कार में बिताया हो।
  • प्रभाव: यह प्रशिक्षण की लागत को 20 गुना कम कर देता है। आपको उसी स्मार्ट रोबोट के लिए बहुत कम कीमत चुकानी पड़ती है।

4. परिणाम: "यूनिवर्सल ट्रांसलेटर"

क्योंकि उन्होंने इस उच्च-गुणवत्ता वाले, मिश्रित डेटा के 2,000 घंटे से अधिक एकत्र किए, इसलिए उन्होंने G0-Dataset नामक एक विशाल लाइब्रेरी बनाई।

  • जीरो-शॉट ट्रांसफर (Zero-Shot Transfer): इसका मतलब है कि वे इस डेटा का उपयोग करके एक रोबोट को प्रशिक्षित कर सकते हैं, और फिर उस "दिमाग" को एक पूरी तरह से अलग रोबोट को दे सकते हैं (अलग लंबाई के हाथ या ग्रिपर्स के साथ), और वह तुरंत काम करने लगता है। यह एक भाषा सीखने और फिर बिना व्याकरण दोबारा सीखे, अलग लहजे वाले व्यक्ति के साथ धाराप्रवाह बोलने जैसा है।

सारांश

XRZero-G0 एक ऐसा सिस्टम है जो इंसानों को अपने घरों में स्वाभाविक रूप से काम करके, वीआर हेडसेट पहनकर, रोबोट को सिखाने देता है। यह गलतियों को फ़िल्टर करने के लिए स्मार्ट सॉफ्टवेयर का उपयोग करता है और सस्ते मानव डेटा को थोड़े से महंगे रोबोट डेटा के साथ मिलाने के लिए एक चतुर "10-से-1" रेसिपी का उपयोग करता है।

मुख्य बात: यह रोबोट सिखाने की महंगी और धीमी प्रक्रिया को एक तेज़, सस्ती और स्केलेबल ऑपरेशन में बदल देता है, जिससे हमारे घरों और कारखानों में स्मार्ट, कुशल रोबोटों का आना हमारी सोच से कहीं अधिक जल्द संभव हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →