DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation
यह शोधपत्र DexVerse को प्रस्तुत करता है, जो एक बड़े पैमाने का, मॉड्यूलर बेंचमार्क है जिसमें 100 विविध कार्य, कई रोबोटिक स्वरूप (embodiments) और विन्यास योग्य (configurable) दृश्य विविधताएं शामिल हैं, ताकि सामान्य-उद्देश्य वाले दक्ष हेरफेर (dexterous manipulation) नीतियों का व्यवस्थित रूप से मूल्यांकन और विकास किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक साथ परम रसोई सहायक, एक कुशल मैकेनिक और एक सूक्ष्म कलाकार बनने के लिए सिखाने की कोशिश कर रहे हैं। आप चाहेंगे कि वह एक फिसलन भरे मग को पकड़े, एक जार का ढक्कन खोले, एक पैनकेक को पलट दे, और शायद ताश का खेल भी खेले बिना एक भी टुकड़ा गिराए। लेकिन समस्या यह है: अधिकांश रोबोट प्रशिक्षण कार्यक्रम एक बच्चे को बिल्कुल सपाट, खाली फुटपाथ पर साइकिल चलाना सिखाने जैसे होते हैं, और फिर उनसे उम्मीद करते हैं कि वे तुरंत गड्ढों और ट्रैफिक वाले व्यस्त, बरसाती शहर की सड़कों पर नेविगेट कर सकें।
यही वह चीज़ है जिसे DexVerse के पीछे के शोधकर्ता हल करने की कोशिश कर रहे हैं। उन्होंने रोबोट्स के लिए डेक्सट्रस मैनिपुलेशन (dexterous manipulation) सीखने के लिए एक विशाल, मॉड्यूलर "ट्रेनिंग जिम" बनाया है—जो बस एक फैंसी तरीका है यह कहने का कि "हाथों और बाहों का उपयोग करके कठिन, संपर्क-प्रधान कार्यों को करना।"
द अल्टीमेटेट रोबोट ऑब्स्टेकल कोर्स (रोबोट के लिए बाधा दौड़)
DexVerse को एक विशाल, डिजिटल खेल के मैदान के रूप में सोचें जिसमें 100 अलग-अलग चुनौतियाँ हैं। यह केवल एक ब्लॉक उठाने के बारे में नहीं है; यह इनके बारे में है:
- बुनियादी बातें: सरल वस्तुओं को पकड़ना और हिलाना।
- औज़ार: एक हथौड़ा इस्तेमाल करना या ड्रिंक डालना (जहाँ आपको यह जानना होता है कि वस्तु कैसे काम करती है, न कि केवल यह कि वह कैसी दिखती है)।
- पहेलियाँ: एक लैपटॉप खोलना, कैंची दबाना, या सुई में धागा पिरोना (इनके लिए सटीक संपर्क और चलते हुए हिस्सों की आवश्यकता होती है)।
- टीम वर्क: एक ट्रे उठाने या वस्तु को पास करने के लिए एक साथ दो हाथों का उपयोग करना।
- मैराथन: कॉफी बनाना या कुछ बेक करना, जिसमें कई चरणों की एक लंबी श्रृंखला शामिल होती है।
सबसे कूल बात क्या है? यह जिम केवल एक ही प्रकार के रोबोट तक सीमित नहीं है। यह 3 अलग-अलग रोबोट आर्म्स और 6 अलग-अलग डेक्सट्रस हाथों (जैसे Shadow Hand या LEA Hand) को सपोर्ट करता है। यह एक वीडियो गेम की तरह है जहाँ आप अपने कैरेक्टर के दस्ताने और हाथ तुरंत बदल सकते हैं ताकि देख सकें कि क्या वे अभी भी लेवल जीत सकते हैं। इसके अलावा, शोधकर्ता रोशनी, बैकग्राउंड, वस्तुओं की बनावट और यहाँ तक कि कैमरा एंगल को भी तुरंत बदल सकते हैं। यह इस बात का परीक्षण करता है कि क्या रोबोट वास्तव में "सीख" रहा है या केवल एक विशिष्ट तस्वीर को याद कर रहा है।
द ह्यूमन ट्यूटर (और डेटा डंप)
इन रोबोटों को सिखाने के लिए, टीम ने केवल कोड नहीं लिखा; उन्होंने वर्चुअल रियलिटी (VR) का उपयोग किया। उन्होंने हेडसेट पहने और इन कार्यों को करने के लिए अपने स्वयं के हाथों का उपयोग किया, जिससे वे "ट्यूटर" के रूप में कार्य कर सके। उन्होंने इन कार्यों के 3,180 प्रदर्शन (demonstrations) एकत्र किए। प्रत्येक रिकॉर्डिंग में सब कुछ शामिल है: रोबोट के जोड़ कैसे हिले, कैमरों ने क्या देखा (RGB इमेज, डेप्थ और पॉइंट क्लाउड्स), और दुनिया की स्थिति। यह रोबोटों के लिए "कैसे करें" के वीडियो का एक विशाल पुस्तकालय है, जो मानव की सटीक गतिविधियों के साथ पूरी तरह से सिंक्रोनाइज़्ड है।
द बिग रिवील: रोबोट अभी भी चलना सीख रहे हैं
यहाँ मुख्य निष्कर्ष है, और यह एक वास्तविकता का अहसास कराने वाला मोड़ है। शोधकर्ताओं ने आज के चार सबसे स्मार्ट, सबसे उन्नत रोबोट "मस्तिष्क" (जिनमें Diffusion Policy, DP3, OpenVLA, और π0.5 शामिल हैं) को लिया और उन्हें इस DexVerse जिम में डाल दिया।
उन्होंने 19 अलग-अलग कार्यों को चलाया और रोबोटों को उन्हें हल करने की कोशिश करने दी। परिणाम? यह एक कठिन मुकाबला है।
- स्कोर: सबसे अच्छा प्रदर्शन करने वाला रोबोट मस्तिष्क भी औसतन लगभग 34% बार ही सफल हुआ। इसका मतलब है कि वे दो-तिहाई से अधिक बार असफल रहे।
- कोई एकल नायक नहीं: वहाँ कोई एक "चैंपियन" रोबोट नहीं था। एक प्रकार का मस्तिष्क सरल उठाने में बहुत अच्छा था, दूसरा औजारों के उपयोग में ठीक था, और तीसरा सटीक संपर्क में अच्छा था, लेकिन कोई भी सब कुछ अच्छी तरह से नहीं कर सका।
- कड़वा सच: शोधकर्ताओं ने पाया कि इंटरनेट के विशाल डेटा पर प्रशिक्षण लेना (जैसे कि "प्री-ट्रेन्ड" मॉडल) रोबोटों को इन जटिल हाथ की गतिविधियों में स्वचालित रूप से बेहतर नहीं बनाता है। इंटरनेट से प्राप्त "ज्ञान" रोबोटिक हाथ के जटिल भौतिकी (physics) में अच्छी तरह से अनुवादित नहीं हुआ।
- जीरो-सक्सेस ज़ोन: कुछ कार्यों के लिए, जैसे कि एक ढलान पर छोटे गोले को धकेलना या यूटिलिटी नाइफ को स्लाइड करना, हर एक रोबमा पूरी तरह से विफल रहा (0% सफलता)। इन कार्यों के लिए बारीक फोर्स कंट्रोल और सब-सेन्टीमीटर सटीकता की आवश्यकता होती है जो वर्तमान रोबोटों में अभी नहीं है।
इसका क्या अर्थ है
DexVerse कोई ऐसी रिपोर्ट नहीं है जो कहती है "रोबोट जीत गए हैं!" बल्कि यह एक रिपोर्ट है जो कहती है, "यहाँ एक विशाल, ईमानदार परीक्षण है, और अभी भी रोबोट संघर्ष कर रहे हैं।"
पेपर सुझाव देता है कि जबकि हमने प्रगति की है, एक नियंत्रित, सरल दुनिया में रोबोट जो कर सकते हैं और एक अस्त-व्यस्त, वास्तविक दुनिया में उन्हें जो करने की आवश्यकता है, उसके बीच का अंतर अभी भी बहुत बड़ा है। शोधकर्ताओं ने इन विफलताओं को सिमुलेशन में मापा, यह दिखाते हुए कि जिन कार्यों के लिए टाइट कॉन्टैक्ट, द्विपक्षीय समन्वय (bimanual coordination) और सटीक टूल उपयोग की आवश्यकता होती है, वे वे "फाइनल बॉस" हैं जिन्हें वर्तमान तकनीक अभी तक हरा नहीं पाई है।
इसलिए, जबकि हमारे पास एक शानदार नया प्रशिक्षण मैदान (DexVerse) और मानव प्रदर्शनों का एक विशाल पुस्तकालय है, एक ऐसा रोबोट बनाने का सपना जो सहजता से किसी भी डेक्सट्रस कार्य को संभाल सके, अभी भी एक प्रगतिशील कार्य (work in progress) है। आगे का रास्ता यह पता लगाने में निहित है कि उन कठिन, शून्य-सफलता वाले कार्यों को कैसे संभाला जाए जहाँ वर्तमान सबसे स्मार्ट AI दिमाग भी फिलहाल मात खा रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।