← नवीनतम पेपर
💻 computer science

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

यह शोधपत्र DexVerse को प्रस्तुत करता है, जो एक बड़े पैमाने का, मॉड्यूलर बेंचमार्क है जिसमें 100 विविध कार्य, कई रोबोटिक स्वरूप (embodiments) और विन्यास योग्य (configurable) दृश्य विविधताएं शामिल हैं, ताकि सामान्य-उद्देश्य वाले दक्ष हेरफेर (dexterous manipulation) नीतियों का व्यवस्थित रूप से मूल्यांकन और विकास किया जा सके।

मूल लेखक: Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

प्रकाशित 2026-07-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक साथ परम रसोई सहायक, एक कुशल मैकेनिक और एक सूक्ष्म कलाकार बनने के लिए सिखाने की कोशिश कर रहे हैं। आप चाहेंगे कि वह एक फिसलन भरे मग को पकड़े, एक जार का ढक्कन खोले, एक पैनकेक को पलट दे, और शायद ताश का खेल भी खेले बिना एक भी टुकड़ा गिराए। लेकिन समस्या यह है: अधिकांश रोबोट प्रशिक्षण कार्यक्रम एक बच्चे को बिल्कुल सपाट, खाली फुटपाथ पर साइकिल चलाना सिखाने जैसे होते हैं, और फिर उनसे उम्मीद करते हैं कि वे तुरंत गड्ढों और ट्रैफिक वाले व्यस्त, बरसाती शहर की सड़कों पर नेविगेट कर सकें।

यही वह चीज़ है जिसे DexVerse के पीछे के शोधकर्ता हल करने की कोशिश कर रहे हैं। उन्होंने रोबोट्स के लिए डेक्सट्रस मैनिपुलेशन (dexterous manipulation) सीखने के लिए एक विशाल, मॉड्यूलर "ट्रेनिंग जिम" बनाया है—जो बस एक फैंसी तरीका है यह कहने का कि "हाथों और बाहों का उपयोग करके कठिन, संपर्क-प्रधान कार्यों को करना।"

द अल्टीमेटेट रोबोट ऑब्स्टेकल कोर्स (रोबोट के लिए बाधा दौड़)

DexVerse को एक विशाल, डिजिटल खेल के मैदान के रूप में सोचें जिसमें 100 अलग-अलग चुनौतियाँ हैं। यह केवल एक ब्लॉक उठाने के बारे में नहीं है; यह इनके बारे में है:

  • बुनियादी बातें: सरल वस्तुओं को पकड़ना और हिलाना।
  • औज़ार: एक हथौड़ा इस्तेमाल करना या ड्रिंक डालना (जहाँ आपको यह जानना होता है कि वस्तु कैसे काम करती है, न कि केवल यह कि वह कैसी दिखती है)।
  • पहेलियाँ: एक लैपटॉप खोलना, कैंची दबाना, या सुई में धागा पिरोना (इनके लिए सटीक संपर्क और चलते हुए हिस्सों की आवश्यकता होती है)।
  • टीम वर्क: एक ट्रे उठाने या वस्तु को पास करने के लिए एक साथ दो हाथों का उपयोग करना।
  • मैराथन: कॉफी बनाना या कुछ बेक करना, जिसमें कई चरणों की एक लंबी श्रृंखला शामिल होती है।

सबसे कूल बात क्या है? यह जिम केवल एक ही प्रकार के रोबोट तक सीमित नहीं है। यह 3 अलग-अलग रोबोट आर्म्स और 6 अलग-अलग डेक्सट्रस हाथों (जैसे Shadow Hand या LEA Hand) को सपोर्ट करता है। यह एक वीडियो गेम की तरह है जहाँ आप अपने कैरेक्टर के दस्ताने और हाथ तुरंत बदल सकते हैं ताकि देख सकें कि क्या वे अभी भी लेवल जीत सकते हैं। इसके अलावा, शोधकर्ता रोशनी, बैकग्राउंड, वस्तुओं की बनावट और यहाँ तक कि कैमरा एंगल को भी तुरंत बदल सकते हैं। यह इस बात का परीक्षण करता है कि क्या रोबोट वास्तव में "सीख" रहा है या केवल एक विशिष्ट तस्वीर को याद कर रहा है।

द ह्यूमन ट्यूटर (और डेटा डंप)

इन रोबोटों को सिखाने के लिए, टीम ने केवल कोड नहीं लिखा; उन्होंने वर्चुअल रियलिटी (VR) का उपयोग किया। उन्होंने हेडसेट पहने और इन कार्यों को करने के लिए अपने स्वयं के हाथों का उपयोग किया, जिससे वे "ट्यूटर" के रूप में कार्य कर सके। उन्होंने इन कार्यों के 3,180 प्रदर्शन (demonstrations) एकत्र किए। प्रत्येक रिकॉर्डिंग में सब कुछ शामिल है: रोबोट के जोड़ कैसे हिले, कैमरों ने क्या देखा (RGB इमेज, डेप्थ और पॉइंट क्लाउड्स), और दुनिया की स्थिति। यह रोबोटों के लिए "कैसे करें" के वीडियो का एक विशाल पुस्तकालय है, जो मानव की सटीक गतिविधियों के साथ पूरी तरह से सिंक्रोनाइज़्ड है।

द बिग रिवील: रोबोट अभी भी चलना सीख रहे हैं

यहाँ मुख्य निष्कर्ष है, और यह एक वास्तविकता का अहसास कराने वाला मोड़ है। शोधकर्ताओं ने आज के चार सबसे स्मार्ट, सबसे उन्नत रोबोट "मस्तिष्क" (जिनमें Diffusion Policy, DP3, OpenVLA, और π0.5 शामिल हैं) को लिया और उन्हें इस DexVerse जिम में डाल दिया।

उन्होंने 19 अलग-अलग कार्यों को चलाया और रोबोटों को उन्हें हल करने की कोशिश करने दी। परिणाम? यह एक कठिन मुकाबला है।

  • स्कोर: सबसे अच्छा प्रदर्शन करने वाला रोबोट मस्तिष्क भी औसतन लगभग 34% बार ही सफल हुआ। इसका मतलब है कि वे दो-तिहाई से अधिक बार असफल रहे।
  • कोई एकल नायक नहीं: वहाँ कोई एक "चैंपियन" रोबोट नहीं था। एक प्रकार का मस्तिष्क सरल उठाने में बहुत अच्छा था, दूसरा औजारों के उपयोग में ठीक था, और तीसरा सटीक संपर्क में अच्छा था, लेकिन कोई भी सब कुछ अच्छी तरह से नहीं कर सका।
  • कड़वा सच: शोधकर्ताओं ने पाया कि इंटरनेट के विशाल डेटा पर प्रशिक्षण लेना (जैसे कि "प्री-ट्रेन्ड" मॉडल) रोबोटों को इन जटिल हाथ की गतिविधियों में स्वचालित रूप से बेहतर नहीं बनाता है। इंटरनेट से प्राप्त "ज्ञान" रोबोटिक हाथ के जटिल भौतिकी (physics) में अच्छी तरह से अनुवादित नहीं हुआ।
  • जीरो-सक्सेस ज़ोन: कुछ कार्यों के लिए, जैसे कि एक ढलान पर छोटे गोले को धकेलना या यूटिलिटी नाइफ को स्लाइड करना, हर एक रोबमा पूरी तरह से विफल रहा (0% सफलता)। इन कार्यों के लिए बारीक फोर्स कंट्रोल और सब-सेन्टीमीटर सटीकता की आवश्यकता होती है जो वर्तमान रोबोटों में अभी नहीं है।

इसका क्या अर्थ है

DexVerse कोई ऐसी रिपोर्ट नहीं है जो कहती है "रोबोट जीत गए हैं!" बल्कि यह एक रिपोर्ट है जो कहती है, "यहाँ एक विशाल, ईमानदार परीक्षण है, और अभी भी रोबोट संघर्ष कर रहे हैं।"

पेपर सुझाव देता है कि जबकि हमने प्रगति की है, एक नियंत्रित, सरल दुनिया में रोबोट जो कर सकते हैं और एक अस्त-व्यस्त, वास्तविक दुनिया में उन्हें जो करने की आवश्यकता है, उसके बीच का अंतर अभी भी बहुत बड़ा है। शोधकर्ताओं ने इन विफलताओं को सिमुलेशन में मापा, यह दिखाते हुए कि जिन कार्यों के लिए टाइट कॉन्टैक्ट, द्विपक्षीय समन्वय (bimanual coordination) और सटीक टूल उपयोग की आवश्यकता होती है, वे वे "फाइनल बॉस" हैं जिन्हें वर्तमान तकनीक अभी तक हरा नहीं पाई है।

इसलिए, जबकि हमारे पास एक शानदार नया प्रशिक्षण मैदान (DexVerse) और मानव प्रदर्शनों का एक विशाल पुस्तकालय है, एक ऐसा रोबोट बनाने का सपना जो सहजता से किसी भी डेक्सट्रस कार्य को संभाल सके, अभी भी एक प्रगतिशील कार्य (work in progress) है। आगे का रास्ता यह पता लगाने में निहित है कि उन कठिन, शून्य-सफलता वाले कार्यों को कैसे संभाला जाए जहाँ वर्तमान सबसे स्मार्ट AI दिमाग भी फिलहाल मात खा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →