← नवीनतम पेपर
💻 computer science

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

यह शोध पत्र इंडस्ट्रियल डेक्सटेरिटी बेंचमार्क (IDB) और एक मल्टीमॉडल डिफ्यूजन-आधारित इमिटेशन लर्निंग फ्रेमवर्क (AG-iDP3) प्रस्तुत करता है जो न्यूनतम प्रदर्शन डेटा के साथ जटिल औद्योगिक केबल हेरफेर कार्यों पर 78% सफलता दर प्राप्त करता है, जो शास्त्रीय विधियों और सिंगल-कैमरा बेसलाइन से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

प्रकाशित 2026-07-16
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ रोबोट अविश्वसनीय रूप से प्रतिभाशाली लेकिन थोड़े अनाड़ी शेफ की तरह हैं। वे सब्जियां काटने में एकदम सटीक हो सकते हैं यदि रसोई खाली हो और रोशनी तेज़ हो, लेकिन जैसे ही आप उनसे एक अंधेरे, भीड़भाड़ वाले पेंट्री में स्पैगेटी की उलझी हुई गांठ को सुलझाने के लिए कहते हैं, वे सुन्न पड़ जाते हैं। यह "डेक्सट्रस मैनिपुलेशन" (dexterous manipulation)—यानी रोबोटिक्स में हाथ की कुशलता—की वर्तमान स्थिति है, जो मानव हाथ की तरह नाजुक, लचीली या कसकर पैक की गई वस्तुओं को संभालने की क्षमता है। दशकों से, वैज्ञानिकों ने रोबots को यह सिखाने की कोशिश की है कि वे ऐसा कैसे करें, इसके लिए जटिल नियम पुस्तिकाएं लिखकर: "यदि आप एक लाल तार देखते हैं, तो बाईं ओर बढ़ें; यदि आपको प्रतिरोध महसूस होता है, तो रुक जाएं।" लेकिन वास्तविक जीवन अव्यवस्थित है। तार मुड़ जाते हैं, लाइटें टिमटिमाती हैं, और कनेक्टर्स तंग जगहों में फंसे होते हैं। बड़ा सवाल सिर्फ यह नहीं है कि "क्या एक रोबोट यह कर सकता है?" बल्कि यह है कि "क्या एक रोबोट इसे उतनी ही आसानी से सीख सकता है जैसे कि एक इंसान अपने जूते के फीते बांधना सीखता है, बिना हर नए कार्य के लिए हजारों पन्नों के निर्देशों की आवश्यकता के?"

यह शोध पत्र, जिसका शीर्षक "इंडस्ट्रियल डेक्सटेरिटी बेंचमार्क" (Industrial Dexterity Benchmark) है, ठीक इसी समस्या पर काम करता है। शोधकर्ताओं ने रोबोटों के परीक्षण करने का एक नया तरीका, उनके सीखने के लिए एक नया "मस्तिष्क", और प्रशिक्षण अभ्यासों का एक नया सेट बनाया। रोबोट को चरण-दर-चरण प्रोग्राम करने के बजाय, उन्होंने इसे एक इंसान को काम करते हुए कुछ बार देखने दिया और फिर उस अहसास और गति की नकल करने की कोशिश करने दी। उन्होंने पाया कि जब रोबोट को दुनिया को कई तरीकों से "देखने" की अनुमति दी जाती है (जैसे कि अपनी आँखों का उपयोग करना और हाथों से महसूस करना) और वह नकल (imitation) के माध्यम से सीखता है, तो वह पुराने, नियम-आधारित तरीकों की तुलना में कठिन कार्यों में बहुत बेहतर हो जाता है। विशेष रूप से, उन्होंने दिखाया कि एक रोबोट एक भीड़भाड़ वाले डेटा सेंटर में एक केबल को साफ करने और उसे फिर से प्लग करने का काम केवल 100 बार एक इंसान को देखने के बाद 78% सफलता दर के साथ सीख सकता है, जबकि पुराने तरीके शुरू करने में भी संघर्ष कर रहे थे।

समस्या: वास्तविक दुनिया का "उलझा हुआ जाल"

एक आधुनिक डेटा सेंटर को एक विशाल, उच्च-तकनीकी लाइब्रेरी के रूप में सोचें जहाँ किताबें वास्तव में केबल हैं। ये केबल इतनी बारीकी से पैक किए गए हैं कि उनके बीच एक इंच की भी जगह नहीं है। यदि किसी इंसान को केबल बदलना या कनेक्टर साफ करना हो, तो उसे बेहद सावधान रहना पड़ता है। एक गलत चाल, और वह अपने पड़ोसी का केबल ढीला कर सकता है, जिससे पूरा सिस्टम क्रैश हो सकता है। वर्षों से, रोबोट इस काम में बहुत खराब रहे हैं। वे खाली मेज से एक बॉक्स उठाने में माहिर हैं, लेकिन दूसरों को परेशान किए बिना एक दराज से एक विशिष्ट मोज़ा निकालने में बहुत खराब हैं।

इसे हल करने का पुराना तरीका एक "नियम पुस्तिका" बनाना था। इंजीनियर रोबोट को बताते थे: "पहले, एक मार्कर खोजें। फिर, कोण की गणना करें। फिर, अपनी बांह को ठीक 5 मिलीमीटर आगे बढ़ाएं।" यह एक आदर्श लैब में काम करता था, लेकिन जैसे ही रोशनी बदलती या कोई केबल थोड़ा हिल जाता, रोबोट भ्रमित हो जाता और विफल हो जाता। यह एक ऐसे मानचित्र का उपयोग करके शहर में नेविगेट करने जैसा था जो केवल तभी काम करता है जब सूरज सीधे ऊपर चमक रहा हो।

नया दृष्टिकोण: देखकर सीखना

इस शोध पत्र के लेखकों ने एक अलग दृष्टिकोण अपनाने का निर्णय लिया। नियम पुस्तिका लिखने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया जो रोबोट को नकल के माध्यम से सीखने की अनुमति देता है, बिल्कुल वैसे ही जैसे एक बच्चा अपने माता-पिता को देखते हुए साइकिल चलाना सीखता है। उन्होंने इसे संभव बनाने के लिए तीन मुख्य उपकरण पेश किए:

  1. "ट्रेनिंग जिम" (IDB बोर्ड्स): उन्होंने तीन अलग-अलग भौतिक बोर्ड बनाए जो प्रशिक्षण बाधाओं के रूप में कार्य करते हैं। एक डेटा सेंटर के भीड़भाड़ वाले केबलों की नकल करता है, दूसरा कार के अंदर की उलझी हुई वायरिंग जैसा दिखता है, और तीसरा एक छोटा गियरबॉक्स असेंबली है। ये बोर्ड "जिम" हैं जहाँ रोबोट अभ्यास करता है। यह शोध पत्र मुख्य रूप से डेटा सेंटर बोर्ड पर केंद्रित है, जहाँ रोबोट को एक केबल को अनप्लग करना, उसे सफाई पैड के खिलाफ रगड़ना और बिना किसी चीज़ को गिराए उसे वापस प्लग करना होता है।
  2. "लर्निंग फ्रेमवर्क" (DAG-ROS): यह वह सॉफ्टवेयर है जो रोबोट की आँखों, हाथों और मस्तिष्क को जोड़ता है। यह एक इंसान को रोबोट का नियंत्रण लेने (टेलीऑपरेशन) और कार्य करने की अनुमति देता है, जबकि सिस्टम हर चाल, हर कैमरा दृश्य और दबाव के हर अंश को रिकॉर्ड करता है। यह एक वीडियो गेम रिप्ले सिस्टम की तरह है जो इंसान के बेहतरीन प्रदर्शन के हर फ्रेम को सहेज लेता है ताकि रोबोट बाद में उसका अध्ययन कर सके।
  3. "स्मार्ट ब्रेन" (AG-iDP3): यह मुख्य आकर्षण है। यह एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जिसे "डिफ्यूजन पॉलिसी" (diffusion policy) कहा जाता है। एक ऐसे रोबोट की कल्पना करें जो क्या करना है इसके बारे में एक धुंधले, रैंडम अनुमान से शुरू होता है, और फिर धीरे-धीरे उस अनुमान को "डीनोइज़" (denoise) करता है, यानी उसे स्टेप-बाय-स्टेप रिफाइन करता है, जब तक कि वह एक स्पष्ट, सुचारू गति में न बदल जाए। यह मस्तिष्क केवल एक तस्वीर नहीं देखता; यह कई इंद्रियों को जोड़ता है। यह कलाई पर लगे कैमरे, एक वाइड-एंगल कैमरे और एक डेप्थ सेंसर (जो 3D में देखता है) के साथ दृश्य को देखता है, और साथ ही अपनी कलाई में दबाव को भी महसूस करता है। यह तय करने के लिए कि कैसे हिलना है, यह सारी जानकारी को मिला देता है।

प्रयोग: छह रोबोटों की दौड़

यह देखने के लिए कि क्या यह नया "स्मार्ट ब्रेन" वास्तव में काम करता है, शोधकर्ताओं ने एक दौड़ आयोजित की। उन्होंने डेटा सेंटर केबल कार्य पर रोबोट के छह अलग-अलग "विज़न सिस्टम" संस्करणों का परीक्षण किया। कुछ रोबोटों में केवल एक कैमरा था, कुछ में दो, कुछ में डेप्थ सेंसर थे, और कुछ में इन सबका मिश्रण था। उन्होंने प्रत्येक सेटअप के लिए 48 परीक्षण चलाए।

परिणाम स्पष्ट थे। जिस रोबट ने केवल एक कैमरे (पुराने तरीके) पर भरोसा किया, वह केवल 36% समय सफल रहा। यह एक आँख पर पट्टी बांधकर सुई में धागा पिरोने जैसा था। हालाँकि, जिस रोबोट ने "मल्टीमॉडल" दृष्टिकोण अपनाया—जिसमें कलाई का कैमरा, एक सीन कैमरा और 3D डेप्थ डेटा शामिल था—वह 78% समय सफल रहा।

मुख्य निष्कर्ष यह था कि 3D संदर्भ (context) होना महत्वपूर्ण था। जब रोबोट के पास केबलों की गहराई (या तो 3D सेंसर के माध्यम से या दो कैमरों का उपयोग करके अलग-अलग कोणों से देखना) देखने की क्षमता थी, तो वह केबल को लगभग पूरी तरह से पकड़ सका (88-98% सफलता)। लेकिन असली जादू "इन्सर्ट" (insert) चरण के दौरान हुआ। मल्टीमॉडल रोबोट, अन्य की तुलना में छोटे कनेक्टर को तंग पोर्ट के साथ बेहतर ढंग से संरेखित (align) कर सका। दिलचस्प बात यह है कि एक विशिष्ट प्रकार के 3D सेंसर (Time-of-Flight) का उपयोग करने वाला रोबोट इस औद्योगिक सेटिंग में मानक स्टीरियो कैमरा की तुलना में बेहतर प्रदर्शन कर गया, जो बताता है कि दो फ्लैट छवियों से गहराई का अनुमान लगाने के बजाय सीधे "गहराई" को देखना अधिक विश्वसनीय है।

यह क्यों मायने रखता है

यह शोध पत्र तर्क देता है कि यह नया दृष्टिकोण औद्योगिक स्वचालन (industrial automation) के लिए एक गेम-चेंजर है। पुराने तरीके में इंजीनियरों को हर नए कार्य के लिए हजारों घंटों तक छवियों को लेबल करने और पैरामीटर को ट्यून करने की आवश्यकता होती थी। इस नए सिस्टम के साथ, रोबोट को इसे अच्छी तरह से सीखने के लिए केवल लगभग 100 प्रदर्शनों (लगभग 100 बार इंसान को कार्य करते हुए देखना) की आवश्यकता थी।

शोधकर्ताओं ने यह भी नोट किया कि सिस्टम अभी भी पूर्ण नहीं है। रोबोट कभी-कभी "ब्रिटल" (brittle) था, जिसका अर्थ है कि यदि प्रशिक्षण के दौरान देखे गए किसी यादृच्छिक (random) ऑब्जेक्ट ने बैकग्राउंड में उपस्थिति दर्ज कराई, तो वह भ्रमित हो सकता था। हालाँकि, उन्होंने दिखाया कि केवल कार्य क्षेत्र पर ध्यान केंद्रित करने के लिए कैमरा व्यू को क्रॉप करने से, वे इसे ठीक कर सकते थे।

निष्कर्ष

यह शोध पत्र सुझाव देता है कि औद्योगिक रोबोटों का भविष्य बेहतर नियम पुस्तिकाएं लिखने के बारे में नहीं है, बल्कि उन्हें इंसानों की तरह दुनिया को "महसूस" करने और "देखने" के लिए सिखाने के बारे में है। कई इंद्रियों को मिलाने और मानव नकल की नकल करने वाली सीखने की विधि का उपयोग करके, रोबोट उन कठिन, तंग और नाजुक कार्यों को संभाल सकते हैं जिन्होंने दशकों से उन्हें कारखानों से बाहर रखा है। हालांकि यह शोध पत्र यह दावा नहीं करता है कि इसने रोबोटिक्स की हर समस्या को हल कर दिया है, लेकिन यह रोबोट को वास्तविक दुनिया में काम करने के लिए पर्याप्त कुशल बनाने के लिए एक मजबूत, पुनरुत्पादक (reproducible) रेसिपी प्रदान करता है, जो "अनाड़ी शेफ" को थोड़े से अभ्यास के साथ एक सक्षम प्रशिक्षु में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →