RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation
यह शोध पत्र RoboCOIN को प्रस्तुत करता है, जो 16 वातावरणों में 15 विविध रोबोटिक प्लेटफॉर्म से एकत्र किए गए 1,80,,000 से अधिक द्विपक्षीय हेरफेर (bimanual manipulation) प्रदर्शनों का एक बड़े पैमाने का, ओपन-सोर्स डेटासेट है, जिसमें मल्टी-एम्बॉडिमेंट हेरफेर अनुसंधान को आगे बढ़ाने के लिए एक पदानुक्रमित क्षमता पिरामिड (hierarchical capability pyramid) और CoRobot प्रोसेसिंग पाइपलाइन शामिल है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि तीन-कोर्स वाला डिनर। यदि आप केवल रोबोट को एक हाथ से सब्जियां काटना सिखाते हैं, तो उसे संघर्ष करना पड़ेगा जब उसे एक हाथ से बर्तन पकड़ने और दूसरे हाथ से चलाने की आवश्यकता होगी। यह बाइमैनुअल मैनिपुलेशन (दो हाथों का उपयोग करना) की चुनौती है।
लंबे समय तक, रोबोट ऐसे छात्रों की तरह रहे हैं जिनके पास केवल एक ही पाठ्यपुस्तक है: वे एक विशिष्ट रोबोटिक हाथ पर सीखते हैं, और जब आप उन्हें एक अलग रोबोट के साथ एक नए किचन में रखते हैं, तो वे भ्रमित हो जाते हैं।
RoboCOIN ज्ञान का एक विशाल नया "लाइब्रेरी" (पुस्तकालय) है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यहाँ इस पेपर का एक सरल विवरण दिया गया, रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: बहुत सारे अलग-अलग "हाथ"
रोबोट की दुनिया को ऐसे सोचें जैसे कि 15 अलग-अलग प्रकार के हाथों वाली दुनिया। कुछ इंसानी हाथों जैसे दिखते हैं, कुछ सिर्फ दो धातु के पंजे हैं, और कुछ आधे मानव रूपी हैं।
- समस्या: पहले, यदि आपने "पंजों A" वाले रोबोट को शर्ट फोल्ड करना सिखाया, तो वह "पंजों B" को यह नहीं सिखा सकता था। डेटा अच्छी तरह से ट्रांसफर नहीं हो पाता था क्योंकि हार्डवेयर बहुत अलग था।
- समाधान: शोधकर्ताओं ने RoboCOIN नामक एक डेटासेट बनाया जिसमें 15 अलग-अलग प्रकार के रोबोटों से 1,80,000 प्रदर्शन (demonstrations) शामिल हैं। यह 15 अलग-अलग शेफ (एक इंसान, एक मशीन, पंजों वाला एक रोबोट, आदि) को इकट्ठा करने और उन सभी को एक ही 421 अलग-अलग रेसिपी पकाते हुए रिकॉर्ड करने जैसा है। यह AI को सिखाता है कि "तौलिया मोड़ना" वही अवधारणा है, चाहे आप इसे उंगलियों से करें या धातु के ग्रिपर्स से।
2. गुप्त नुस्खा (The Secret Sauce): "क्षमता पिरामिड" (Capability Pyramid)
अधिकांश रोबोट डेटा केवल एक कच्चा वीडियो फीड होता है: रोबोट का हाथ बाएं गया, फिर दाएं गया, फिर पकड़ा। यह बिना सबटाइटल या स्क्रिप्ट के फिल्म देखने जैसा है। आप देखते हैं कि क्या हुआ, लेकिन आप नहीं जानते कि क्यों हुआ।
RoboCOIN एक Hierarchical Capability Pyramid जोड़ता है, जो फिल्म में डायरेक्टर के कमेंट्री जोड़ने जैसा है। यह हर कार्य को तीन स्तरों में तोड़ देता है:
- स्तर 1 (बड़ी तस्वीर): "लक्ष्य आड़ू (peach) को टोकरी में रखना है।" (यह रोबोट को कहानी समझने में मदद करता है)।
- स्तर 2 (अध्याय): "पहले, आड़ू को पकड़ें। दूसरा, इसे उठाएं। तीसरा, इसे टोकरी के ऊपर ले जाएं।" (यह कहानी को दृश्यों में तोड़ता है)।
- स्तर 3 (फ्रेम): "हाथ को धीरे से नीचे ले जाएं, फिर ग्रिपर को बंद करें।" (यह हर एक सेकंड के लिए सटीक स्क्रिप्ट है)।
रोबोट को तीनों स्तरों पर सिखाकर, यह न केवल यह सीखता है कि कैसे हिलना है, बल्कि यह भी कि कार्य के बारे में कैसे सोचना है।
3. गुणवत्ता नियंत्रण: "ट्रैफिक पुलिस" (RTML)
जब इंसान रोबोट के लिए डेटा रिकॉर्ड करते हैं, तो वे गलतियाँ करते हैं। कभी-कभी वे बहुत तेज़ चलते हैं, कभी-कभी वे वस्तु गिरा देते हैं, या कभी-कभी वे अजीब या झटकेदार तरीके से चलते हैं। यदि आप रोबोट को खराब डेटा के साथ सिखाते हैं, तो रोबोट बुरी आदतें सीख लेता है।
टीम ने RTML (रोबोट ट्रेजेक्टरी मार्कअप लैंग्वेज) नामक एक टूल बनाया है। इसे रोबोटिक गतिविधियों के लिए एक सख्त ट्रैफिक पुलिस या स्पेल-चेकर के रूप में समझें।
- यह हर रिकॉर्डिंग को स्वचालित रूप से स्कैन करता है।
- यदि किसी इंसान ने अपना हाथ बहुत तेज़ी से हिलाया (सुरक्षा नियमों का उल्लंघन किया), तो ट्रैफिक पुलिस उसे फ्लैग कर देती है।
- यदि रोब सहित वस्तु गिरा दी, तो ट्रैफिक पुलिस उसे "निम्न गुणवत्ता" के रूप में चिह्नित करती है।
- परिणाम: उन्होंने लगभग 35% खराब डेटा को फ़िल्टर कर दिया। इसका मतलब है कि रोबोट "ए-लिस्ट" प्रदर्शनों से सीख रहे हैं, न कि उनकी गलतियों (bloopers) से।
4. "यूनिवर्सल ट्रांसलेटर" (CoRobot)
बेहतरीन डेटा होने के बावजूद, इसका उपयोग करना कठिन है क्योंकि प्रत्येक रोबोट एक अलग "भाषा" बोलता है (अलग सॉफ्टवेयर, अलग कैमरे, अलग मोटर्स)।
- टीम ने CoRobot बनाया, जो एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है।
- हर रोबोट के लिए अलग मैनुअल की आवश्यकता के बजाय, आप बस
pip install robocoin(एक सरल कंप्यूटर कमांड) टाइप करते हैं, और CoRobot डेटा को अनुवादित करता है ताकि कोई भी रोबोट इसे समझ सके। यह एक यूनिवर्सल रिमोट कंट्रोल होने जैसा है जो दुनिया के हर टीवी ब्रांड पर काम करता है।
5. परिणाम: रोबोट हो रहे हैं स्मार्ट
जब उन्होंने इस नई लाइब्रेरी का परीक्षण उन रोबोटों पर किया जिन्हें उन्होंने पहले कभी नहीं देखा था:
- सिमुलेशन: जो रोबोट पहले जटिल कार्यों (जैसे ब्लॉक को स्टैक करना या कटोरा पास करना) में विफल रहे थे, उनके सफलता दर में 75% से 200% तक की वृद्धि देखी गई।
- वास्तविक दुनिया: यहाँ तक कि जब रोशनी बदल गई या वस्तुएं अलग दिखने लगीं, तब भी RoboCOIN पर प्रशिक्षित रोबोट बहुत अधिक मजबूत (robust) थे। वे एक "नए" कटोरे से भ्रमित नहीं हुए; वे कटोरे की अवधारणा को जानते थे।
सारांश उपमा (Summary Analogy)
कल्पमान कीजिए कि आप टेनिस सीखना चाहते हैं।
- पुराना तरीका: आप क्ले कोर्ट पर एक प्रो खिलाड़ी को देखते हैं। आप घास पर खेलने की कोशिश करते हैं, और आप विफल हो जाते हैं क्योंकि गेंद अलग तरह से उछलती है।
- RoboCOIN तरीका: आप 15 अलग-अलग प्रोफेशनल्स को देखते हैं (कुछ क्ले पर, कुछ घास पर, कुछ हार्ड कोर्ट पर) जो 400 अलग-अलग तरह के शॉट्स खेलते हैं। साथ ही, आपके पास एक कोच (पिरामिड) है जो यह समझाता है कि वे रैकेट क्यों घुमाते हैं, और एक वीडियो एडिटर (RTML) है जो गलतियों को काट देता है।
- परिणाम: अब आप किसी भी कोर्ट पर, किसी भी रैकेट के साथ, एक प्रो की तरह खेल सकते हैं।
संक्षेप में: RoboCOIN एक विशाल, उच्च-गुणवत्ता वाली, मल्टी-रोबोट लाइब्रेरी है जो रोबोटों को दो हाथों का एक साथ उपयोग करना, कार्यों को गहराई से समझना और नई स्थितियों के अनुकूल होना सिखाती है, जिससे वे वास्तविक दुनिया में बहुत अधिक सक्षम बन जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।