RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation
RoboCousin एक विस्तार योग्य सिमुलेशन प्लेटफॉर्म है जो उपयोगकर्ता द्वारा प्रदान किए गए ऑब्जेक्ट ऑब्जर्वेशन को विविध, भौतिकी-सटीक एसेट्स और विशेषज्ञ प्रक्षेप पथों (expert trajectories) में स्वचालित रूप से परिवर्तित करता है, जो प्रभावी सिम-टू-रियल ट्रांसफर के साथ द्विपक्षीय रोबोटिक मैनिपुलेशन के लिए स्केलेबल और सुदृढ़ डेटा जनरेशन को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोट को इंसान की तरह दो हाथों का उपयोग करना सिखाना आधुनिक रोबोटिक्स की सबसे कठिन चुनौतियों में से एक है। कपड़े तह करने, जार खोलने या भारी बक्सा उठाने जैसे जटिल कार्यों को सीखने के लिए, एक रोबोट को इसे करने के हजारों उदाहरणों को देखने की आवश्यकता होती है। वास्तविक दुनिया में, इन उदाहरणों को एकत्र करना धीमा, महंगा और अक्सर खतरनाक होता है। यदि रोबोट से कांच का गिलास गिर जाता है, तो वह टूट जाता है; यदि वह बर्तनों के ढेर को गिरा देता है, तो उसकी सफाई एक बड़ी समस्या बन जाती है। इस कारण से, वैज्ञानिकों ने कंप्यूटर सिमुलेशन का रुख किया है। वे आभासी दुनिया (virtual worlds) बनाते हैं जहाँ रोबोट बिना कुछ तोड़े लाखों बार अभ्यास कर सकता है। हालाँकि, एक बड़ी समस्या इस क्षेत्र को पीछे खींच रही है: अधिकांश सिमुलेशन निश्चित फर्नीचर वाले बंद कमरों की तरह होते हैं। आप रोबोट को कमरे में जितना चाहें उतना घुमा सकते हैं, लेकिन आप आसानी से कोई नई वस्तु, जैसे कि उपयोगकर्ता का विशिष्ट कॉफी मग, नहीं जोड़ सकते या कमरे के लेआउट को नहीं बदल सकते। ऐसा करने के लिए, एक मानव इंजीनियर को आमतौर पर वस्तु के आकार को फिर से बनाने, उसकी भारीपन को परिभाषित करने और यह निर्धारित करने में घंटों समय बिताना पड़ता है कि रोबोट की उंगलियां उसे ठीक कहाँ छूनी चाहिए। यह मैन्युअल कार्य इतना धीमा है कि यह रोबोटों को वास्तव में अनुकूलन योग्य बनाने के लिए आवश्यक विशाल, विविध डेटासेट बनाने में बाधा डालता है।
शोधकर्ताओं की एक टीम ने 'रोबोकज़िन' (RoboCousin) नामक एक नई प्रणाली पेश की है जो सिमुलेशन को एक खुले, विस्तार योग्य वर्कशॉप में बदलकर इस बाधा को दूर करती है। वस्तुओं की एक पूर्व-चयनित सूची से ही रोबोट को सीखने के लिए मजबूर करने के बजाय, यह प्रणाली उपयोगकर्ता को किसी भी वस्तु की एक साधारण तस्वीर लेने या कमरे के विवरण से उसे तुरंत एक यथार्थवादी, इंटरैक्टिव 3D मॉडल में बदलने की अनुमति देती है जिससे रोबोट अभ्यास कर सके। यह प्रणाली केवल एक सुंदर चित्र नहीं बनाती है; यह स्वचालित रूप से वस्तु के भौतिक गुणों, जैसे कि उसका वजन और उसकी सतह कितनी फिसलन भरी है, का पता लगाती है, और यह गणना करती है कि रोबोट के ग्रिपर्स को उसे पकड़ने के लिए सबसे अच्छी जगहें कौन सी हैं। यह प्रक्रिया एक सपाट छवि को एक "डिजिटल कज़िन" (digital cousin) में बदल देती है—एक आभासी संस्करण जो वास्तविक चीज़ जैसा दिखता है और व्यवहार करता है, लेकिन अन्य वस्तुओं और पृष्ठभूमियों के साथ मिश्रित होने के लिए पर्याप्त लचीला है ताकि नए प्रशिक्षण परिदृश्य बनाए जा सकें।
शोधकर्ताओं ने इस प्रणाली को एक मौजूदा सिमुलेशन प्लेटफॉर्म पर बनाया है और इसमें एक ऐसा पाइपलाइन जोड़ा है जो प्रारंभिक फोटो से लेकर अंतिम रोबोट मूवमेंट तक सब कुछ संभालता है। जब उपयोगकर्ता किसी वस्तु की छवि प्रदान करता है, तो प्रणाली पहले उसे पृष्ठभूमि से अलग करती है और उसके त्रि-आयामी आकार का पुनर्निर्माण करती है। फिर यह वस्तु के भौतिक गुणों, जैसे कि उसके द्रव्यमान (mass) और घर्षण (friction) का अनुमान लगाने के लिए कृत्रिम बुद्धिमत्ता (AI) का उपयोग करती है, जिससे रोबोट उसके साथ यथार्थवादी तरीके से बातचीत कर सके। महत्वपूर्ण रूप से, प्रणाली स्वचालित रूप से "कॉन्टैक्ट पॉइंट्स" (contact points) की पहचान करती है, जो वस्तु पर वे विशिष्ट स्थान हैं जहाँ रोबोट का हाथ सुरक्षित और प्रभावी ढंग से पकड़ बना सकता है। पारंपरिक सेटअप में, एक इंसान को हर एक वस्तु के लिए इन स्थानों को मैन्युअल रूप से चिह्नित करना पड़ता था, जो एक थकाऊ प्रक्रिया है और जो कितनी भी वस्तुएं जोड़ी जा सकती हैं, इसे सीमित करती है। इस नई प्रणाली में, कंप्यूटर यह काम तुरंत कर देता है। परिणाम स्वरूप 3,000 से अधिक विभिन्न वस्तुओं और 50 अलग-अलग बैकग्राउंड वातावरणों की एक लाइब्रेरी तैयार है, जो रोबोट के उपयोग के लिए तैयार है।
प्रशिक्षण को और अधिक मजबूत बनाने के लिए, यह प्रणाली "डिजिटल कज़िन्स" बनाती है। जबकि एक "डिजिटल ट्विन" (digital twin) वास्तविक दृश्य की एक सटीक, कठोर प्रति है, एक "डिजिटल कज़िन" एक भिन्नता है जो महत्वपूर्ण संबंधों को बनाए रखती है लेकिन विवरणों को बदल देती है। उदाहरण के लिए, यदि रोबोट को मेज से बोतल उठाने का सीखना है, तो प्रणाली एक ऐसा दृश्य बना सकती है जहाँ बोतल का रंग अलग हो, मेज की सामग्री अलग हो, या पृष्ठभूमि लिविंग रूम के बजाय किचन हो, जब तक कि बोतल अभी भी मेज पर इस तरह से रखी हो जो तर्कसंगत हो। यह दृष्टिकोण रोबोट को केवल एक विशिष्ट सेटअप को याद करने के बजाय कार्य की मूल अवधारणा को सिखाता है। यह प्रणाली कमरे के स्तर तक भी स्केल होती है। यह एक मोबाइल रोबोट के लिए एक आभासी घर के माध्यम से नेविगेट करने, एक मेज के पास पहुँचने और फिर मैनिपुलेशन कार्य करने के लिए पथ की योजना बना सकती है, और यह सब एक निरंतर सिमुलेशन के भीतर होता है। यह रोबोट को न केवल अपने हाथों को चलाने, बल्कि कार्य तक पहुँचने के लिए अपने पूरे शरीर को चलाने के बारे में भी सीखने की अनुमति देता है।
टीम ने परीक्षण किया कि क्या यह स्वचालित दृष्टिकोण वास्तव में वास्तविक दुनिया में काम करता है। उन्होंने इस प्रणाली का उपयोग करके दस लाख से अधिक प्रशिक्षण प्रक्षेपवक्र (trajectories) उत्पन्न किए और फिर एक भौतिक दो-हाथों वाले रोबोट को विशिष्ट कार्य करने के लिए प्रशिक्षित किया। परिणाम आश्चर्यजनक थे। जब रोबोट को उन वस्तुओं पर प्रशिक्षित किया गया जिन्हें प्रणाली ने छवियों से स्वचालित रूप से पुनर्गठित किया था, तो इसने उन वस्तुओं की तुलना में समान या कुछ मामलों में बेहतर प्रदर्शन किया जिन्हें मानव विशेषज्ञों द्वारा सावधानीपूर्वक तैयार किया गया था। उदाहरण के लिए, बोतल उठाने के कार्य में, नई प्रणाली के एसेट्स का उपयोग करने पर सफलता दर 40 प्रतिशत से बढ़कर 80 प्रतिशत हो गई। इसके अलावा, जब रोबोट को एक एकल सटीक कमरे के बजाय विभिन्न "कज़िन" दृश्यों पर प्रशिक्षित किया गया, तो वह नई स्थितियों को संभालने में बहुत बेहतर हो गया। चश्मे के केस (eyeglass case) को उठाने के एक परीक्षण में, एक एकल सटीक दृश्य पर प्रशिक्षित रोब manera पूरी तरह से विफल रहा, जबकि विविध कज़िन दृश्यों पर प्रशिक्षित रोबोट 55 प्रतिशत बार सफल हुआ।
शोधकर्ताओं ने यह भी सत्यापित किया कि किसी वस्तु को पकड़ने के लिए कंप्यूटर के स्वचालित अनुमान कितने सटीक थे। उन्होंने सिस्टम द्वारा सुझाए गए ग्रैब पॉइंट्स की तुलना उन बिंदुओं के सेट से की जिन्हें मनुष्यों द्वारा सावधानीपूर्वक चिह्नित किया गया था। कंप्यूटर के सुझाव थोड़े बेहतर थे, जिसने सिमुलेशन में 72 प्रतिशत मानव-चिह्नित बिंदुओं की तुलना में 76 प्रतिशत की सफलता दर हासिल की। यह सिद्ध करता है कि सिस्टम वस्तुओं को एनोटेट करने की धीमी, मैन्युअल प्रक्रिया को एक तेज़, स्वचालित प्रक्रिया से बदल सकता है जो कम से कम उतनी ही विश्वसनीय है। वास्तविक दुनिया के अवलोकनों को सिमुलेशन एसेट्स में बदलने की क्षमता को प्रशिक्षण परिदृश्यों उत्पन्न करने की क्षमता से जोड़कर, RoboCousin एक व्यावहारिक मार्ग प्रदान करता है। यह सुझाव देता है कि रोबोट लर्निंग का भविष्य इस बात पर निर्भर नहीं है कि इंजीनियरों को हर नई वस्तु को हाथ से बनाने का इंतजार करना पड़े, बल्कि यह उन प्रणालियों पर निर्भर है जो तुरंत उस बिखरी हुई और विविध दुनिया को समझ और अनुकूलित कर सकें जिसमें हम रहते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।