Contact-Guided Exploration for Non-Prehensile Locomanipulation with Multi-Critic RL
यह शोधपत्र नॉन-प्रिहेंसिल मैनिपुलेशन (non-prehensile manipulation) में जटिल हाइब्रिड डायनेमिक्स और विरल संपर्क (sparse contact) की चुनौतियों से निपटने के लिए एक मल्टी-क्रिटिक रीइन्फोर्समेंट लर्निंग फ्रेमवर्क के भीतर एक कॉन्टैक्ट-गाइडेड एक्सप्लोरेशन रणनीति का प्रस्ताव करता है, जो एक वास्तविक दुनिया के क्वाड्रुपेडल मोबाइल मैनिपुलेटर पर चेयर ट्रांसपोर्टेशन जैसे कार्यों के लिए तैनात करने योग्य कौशल को सफलतापूर्वक प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से कारखाने के फर्श के उस्ताद रहे हैं, जहाँ वे भारी पुर्जों को उठाते हैं और उन्हें पूर्ण सटीकता के साथ रखते हैं। लेकिन उस नियंत्रित वातावरण से बाहर निकलकर यदि आप किसी घर या गोदाम में कदम रखें, तो नियम बदल जाते हैं। यहाँ, वस्तुएं अक्सर उठाने के लिए बहुत भारी या ग्रिपर से पकड़ने के लिए बहुत अजीब होती हैं। एक भारी आर्मचेयर या एक बड़े बक्से को हिलाने के लिए, एक रोबोट उसे केवल उठा नहीं सकता; उसे उसे फर्श पर धकेलना, खींचना या खिसकाना होगा। इसे 'नॉन-प्रीहेन्साइल मैनिपुलेशन' (non-prehensile manipulation) के रूप में जाना जाता है। यह एक कठिन कौशल है क्योंकि इसकी भौतिकी काफी जटिल है। किसी वस्तु को पकड़ने के विपरीत, जहाँ संपर्क ठोस होता है, धकेलना घर्षण और संपर्क के कोण पर निर्भर करता है। यदि रोबोट गलत कोण पर धक्का देता है, तो वस्तु फिसल सकती है, पलट सकती है, या रोबोट अपना संतुलन खो सकता है। वर्षों तक, इंजीनियरों ने रोबोट को यह सिखाने के लिए संघर्ष किया कि बिना टकराए या वस्तु को हिलाने में विफल हुए, संपर्क के इस नाजुक नृत्य को कैसे संचालित किया जाए।
शोधकर्ताओं की एक टीम ने अब इन कौशलों को सिखाने का एक नया तरीका विकसित किया है, जो रोबोट की सीखने की प्रक्रिया को बिल्कुल शुरुआत से ही निर्देशित करता है। रोबोट को तब तक बेतरतीब ढंग से अनुमान लगाने देने के बजाय कि वह गलती से किसी वस्तु को धकेलने का तरीका खोज ले, शोधकर्ताओं ने उसे एक नक्शा दिया कि कहाँ स्पर्श करना है। उन्होंने एक कंप्यूटर एल्गोरिदम का उपयोग करके वस्तु पर संपर्क करने के लिए सबसे तार्किक स्थानों की पहचान की, जैसे कि कुर्सी के पैर या डिशवॉशर का हैंडल। फिर उन्होंने एक प्रशिक्षण प्रणाली बनाई जो रोबोट को इन विशिष्ट स्थानों को खोजने के लिए पुरस्कृत करती है। हालाँकि, वे जानते थे कि यदि रोबोट केवल सही स्थान को छूने पर ही ध्यान देगा, तो वह वास्तव में वस्तु को उसके गंतव्य तक पहुँचाना कभी नहीं सीख पाएगा। इसे हल करने के लिए, उन्होंने एक लर्निंग शेड्यूल बनाया जो संपर्क बिंदु खोजने पर भारी ध्यान केंद्रित करने से शुरू होता है और धीरे-धीरे उस ध्यान को कम करता जाता है, जिससे रोबोट को एक अच्छा ग्रिप स्थापित करने के बाद वस्तु को कुशलतापूर्वक चलाने के लिए मजबूर किया जा सके।
शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण एक चार पैरों वाले रोबोट पर किया जो एक हाथ (आर्म) से लैस था—एक ऐसी मशीन जिसे वस्तुओं का हेरफेर करते हुए ऊबड़-खाबड़ रास्तों पर चलने के लिए डिज़ाइन किया गया है। अपने सिमुलेशन में, रोबोट ने बक्सों को धकेलना और कुर्सियों को विशिष्ट स्थानों तक पहुँचाना सीखा। परिणामों ने दिखाया कि इस निर्देशित दृष्टिकोण के बिना, रोबोट अक्सर वस्तु को छूने में भी विफल रहता था, या वह उसे इस तरह से धकेलता था जिससे वह पलट जाती थी। उनके तरीके का उपयोग करके, रोबोट ने नब्बे प्रतिशत से अधिक परीक्षणों में सफलतापूर्वक वस्तुओं को स्थानांतरित किया। महत्वपूर्ण रूप से, रोबोट ने वस्तु को स्थिर रखने के लिए अपने शरीर और हाथ को समायोजित करना सीखा, और अक्सर भारी फर्नीचर को गिरने से बचाने के लिए अपने स्वयं के गुरुत्वाकर्षण केंद्र को नीचे की ओर झुकाया।
असली परीक्षा तब आई जब शोधकर्ताओं ने रोबro को कंप्यूटर से बाहर निकालकर वास्तविक दुनिया में उतारा। उन्होंने रोबोट को विभिन्न कुर्सियों के सामने रखा जिन्हें उसने पहले कभी नहीं देखा था, जिनमें से कुछ तीन पैरों वाली थीं और कुछ फोल्डिंग तंत्र वाली थीं। आकार और वजन में अंतर के बावजूद, रोबोट ने उन्हें सफलतापूर्वक उनके लक्ष्यों तक धकेला और खींचा। एक प्रयोग में, उन्होंने कुर्सी में अतिरिक्त वजन जोड़ा, जिससे वह रोबोट के हाथ की तकनीकी क्षमता से भी अधिक भारी हो गई। रोबोट ने फिर भी इसे हिलाने में सफलता प्राप्त की क्योंकि उसने काम करने के लिए अपने पैरों और जमीन का सहारा लिया, जिससे सिद्ध हुआ कि उसने काम करने के लिए अपने पूरे शरीर का उपयोग करना सीख लिया है। रोबोट ने गलतियों से उबरने की क्षमता भी दिखाई; यदि वह फिसला या संपर्क खो गया, तो वह स्वचालित रूप से खुद को पुनर्गठित करता और बिना रुके फिर से प्रयास करता।
शोधकर्ताओं ने इस तकनीक को एक अधिक जटिल कार्य पर भी लागू किया: एक डिशवॉशर खोलना। इस वस्तु में चलते हुए हिस्से होते हैं, जिसके लिए रोबोट को पहले हैंडल पकड़ना होता है और फिर दरवाजे के पैनल को धकेलना होता है जब वह खुलता है। रोबोट ने हैंडल को शुरुआती बिंदु के रूप में पहचानना और फिर दरवाजे को पूरी तरह से खुलने तक धकेलने के लिए सहजता से बदलना सीखा। इसने प्रदर्शित किया कि यह विधि उन वस्तुओं को भी संभाल सकती है जो कार्य के दौरान अपना आकार बदलती हैं, न कि केवल स्थिर ब्लॉकों को। अध्ययन बताता है कि रोबोट की प्रारंभिक जिज्ञासा को सार्थक संपर्क बिंदुओं की ओर निर्देशित करके और फिर बाकी चीज़ों को खुद समझने के लिए छोड़ देने से, इंजीनियर मशीनों को हमारे दैनिक जीवन की भारी, अजीब और अप्रत्याशित वस्तुओं को संभालने के योग्य बना सकते हैं। हालांकि यह प्रणाली अभी भी वस्तु की स्थिति को ट्रैक करने के लिए बाहरी कैमरों पर निर्भर करती है, लेकिन मूल सीखने की रणनीति वजन, आकार और घर्षण के वास्तविक दुनिया के बदलावों को संभालने के लिए पर्याप्त मजबूत साबित हुई, जो हमें उन रोबोटों के करीब लाती है जो वास्तव में हमारे घरों में भारी काम करने में मदद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।