TacBPM: A Tactile-conditioned Behavior Prior Model for Dexterous Reorientation
यह शोध पत्र TacBPM को प्रस्तुत करता है, जो एक स्पर्श-सशर्त व्यवहार पूर्व मॉडल (tactile-conditioned behavior prior model) है जो जटिल डेक्सट्रस इन-हैंड ओरिएंटेशन और आर्म-हैंड मैनिपुलेशन कार्यों के लिए प्रशिक्षण को त्वरित करने और स्थिर, सफल सिम-टू-रियल ट्रांसफर को सक्षम करने हेतु मल्टी-स्केल स्फीयर स्पेशलिस्ट्स को एक लेटेंट कंट्रोलर में संकुचित (distill) करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोटिक हाथ एक नाजुक अंडे, एक फिसलन भरे नींबू या एक भारी हथौड़े को उठाने की कोशिश कर रहा है। एक इंसान के विपरीत, जो स्वाभाविक रूप से किसी वस्तु की बनावट, वजन और फिसलन को महसूस कर सकता है ताकि पलक झपकते ही अपनी पकड़ को समायोजित कर सके, एक रोबोट आमतौर पर कैमरों या पूर्व-निर्धारित निर्देशों पर निर्भर करता है। यदि वस्तु थोड़ी भी खिसक जाती है, या सतह उम्मीद से अधिक चिकनी होती है, तो रोबोट अक्सर अपनी पकड़ खो देता है। दशकों से, वैज्ञानिक रोबलों को मानव हाथ जैसी कुशलता से वस्तुओं को नियंत्रित करना सिखाने का प्रयास कर रहे हैं, जो कि दर्जनों छोटे जोड़ों के समन्वय और निरंतर शारीरिक संपर्क के प्रति प्रतिक्रिया करने की एक कठिन चुनौती है। चुनौती केवल हाथ को एक स्थान पर ले जाने की नहीं है, बल्कि वस्तु के मुड़ने, लुढ़कने या पकड़ के भीतर फिसलने के दौरान दबाव के एक नाजुक, बदलते संतुलन को बनाए रखने की है।
शार्पा रोबोटिक्स के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, जो इस बात पर केंद्रित है कि कैसे एक रोबटेज स्पर्श की संवेदना को अपने प्राथमिक मार्गदर्शक के रूप में उपयोग करके वस्तुओं को पुन: उन्मुख (reorient) करना सीख सकता है—जैसे उन्हें पलटना या घुमाना। उनका कार्य, जो 'TacBPM' नामक एक अध्ययन में प्रस्तुत किया गया है, रोबोट लर्निंग की एक विशिष्ट बाधा को संबोधित करता है: मशीन को बिना संपर्क तोड़े या वस्तु को गिराए उंगलियों की गतिविधियों के सही क्रम को खोजने के लिए प्रशिक्षित करने की कठिनाई। रोबोट को हर संभव गतिविधि को शून्य से सीखने के लिए मजबूर करने के बजाय, शोधकर्ताओं ने एक "व्यवहार पूर्ववृत्त" (behavior prior) बनाया, जो सुरक्षित, संपर्क-समृद्ध गतिविधियों के एक आधारभूत पुस्तकालय के रूप में कार्य करता है। यह लाइब्रेरी विभिन्न आकारों के गोलों (spheres) पर रोबोट को प्रशिक्षित करके बनाई गई है, जिससे वह विभिन्न पैमानों की वस्तुओं को लुढ़काना और पकड़ना सीखता है। मुख्य नवाचार यह है कि यह लाइब्रेरी केवल दृश्य निर्देशों का एक सेट नहीं है; यह स्पर्श संबंधी फीडबैक (tactile feedback) पर आधारित है, जिसका अर्थ है कि रोबोट की आंतरिक मार्गदर्शन प्रणाली लगातार यह जांचती है कि उसकी उंगलियां क्या महसूस कर रही हैं ताकि अगली चाल तय की जा सके।
शोधकर्ताओं ने अपने सिस्टम को 'डिस्टिलेशन' (distillation) नामक एक विधि का उपयोग करके प्रशिक्षित किया, जहाँ उन्होंने आठ अलग-अलग विशेषज्ञ नीतियों (expert policies) को लिया, जिनमें से प्रत्येक एक विशिष्ट आकार के गोले (बहुत छोटे से लेकर बड़े तक) के लिए विशेषीकृत थी, और उनके ज्ञान को एक एकल, संक्षिप्त नियंत्रक (controller) में संकुचित किया। यह नियंत्रक रोबोट के बाईस जोड़ों के लिए कच्चे मोटर कमांड आउटपुट नहीं करता है। इसके बजाय, यह एक उच्च-स्तरीय "लेटेंट" (latent) क्रिया उत्पन्न करता है, जो एक सुरक्षित, संपर्क-स्थिर गति पैटर्न का प्रतिनिधित्व करने वाला एक सरल निर्देश है। रोबोट फिर इस निर्देश के आधार पर कार्य के विशिष्ट संदर्भ में छोटे समायोजन करना सीखता है। कोर टैक्टाइल गाइडेंस को स्थिर रखकर और केवल छोटे सुधारों को सीखने की अनुमति देकर, सिस्टम उस अराजक 'ट्रायल-एंड-एरर' (प्रयास और त्रुटि) से बच जाता है जो आमतौर पर रोबोटों को वस्तु गिराने के लिए मजबूर करता है। अध्ययन दिखाता है कि जब रोबोट को एक ऐसी नई वस्तु दी जाती है जिसे उसने पहले कभी नहीं देखा, जैसे कि एक ब्लॉक, एक बोतल, या अनियमित आकार का कोई उपकरण, तो वह फिर भी सफल हो सकता है क्योंकि वह उन स्पर्श पैटर्न पर निर्भर करता है जो उसने गोलों से सीखे थे।
परीक्षणों की एक श्रृंखला में, शोधकर्ताओं ने मूल्यांकन किया कि क्या यह दृष्टिकोण उन वस्तुओं को संभाल सकता है जो गोले नहीं थे और वे कार्य जो साधारण रोटेशन से अधिक जटिल थे। उन्होंने रोबोट को वस्तुओं को विशिष्ट कोणों पर घुमाने, विशिष्ट अक्षों के चारों ओर घुमाने, और यहाँ तक कि किसी वस्तु को पकड़ने, उठाने, ले जाने और नई स्थिति में रखने के पूर्ण अनुक्रम को करने के लिए कहा। उन रोबोटों की तुलना में जो अपने जोड़ों को यादृच्छिक रूप से हिलाकर इन कार्यों को सीखने का प्रयास करते हैं, TacBPM सिस्टम काफी बेहतर प्रदर्शन करता है। सिमुलेशन में, मानक दृष्टिकोण अक्सर वस्तु को पकड़ने का एक स्थिर तरीका खोजने में विफल रहा, जिसके परिणामस्वरूप वस्तु गिर जाती या फंस जाती, जबकि टैक्टाइल-कंडीशन्ड सिस्टम ने अधिकांश प्रयासों में कार्यों को सफलतापूर्वक पूरा किया। उदाहरण के लिए, जब एक ब्लॉक या बोतल को लक्षित ओरिएंटेशन में घुमाने के लिए कहा गया, तो नई विधि ने नब्बे प्रतिशत के करीब सफलता दर प्राप्त की, जबकि मानक विधि दस प्रतिशत तक पहुँचने के लिए भी संघर्ष करती रही।
शोधकर्ताओं ने वास्तविक रोब-आर्म पर भी इस सिस्टम का परीक्षण किया जो उसी कुशल हाथ से लैस था। भौतिक हार्डवेयर पर बिना किसी अतिरिक्त प्रशिक्षण के, सिमुलेशन में सीखी गई नीति को सीधे वास्तविक दुनिया में स्थानांतरित किया गया। रोबोट ने विभिन्न उपकरणों, जिनमें एक रबर का हथौड़ा और एक नीला ब्रश शामिल था, को सफलतापूर्वक पकड़ा, उठाया और लक्षित स्थितियों में ले गया। इसने टेनिस बॉल और एक कॉर्नर ब्लॉक जैसी वस्तुओं को विशिष्ट दिशाओं में घुमाने का काम भी सफलतापूर्वक किया, जिसमें बाएं, दाएं, ऊपर या नीचे घुमाने के आदेशों का पालन किया गया। इन वास्तविक दुनिया के परीक्षणों में, टैक्टाइल प्रायर का उपयोग करने वाला रोबोट एक ही प्रयास में छह सौ डिग्री से अधिक घुमाव के साथ एक कॉर्नर ब्लॉक को घुमाने में सफल रहा, जबकि अन्य विधियाँ अक्सर संपर्क बनाए रखने में विफल रहीं या वस्तु को पूरी तरह से खो देती थीं। शोधकर्ताओं ने नोट किया कि सिस्टम विशेष रूप से मजबूत था जब वस्तु का आकार या माप बदल गया, जिससे पता चलता कि स्पर्श संबंधी मार्गदर्शन ने रोबोट को बुनियादी चीजों को फिर से सीखे बिना नई ज्यामिति के अनुकूल होने में मदद की।
एक महत्वपूर्ण निष्कर्ष यह था कि सिस्टम तब भी काम करता है जब रोबोट को उन वस्तुओं को संभालने के लिए कहा जाता है जिन्हें उसने प्रशिक्षण के दौरान कभी नहीं देखा था। शोधकर्ताओं ने कचरे के डिब्बे, स्ट्रॉबेरी और एक बहु-फल वाले ब्लॉक जैसी आकृतियों पर रोबोट का परीक्षण किया, जिनका उपयोग प्रारंभिक लाइब्रेरी बनाने के लिए नहीं किया गया था। रोबोट अपने ज्ञान का सामान्यीकरण करने में सक्षम रहा, गोलों से सीखे गए स्पर्श पैटर्न का उपयोग करके इन अपरिचित वस्तुओं को पकड़ने और घुमाने का तरीका खोजा। यह सुझाव देता है कि स्पर्श की संवेदना हेरफेर (manipulation) के लिए एक सार्वभौमिक भाषा प्रदान करती है जो विशिष्ट आकृतियों से परे है। अध्ययन ने एक ऐसा परिदृश्य भी तलाशा जहाँ रोबोट को एक विशिष्ट अंतिम कोण के बजाय, "लंबवत अक्ष के चारों ओर घुमाएं" जैसे संक्षिप्त आदेशों का पालन करना था। सिस्टम ने इन दिशाओं को समझने और उसके अनुसार अपनी उंगलियों की गति को समायोजित करने का कौशल दिखाया, जिससे वस्तु को घुमाते समय एक स्थिर पकड़ बनी रही।
शोधकर्ताओं ने सावधानीपूर्वक यह दिखाया कि उनकी विधि की सफलता काफी हद तक स्पर्श संबंधी जानकारी पर निर्भर थी। जब उन्होंने सिस्टम से स्पर्श सेंसर हटा दिए और केवल रोबोट के जोड़ों की स्थिति पर भरोसा किया, तो प्रदर्शन में काफी गिरावट आई, विशेष रूप से फिसलन भरी या अनियमित आकार की वस्तुओं के लिए। इसने पुष्टि की कि रोबोट को अपनी पकड़ को समायोजित करने या अपनी रणनीति बदलने के लिए वस्तु को महसूस करने की आवश्यकता थी। अध्ययन ने यह भी प्रदर्शित किया कि सिस्टम को विभिन्न प्रकार के रोबोटों के लिए अनुकूलित किया जा सकता है। एक हाथ और हाथ के मिलकर काम करने वाले एक अलग परीक्षण में, उसी प्रशिक्षण प्रतिमान ने रोबोट को विभिन्न उपकरणों को पकड़ने, उठाने और ले जाने की अनुमति दी, जिससे सिद्ध हुआ कि यह दृष्टिकोण केवल एक हाथ से आगे बढ़कर अधिक जटिल रोबोटिक निकायों तक भी विस्तार कर सकता है।
यह कार्य यह दावा नहीं करता है कि इसने रोबोटिक हेरफेर की हर समस्या को हल कर दिया है, और शोधकर्ता स्वीकार करते हैं कि प्रशिक्षण के उदाहरणों से बहुत भिन्न वस्तुओं तक विस्तार करने में इसकी कुछ सीमाएँ हैं। उदाहरण के लिए, जब रोबोट को एक ऐसे गोले को संभालने के लिए कहा गया जो उसके द्वारा देखे गए किसी भी गोले से काफी बड़ा था, तो इसकी सफलता दर घट गई, जो दर्शाता है कि सिस्टम की कुछ सीमाएँ हैं। हालाँकि, परिणाम स्पष्ट रूप से दिखाते हैं कि रोबोट की सीखने की प्रक्रिया को स्पर्श संबंधी फीडबैक में स्थापित करके और संपर्क-समृद्ध व्यवहारों का एक स्थिर आधार प्रदान करके, मशीनों को वस्तुओं के हेरफेर के लिए एक ऐसे स्तर की कुशलता सिखाना संभव है जो पहले पहुंच से बाहर था। अध्ययन यह सुझाव देता है कि रोबोटिक हेरफेर का भविष्य केवल रोबोट को किसी वस्तु के हर विवरण को देखने के लिए सिखाने में नहीं है, बल्कि उन्हें कार्य के माध्यम से महसूस करना सिखाने में है, जिसमें स्थिरता और नियंत्रण के लिए स्पर्श को प्राथमिक मार्गदर्शक बनाया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।