Compliance for Free: Learning Identifiable Impedance via Bilateral Teleoperation
यह शोध पत्र मौजूदा जॉइंट-टॉर्क सेंसरों से ऑपरेटर स्टिफनेस (कठोरता) की पहचान करने और उसे रिकॉर्ड करने के लिए फोर-चैनल द्विपक्षीय टेलीऑपरेशन का उपयोग करने वाली एक विधि प्रस्तावित करता है, जो संपर्क-समृद्ध कार्यों के लिए शून्य एनोटेशन लागत पर दिशा-निर्भर अनुपालन लेबल (compliance labels) उत्पन्न करने हेतु विजन-लैंग्वेज-एक्शन मॉडलों को फाइन-ट्यून करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट दुनिया को देखने और यह तय करने में उल्लेखनीय रूप से कुशल हो गए हैं कि आगे कैसे बढ़ना है। आधुनिक आर्टिफिशियल इंटेलिजेंस एक अव्यवस्थित कमरे की तस्वीर देखकर रोबोटिक हाथ को ठीक से बता सकता है कि कप कैसे उठाना है या दराज कैसे खोलनी है। लेकिन एक अंतिम, महत्वपूर्ण चरण है जहाँ ये मशीनें अक्सर लड़खड़ा जाती हैं: वह क्षण जब वे किसी चीज़ को छूती हैं। हालांकि एक रोबोट को बताया जा सकता है कि कहाँ जाना है, लेकिन उसे यह समझने में कठिनाई होती है कि कितना ज़ोर से दबाना है। ऐसे कार्य जिनमें कोमल स्पर्श की आवश्यकता होती है, जैसे कि व्हाइटबोर्ड को बिना खरोंच के पोंछना, या एक तंग छेद में पेग डालना, 'कम्प्लायंस' (compliance) नामक गुण पर निर्भर करते हैं। यह दबाव के प्रति नियंत्रित तरीके से झुकने या प्रतिरोध करने की क्षमता है। लंबे समय तक, रोबकों को यह कौशल सिखाना कठिन रहा है क्योंकि मनुष्यों द्वारा रोबोट को निर्देश देने के मानक तरीके केवल रोबोट की अंतिम स्थिति को रिकॉर्ड करते हैं। वे उस अदृश्य बल को छोड़ देते हैं जो मनुष्य लगा रहा था, जिससे रोबोट को यह अनुमान लगाने के लिए मजबूर होना पड़ता है कि उसे सख्त होना चाहिए या नरम।
बार्सिलोना की एक शोध टीम ने बिना महंगे फोर्स-टॉर्क या टैक्टाइल सेंसर जोड़े, इस जानकारी के लापता हिस्से को हल करने का एक तरीका खोज लिया है। उन्होंने पाया कि एक विशिष्ट प्रकार के रिमोट कंट्रोल सेटअप का उपयोग करके, वे केवल रोबोटिक हाथ में पहले से मौजूद जॉइंट-टॉर्क सेंसर का उपयोग करके मानव के इच्छित लक्ष्य और उनके द्वारा लगाए गए बल को गणितीय रूप से अलग कर सकते हैं। अपने प्रयोगों में, एक मानव ऑपरेटर ने एक ऐसे सिस्टम के माध्यम से एक रोबोटिक हाथ को नियंत्रित किया जहाँ ऑपरेटर का अपना हाथ एक दूसरे, समान रोबोटिक हाथ को हिला रहा था। यह देखते हुए कि ऑपरेटर का हाथ वास्तव में कैसे चला और रोबोटिक हाथ वास्तव में कैसे चला, शोधकर्ता यह गणना कर सके कि ऑपरेटर हर एक क्षण में रोबोट को कितना सख्त या नरम बनाना चाहता था। उन्होंने इस नए डेटा का उपयोग एक आर्टिफिशियल इंटेलिजेंस मॉडल को प्रशिक्षित करने के लिए किया जो अब एक साधारण मौखिक निर्देश ले सकता है, जैसे कि "इस निशान को मजबूती से पोंछें," और केवल एक स्थान पर जाने के बजाय अपनी कठोरता (stiffness) को उसके अनुरूप समायोजित कर सकता है।
शोधकर्ताओं ने जिस मुख्य समस्या का समाधान किया वह है भ्रम जो तब होता है जब हम किसी मनुष्य को देखकर रोबोट को सिखाने की कोशिश करते हैं। कल्पना कीजिए कि एक मनुष्य रोबोटिक हाथ को दीवार के विरुद्ध धकेल रहा है। यदि रोबोट एक निश्चित स्थान पर समाप्त होता है, तो हमें नहीं पता कि मनुष्य ने एक सख्त स्प्रिंग के विरुद्ध ज़ोर से धक्का दिया या एक नरम स्प्रिंग के विरुद्ध धीरे से। दोनों ही परिदृश्य परिणाम स्वरूप रोबोट को बिल्कुल उसी स्थान पर ला सकते हैं। मानक रिकॉर्डिंग उपकरण केवल अंतिम स्थिति देखते हैं, इसलिए वे अंतर नहीं बता सकते कि क्या हुआ। यह रोबोट को केवल यह देखकर "मजबूत" बनाम "कोमल" की अवधारणा सिखाना असंभव बनाता है कि रोबोट कहाँ गया। शोधकर्ताओं ने महसूस किया कि इसे ठीक करने के लिए, उन्हें मानव के इच्छित स्थान का एक दूसरा, स्वतंत्र माप चाहिए था, जो कि रोबोट वास्तव में कहाँ पहुँचा, उससे अलग हो।
इसे हल करने के लिए, उन्होंने एक फोर-चैनल द्विपक्षीय टेलीऑपरेशन (bilateral teleoperation) सिस्टम का उपयोग किया। इस सेटअप में, एक मानव एक "लीडर" रोबोटिक हाथ पकड़ता है, और एक "फॉलोअर" रोबोटिक हाथ उसकी नकल करने की कोशिश करता है। महत्वपूर्ण बात यह है कि सिस्टम केवल स्थिति कमांड नहीं भेजता है; यह बल की जानकारी भी दोनों तरफ भेजता है। जब फॉलोअर हाथ किसी बाधा से टकराता है, तो मनुष्य अपने हाथ में उस प्रतिरोध को महसूस करता है। क्योंकि मनुष्य सक्रिय रूप से संपर्क को महसूस कर रहा है, इसलिए उसके अपने हाथ की गति उसके वास्तविक इरादे का प्रतिनिधित्व करती है, जबकि फॉलोअर की गति दिखाती है कि रोबोट ने पर्यावरण के प्रति कैसी प्रतिक्रिया दी। लीडर के पथ की तुलना फॉलोअर के पथ से करके, शोधकर्ता यह गणना कर सके कि मनुष्य कहाँ होना चाहता था और रोबोट वास्तव में कहाँ था। इस अंतर ने, रोबोट द्वारा महसूस किए गए बल (जिसे रोबोट के मूल जॉइंट-टॉर्क सेंसर का उपयोग करके अनुमानित किया गया था) के साथ मिलकर, उन्हें यह निर्धारित करने में सक्षम बनाया कि मनुष्य कितनी कठोरता लागू कर रहा था।
इस पद्धति का उपयोग करते हुए, टीम ने व्हाइटबोर्ड पोंछने के प्रदर्शनों का एक बड़ा सेट एकत्र किया। उन्होंने मनुष्यों को बोर्ड पर निशान "सामान्य" या "मजबूती से" पोंछने का निर्देश दिया। अपने नए गणना पद्धति के कारण, वे पोंछने की गति के हर एक क्षण में उपयोग की गई कठोरता के लिए एक सटीक लेबल निकाल सके, बिना रोबोट की कलाई पर किसी विशेष बल सेंसर की आवश्यकता के। इसके बाद उन्होंने इस मॉडल को फाइन-ट्यून करने के लिए एक बड़े विजन-लैंग्वेज मॉडल (एक प्रकार का एआई जो छवियों और टेक्स्ट को समझता है) का उपयोग किया। उन्होंने इस मॉडल को न केवल एक लक्ष्य स्थिति, बल्कि प्रत्येक चाल के लिए एक लक्ष्य कठोरता मान आउटपुट करना सिखाया।
परिणामों ने दिखाया कि यह दृष्टिकोण बिल्कुल इच्छानुसार काम करता है। जब शोधकर्ताओं ने नए रोबोट पॉलिसी का परीक्षण किया, तो उन्होंने पाया कि यह भाषा के निर्देश के आधार पर वास्तव में अपने दबाव को बदल सकता है। जब इसे "मजबूती से" पोंछने के लिए कहा गया, तो इसने अपने संपर्क बल को बढ़ाकर औसतन 9.1 न्यूटन कर दिया। जब इसे "सामान्य रूप से" पोंछने के लिए कहा गया, तो इसने उस बल को घटाकर 6.4 न्यूटन कर दिया। यह परिवर्तन सांख्यिकीय रूप से महत्वपूर्ण और सुसंगत था। इसके विपरीत, इसी अध्ययन में परीक्षण की गई अन्य रोबोट पॉलिसियों ने अपने व्यवहार को बदलने में विफल रहे। कुछ पॉलिसियाँ जिन्हें इनपुट के रूप में बल डेटा दिया गया था, फिर भी बहुत कठोरता से चलती रहीं, जबकि अन्य जिन्होंने निश्चित नियमों के आधार पर कठोरता का अनुमान लगाने की कोशिश की, वे बिल्कुल भी अनुकूलित नहीं हो सकीं। केवल नई लेबलिंग के साथ प्रशिक्षित नीति ही सफलतापूर्वक "मंतुबूरी से" शब्द को भौतिक दबाव में वृद्धि से जोड़ पाई।
शोधकर्ताओं ने यह भी सत्यापित किया कि रोबोट ने चयनात्मक रूप से सख्त होना सीखा। यह केवल सभी दिशाओं में समान रूप से कठोर नहीं हुआ; यह पोंछने की दिशा में सख्त हो गया ताकि मार्ग से हटने के प्रतिरोध को रोका जा सके, जबकि अन्य दिशाओं में नरम बना रहा। यह एनिसोट्रोपिक व्यवहार (anisotropic behavior), या दिशा-निर्भर कठोरता, एक परिष्कृत गुण है जो यह दर्शाता है कि कैसे एक मानव हाथ स्वाभाविक रूप से कार्य के अनुसार खुद को ढालता है। रोबोट ने बोर्ड से स्याही हटाने में 50 प्रतिशत सफलता दर हासिल की, जो परीक्षण की गई पांच अलग-अलग पॉलिसियों में सबसे अधिक थी, और इसने अत्यधिक बल के कारण होने वाले सुरक्षा स्टॉप को कम करते हुए यह कार्य किया।
इन सफलताओं के बावजूद, अध्ययन कुछ सीमाओं को स्वीकार करता है। यह विधि इस बात पर निर्भर करती है कि रोबोट में ऐसे सेंसर हों जो उसके जोड़ों में टॉर्क को माप सकें, जो अनुसंधान रोबोटों में सामान्य हैं लेकिन हमेशा सस्ते वाणिज्यिक मॉडलों में नहीं होते। इस तकनीक के लिए यह भी आवश्यक था कि अंशांकन (calibration) के दौरान रोबलेट एक विशिष्ट मुद्रा में रहे ताकि बल गणना सटीक बनी रहे। इसके अलावा, रोटेशनल स्टिफनेस, या रोबोट घूमने के विरुद्ध कैसे प्रतिरोध करता है, उसे सटीक रूप से मापना कठिन था क्योंकि पोंछने के कार्य में स्पष्ट डेटा उत्पन्न करने के लिए पर्याप्त घुमाव वाली गति शामिल नहीं थी। शोधकर्ताओं ने उल्लेख किया कि हालांकि उनकी विधि इस विशिष्ट कार्य के लिए अच्छी तरह काम करती है, लेकिन यह रोबोट द्वारा सामना किए जाने वाले हर प्रकार के संपर्क के लिए सार्वभौमिक समाधान नहीं है।
इस कार्य का महत्व इस बात में निहित है कि यह रोबोट को स्पर्श के बारे में सिखाने के लिए महंगे, विशेषीकृत फोर्स-टॉर्क या टैक्टाइल हार्डवेयर की आवश्यकता को दरकिनार करता है। रोबोटिक हाथ पर मौजूद मौजूदा जॉइंट-टॉर्क सेंसर का उपयोग करके और मानव इरादे की व्याख्या करने के लिए एक चतुर गणितीय दृष्टिकोण का उपयोग करके, शोधकर्ताओं ने शून्य अतिरिक्त लागत पर कम्प्लायंस के लिए उच्च-गुणवत्ता वाला प्रशिक्षण डेटा उत्पन्न करने का एक तरीका बनाया है। यह सुझाव देता है कि भविष्य में रोबोट बहुत अधिक प्रभावी ढंग से नाजुक या परिवर्तनशील-बल वाले कार्यों को संभालना सीख सकते हैं, केवल मनुष्यों को एक ऐसे सिस्टम के माध्यम से देखकर जो गति और प्रतिरोध की भावना दोनों को कैप्चर करता है। यह अध्ययन प्रदर्शित करता है कि बेहतर रोबोट स्पर्श की कुंजी बेहतर सेंसर नहीं, बल्कि हमारे पास पहले से मौजूद संकेतों को पढ़ने के बेहतर तरीके हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।