Imitation of Arm Gestures by the Semi-Humanoid Robot NICO
यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो अर्ध-मानव सदृश रोबोट NICO को मोनोकुलर RGB इनपुट, मीडियापाइप-आधारित 3D पोज़ एस्टीमेशन और जॉइंट एंगल्स की गणना एवं मैपिंग के लिए विश्लेषणात्मक ज्यामिति का उपयोग करके मानव बाहु संकेतों (arm gestures) की नकल करने में सक्षम बनाती है, जो जटिल मुद्राओं और कलाई की गतिविधियों में सीमाओं को स्वीकार करते हुए सरल संकेतों पर सफल प्रदर्शन प्रदर्शित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल निर्देशों की एक कठोर सूची का पालन नहीं करते, बल्कि वास्तव में हमें देखकर "सीख" सकते हैं, ठीक वैसे ही जैसे एक छोटा बच्चा अपने माता-पिता की नकल करता है। यह ह्यूमन-रोबोट इंटरैक्शन (HRI) का केंद्र है, जो एक ऐसा विज्ञान क्षेत्र है जो मशीनों को केवल औजारों के बजाय साथियों जैसा महसूस कराने के लिए समर्पित है। एक रोबोट के लिए मानव गति की वास्तव में नकल करने के लिए, उसे दो महाशक्तियों की आवश्यकता होती है: परसेप्शन (एक 2D फोटो में मानव शरीर को "देखने" और समझने की क्षमता) और काइनेमैटिक्स (वह गणित जो यह पता लगाता है कि उस मानव मुद्रा से मेल खाने के लिए उसे अपने धातु के जोड़ों को कैसे मोड़ना है)। जबकि कुछ वैज्ञानिक रोबोटों को लाखों वीडियो खिलाकर उन्हें सिखाने की कोशिश करते हैं और उम्मीद करते हैं कि एक जटिल कंप्यूटर मस्तिष्क इसे समझ लेगा, अन्य एक अधिक प्रत्यक्ष, ज्यामितीय दृष्टिकोण पसंद करते हैं—कोणों और दूरियों को मापने के लिए सरल गणित का उपयोग करना। यह क्यों मायने रखता है? क्योंकि यदि एक रोबोट स्वाभाविक रूप से हमारे इशारों की नकल कर सकता है, तो वह महंगे, भारी सेंसर या वर्षों के प्रशिक्षण के बिना, सामाजिक परिवेश में हमारे साथ बातचीत कर सकता है, कार्यों में मदद कर सकता है, या हमें सिखा भी सकता है।
इस अध्ययन में, शोधकर्ताओं अनस्तासिया इहनाटोविच और इगोर फरकास ने NICO नामक एक सेमी-ह्यूमनॉइड रोबोट को एक मानक कैमरे और कुछ चतुर ज्यामिति का उपयोग करके मानव भुजा के इशारों की नकल करना सिखाने का प्रयास किया। NICO को एक बच्चे के आकार के रोबोट के रूप में सोचें जिसमें एक सिर और दो भुजाएं हैं, जिसे लोगों के साथ रहने के लिए डिज़ाइन किया गया है। टीम ने किसी भी फैंसी 3D डेप्थ कैमरा या मोशन-कैप्चर सूट का उपयोग नहीं किया; इसके बजाय, वे मीडियापाइप (MediaPipe) नामक एक मुफ्त सॉफ्टवेयर टूल पर भरोसा करते हैं, जो एक डिजिटल कंकाल ट्रैकर की तरह कार्य करता है। जब आप मीडियापाइप को एक सामान्य फोटो दिखाते हैं, तो यह तुरंत मानव शरीर पर 33 प्रमुख बिंदुओं (जैसे कंधे, कोहनी और कलाई) को पहचान लेता है और अनुमान लगाता है कि वे 3D स्थान में कहाँ हैं।
शोधकर्ताओं की विधि एक अनुवादक की तरह काम करती है। पहले, मीडियापाइप मानव को "देखता" है और उनकी भुजा के जोड़ों के निर्देशांक (coordinates) प्राप्त करता है। फिर, टीम ज्यामितीय सूत्रों के एक सेट का उपयोग करती है—जो मूल रूप से बिंदुओं के बीच की दूरी के आधार पर कोणों की गणना करने का एक नुस्खा है—यह पता लगाने के लिए कि मानव की कोहनी कितनी मुड़ी हुई है या उनकी कलाई कितनी घूमी हुई है। अंत में, वे उन मानव कोणों को गणितीय रूप से NICO के विशिष्ट मोटरों में "मैप" करते हैं, जिससे रोबोट को यह निर्देश मिलता है कि उसे मानव से मेल खाने के लिए अपने स्वयं के जोड़ों को कैसे हिलाना है। यह मानव मुद्रा को लेकर एक रूपांतरण चार्ट (conversion chart) चलाने जैसा है ताकि रोबोट का निर्देश मैनुअल प्राप्त किया जा सके।
टीम ने इस प्रणाली का परीक्षण विभिन्न ऊंचाइयों के छह स्वयंसेवर्तों के साथ किया, जिसमें उन्हें विभिन्न कोणों (सीधे सामने, या थोड़ा बगल की ओर मुड़े हुए) पर खड़े होकर 11 अलग-अलग भुजा मुद्राओं को बनाए रखने के लिए कहा गया। परिणाम सफलता और ईमानदार सीमाओं का मिश्रण थे। रोबलेट बड़ी गतिविधियों की नकल करने में काफी अच्छा था: यह शोल्डर पिच (हाथ को ऊपर-नीचे उठाना), एल्बो बेंड (कोहनी का मुड़ना), और रिस्ट बेंड (कलाई का मुड़ना) का मध्यम स्तर की सटीकता के साथ अनुमान लगा सका, जिसमें औसत त्रुटि क्रमशः लगभग 10°, 20°, और 23° थी। हालांकि, रोबोट शोल्डर रोल (कंधे पर हाथ को घुमाना) और फोरआर्म रोटेशन (दरवाजे का हैंडल घुमाने की तरह हाथ को घुमाना) में अधिक संघर्ष करता है। फोरआर्म रोटेशन सबसे कठिन हिस्सा था; हैंड-ट्रैकिंग डेटा की मदद के बावजूद, रोबोट का अनुमान औसतन 50.1° गलत था, जो कि एक महत्वपूर्ण अस्थिरता है।
दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि रोबोट का प्रदर्शन इस बात पर निर्भर नहीं करता था कि मानव कितना लंबा था या उन्होंने अपने शरीर को किस तरह घुमाया था (एक 45° की सीमा के भीतर)। इसके बजाय, सबसे बड़ा कारक यह था कि मानव क्या कर रहा था। यदि मुद्रा में अग्रभुजा (forearm) का जटिल घुमाव शामिल था या हाथ भुजा के पीछे छिपा हुआ था, तो रोबोट भ्रमित हो जाता था। यह प्रणाली अविश्वसनीय रूप से तेज़ भी थी, जो प्रत्येक छवि को लगभग 0.0017 सेकंड में प्रोसेस करती थी, जो वास्तविक समय की गति के साथ तालमेल बिठाने के लिए पर्याप्त है।
अंततः, यह शोध पत्र सुझाव देता है कि यह "केवल-ज्यामिति" वाला दृष्टिकोण महंगे हार्डवेयर या विशाल प्रशिक्षण डेटासेट के बिना एक रोबोट को मानव इशारों की नकल करने के लिए एक व्यवहार्य और कुशल तरीका है। यह सिद्ध करता है कि आप केवल एक सामान्य कैमरे का उपयोग करके एक रोबोट को सार्थक तरीके से अपनी भुजाएं हिलाने के लिए तैयार कर सकते हैं। हालांकि, लेखक सावधानी बरतते हुए कहते हैं कि यह अभी तक एक पूर्ण समाधान नहीं है। यह प्रणाली अभी भी जटिल कलाई और अग्रभुजा की गतिविधियों पर लड़खड़ाती है, और इसे एक मजबूत, रोजमर्रा के उपकरण के रूप में माना जाने से पहले लोगों और मुद्राओं की एक विस्तृत विविधता पर अधिक परीक्षण की आवश्यकता है। फिलहाल, यह एक आशाजनक प्रूफ ऑफ कॉन्सेप्ट है जो दिखाता है कि एक रोबोट हमें "देख" और "नकल" कर सकता है, भले ही कभी-कभी वह कलाई के घुमाव को थोड़ा गलत समझ ले।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।