← नवीनतम पेपर
💻 computer science

Imitation of Arm Gestures by the Semi-Humanoid Robot NICO

यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो अर्ध-मानव सदृश रोबोट NICO को मोनोकुलर RGB इनपुट, मीडियापाइप-आधारित 3D पोज़ एस्टीमेशन और जॉइंट एंगल्स की गणना एवं मैपिंग के लिए विश्लेषणात्मक ज्यामिति का उपयोग करके मानव बाहु संकेतों (arm gestures) की नकल करने में सक्षम बनाती है, जो जटिल मुद्राओं और कलाई की गतिविधियों में सीमाओं को स्वीकार करते हुए सरल संकेतों पर सफल प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Anastasiya Ihnatovich, Igor Farkaš

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anastasiya Ihnatovich, Igor Farkaš

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल निर्देशों की एक कठोर सूची का पालन नहीं करते, बल्कि वास्तव में हमें देखकर "सीख" सकते हैं, ठीक वैसे ही जैसे एक छोटा बच्चा अपने माता-पिता की नकल करता है। यह ह्यूमन-रोबोट इंटरैक्शन (HRI) का केंद्र है, जो एक ऐसा विज्ञान क्षेत्र है जो मशीनों को केवल औजारों के बजाय साथियों जैसा महसूस कराने के लिए समर्पित है। एक रोबोट के लिए मानव गति की वास्तव में नकल करने के लिए, उसे दो महाशक्तियों की आवश्यकता होती है: परसेप्शन (एक 2D फोटो में मानव शरीर को "देखने" और समझने की क्षमता) और काइनेमैटिक्स (वह गणित जो यह पता लगाता है कि उस मानव मुद्रा से मेल खाने के लिए उसे अपने धातु के जोड़ों को कैसे मोड़ना है)। जबकि कुछ वैज्ञानिक रोबोटों को लाखों वीडियो खिलाकर उन्हें सिखाने की कोशिश करते हैं और उम्मीद करते हैं कि एक जटिल कंप्यूटर मस्तिष्क इसे समझ लेगा, अन्य एक अधिक प्रत्यक्ष, ज्यामितीय दृष्टिकोण पसंद करते हैं—कोणों और दूरियों को मापने के लिए सरल गणित का उपयोग करना। यह क्यों मायने रखता है? क्योंकि यदि एक रोबोट स्वाभाविक रूप से हमारे इशारों की नकल कर सकता है, तो वह महंगे, भारी सेंसर या वर्षों के प्रशिक्षण के बिना, सामाजिक परिवेश में हमारे साथ बातचीत कर सकता है, कार्यों में मदद कर सकता है, या हमें सिखा भी सकता है।

इस अध्ययन में, शोधकर्ताओं अनस्तासिया इहनाटोविच और इगोर फरकास ने NICO नामक एक सेमी-ह्यूमनॉइड रोबोट को एक मानक कैमरे और कुछ चतुर ज्यामिति का उपयोग करके मानव भुजा के इशारों की नकल करना सिखाने का प्रयास किया। NICO को एक बच्चे के आकार के रोबोट के रूप में सोचें जिसमें एक सिर और दो भुजाएं हैं, जिसे लोगों के साथ रहने के लिए डिज़ाइन किया गया है। टीम ने किसी भी फैंसी 3D डेप्थ कैमरा या मोशन-कैप्चर सूट का उपयोग नहीं किया; इसके बजाय, वे मीडियापाइप (MediaPipe) नामक एक मुफ्त सॉफ्टवेयर टूल पर भरोसा करते हैं, जो एक डिजिटल कंकाल ट्रैकर की तरह कार्य करता है। जब आप मीडियापाइप को एक सामान्य फोटो दिखाते हैं, तो यह तुरंत मानव शरीर पर 33 प्रमुख बिंदुओं (जैसे कंधे, कोहनी और कलाई) को पहचान लेता है और अनुमान लगाता है कि वे 3D स्थान में कहाँ हैं।

शोधकर्ताओं की विधि एक अनुवादक की तरह काम करती है। पहले, मीडियापाइप मानव को "देखता" है और उनकी भुजा के जोड़ों के निर्देशांक (coordinates) प्राप्त करता है। फिर, टीम ज्यामितीय सूत्रों के एक सेट का उपयोग करती है—जो मूल रूप से बिंदुओं के बीच की दूरी के आधार पर कोणों की गणना करने का एक नुस्खा है—यह पता लगाने के लिए कि मानव की कोहनी कितनी मुड़ी हुई है या उनकी कलाई कितनी घूमी हुई है। अंत में, वे उन मानव कोणों को गणितीय रूप से NICO के विशिष्ट मोटरों में "मैप" करते हैं, जिससे रोबोट को यह निर्देश मिलता है कि उसे मानव से मेल खाने के लिए अपने स्वयं के जोड़ों को कैसे हिलाना है। यह मानव मुद्रा को लेकर एक रूपांतरण चार्ट (conversion chart) चलाने जैसा है ताकि रोबोट का निर्देश मैनुअल प्राप्त किया जा सके।

टीम ने इस प्रणाली का परीक्षण विभिन्न ऊंचाइयों के छह स्वयंसेवर्तों के साथ किया, जिसमें उन्हें विभिन्न कोणों (सीधे सामने, या थोड़ा बगल की ओर मुड़े हुए) पर खड़े होकर 11 अलग-अलग भुजा मुद्राओं को बनाए रखने के लिए कहा गया। परिणाम सफलता और ईमानदार सीमाओं का मिश्रण थे। रोबलेट बड़ी गतिविधियों की नकल करने में काफी अच्छा था: यह शोल्डर पिच (हाथ को ऊपर-नीचे उठाना), एल्बो बेंड (कोहनी का मुड़ना), और रिस्ट बेंड (कलाई का मुड़ना) का मध्यम स्तर की सटीकता के साथ अनुमान लगा सका, जिसमें औसत त्रुटि क्रमशः लगभग 10°, 20°, और 23° थी। हालांकि, रोबोट शोल्डर रोल (कंधे पर हाथ को घुमाना) और फोरआर्म रोटेशन (दरवाजे का हैंडल घुमाने की तरह हाथ को घुमाना) में अधिक संघर्ष करता है। फोरआर्म रोटेशन सबसे कठिन हिस्सा था; हैंड-ट्रैकिंग डेटा की मदद के बावजूद, रोबोट का अनुमान औसतन 50.1° गलत था, जो कि एक महत्वपूर्ण अस्थिरता है।

दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि रोबोट का प्रदर्शन इस बात पर निर्भर नहीं करता था कि मानव कितना लंबा था या उन्होंने अपने शरीर को किस तरह घुमाया था (एक 45° की सीमा के भीतर)। इसके बजाय, सबसे बड़ा कारक यह था कि मानव क्या कर रहा था। यदि मुद्रा में अग्रभुजा (forearm) का जटिल घुमाव शामिल था या हाथ भुजा के पीछे छिपा हुआ था, तो रोबोट भ्रमित हो जाता था। यह प्रणाली अविश्वसनीय रूप से तेज़ भी थी, जो प्रत्येक छवि को लगभग 0.0017 सेकंड में प्रोसेस करती थी, जो वास्तविक समय की गति के साथ तालमेल बिठाने के लिए पर्याप्त है।

अंततः, यह शोध पत्र सुझाव देता है कि यह "केवल-ज्यामिति" वाला दृष्टिकोण महंगे हार्डवेयर या विशाल प्रशिक्षण डेटासेट के बिना एक रोबोट को मानव इशारों की नकल करने के लिए एक व्यवहार्य और कुशल तरीका है। यह सिद्ध करता है कि आप केवल एक सामान्य कैमरे का उपयोग करके एक रोबोट को सार्थक तरीके से अपनी भुजाएं हिलाने के लिए तैयार कर सकते हैं। हालांकि, लेखक सावधानी बरतते हुए कहते हैं कि यह अभी तक एक पूर्ण समाधान नहीं है। यह प्रणाली अभी भी जटिल कलाई और अग्रभुजा की गतिविधियों पर लड़खड़ाती है, और इसे एक मजबूत, रोजमर्रा के उपकरण के रूप में माना जाने से पहले लोगों और मुद्राओं की एक विस्तृत विविधता पर अधिक परीक्षण की आवश्यकता है। फिलहाल, यह एक आशाजनक प्रूफ ऑफ कॉन्सेप्ट है जो दिखाता है कि एक रोबोट हमें "देख" और "नकल" कर सकता है, भले ही कभी-कभी वह कलाई के घुमाव को थोड़ा गलत समझ ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →