Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition
मिरर न्यूरॉन सिस्टम से प्रेरित होकर, यह शोध पत्र NICO ह्यूमनॉइड रोबोट के लिए एक द्वि-स्तरीय आर्किटेक्चर प्रस्तावित करता है जो हाथ और भुजा की गतिज विज्ञान (kinematics) को एनकोड करने के लिए सेल्फ-ऑर्गनाइजिंग मैप्स का और मोटर प्रिमिटिव्स की सटीक ऑनलाइन चरण पहचान प्राप्त करने के लिए एक इको स्टेट नेटवर्क का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को मानवीय संकेत, जैसे कि हाथ हिलाना या हाई-फाइव, समझना सिखाने की कोशिश कर रहे हैं, और यह केवल "यदि-तो" (if-then) नियमों की एक सूची याद करने के बजाय है। यह 'सोशल कॉग्निशन' (सामाजिक संज्ञान) नामक एक क्षेत्र का मूल है, जहाँ वैज्ञानिक यह पता लगाने की कोशिश करते हैं कि मशीनें यह कैसे "समझ" सकती हैं कि लोग क्या कर रहे हैं और क्यों। ऐसा करने के लिए, शोधकर्ता प्रेरणा के रूप में मानव मस्तिष्क की ओर देखते हैं, विशेष रूप से "मिरर न्यूरॉन्स" (दर्पण न्यूरॉन्स) नामक कोशिकाओं के एक दिलचस्प समूह की ओर। ये विशेष मस्तिष्क कोशिकाएं न केवल तब सक्रिय होती हैं जब आप स्वयं कोई क्रिया करते हैं, बल्कि तब भी जब आप किसी और को वह क्रिया करते हुए देखते हैं। यह ऐसा है जैसे आपके मस्तिष्क में एक आंतरिक मूवी थिएटर हो जहाँ वह उस क्रिया को समझने के लिए उसे फिर से चलाता है। रोबोटिक्स में बड़ा सवाल यह है: क्या हम एक ऐसा कंप्यूटर सिस्टम बना सकते हैं जो इसी तरह काम करता हो? केवल एक वीडियो देखकर अनुमान लगाने के बजाय, क्या एक रोबट गतिविधियों का अपना आंतरिक "शब्दकोश" बना सकता है और उसका उपयोग यह पहचानने के लिए कर सकता है कि अभी गति का कौन सा चरण चल रहा है? यह उन रोबोटों के लिए महत्वपूर्ण है जिन्हें मनुष्यों के साथ मिलकर काम करने की आवश्यकता है, क्योंकि यदि एक रोबोट यह अनुमान लगा सके कि आप एक कप उठाने वाले हैं, तो वह आपसे पूछने से पहले ही रास्ते से हट सकता है या आपको नैपकिन थमा सकता है।
रडोवन ग्रेगर और इगोर फारकास द्वारा लिखा गया यह शोध पत्र ठीक इसी विचार की खोज करता है, जिसमें NICO नामक एक ह्यूमनॉइड रोबोट का उपयोग किया गया है। टीम ने मिरर न्यूरॉन अवधारणा से प्रेरित एक दो-स्तरीय प्रणाली बनाई है ताकि रोबोट को वास्तविक समय में अपनी स्वयं की गतिविधियों के "चरणों" को पहचानना सिखाया जा सके। इसे रोबोट को नृत्य सिखाने की तरह समझें। उनके सिस्टम का पहला स्तर दो विशेष मानचित्रों का उपयोग करता है, जिन्हें सेल्फ-ऑर्गनाइजिंग मैप्स (SOMs) कहा जाता है, जो गति के पैटर्न के एक पुस्तकालय के रूप में कार्य करते हैं। एक मानचित्र रोबोट के हाथ की गतिविधियों को सीखता है, और दूसरा उसके हाथ के आकार को सीखता है। जैसे ही रोबोट सात अलग-अलग क्रियाओं का अभ्यास करता है—जैसे कि कोई वस्तु उठाना, खाना, या हाथ हिलाना—ये मानचित्र हजारों सूक्ष्म गतिविधियों को व्यवस्थित समूहों में स्वतः ही वर्गीकृत कर देते हैं। यह ऐसा है जैसे रोबोट अपनी स्वयं की "मोशन प्रिमिटिव्स" (गति के मूल तत्व) की खोज कर रहा हो, जो गति के बुनियादी लेगो (Lego) ब्लॉक्स की तरह हैं। शोधकर्ताओं ने पाया कि आर्म मैप (हाथ का मानचित्र) और हैंड मैप (हथेली का मानचित्र) अलग-अलग, पूरक चीजें सीखते हैं: आर्म मैप पहुँच (reach) के पथ और समय का पता लगाने में उत्कृष्ट है, जबकि हैंड मैप यह पहचानने में माहिर है कि उंगलियों का आकार वास्तव में कैसा है (जैसे कि पावर ग्रिप बनाम प्रिसिजन पिंच)।
एक बार जब ये "लेगो ब्लॉक्स" खोज लिए जाते हैं, तो सिस्टम का दूसरा स्तर सक्रिय हो जाता है। यह भाग एक इको स्टेट नेटवर्क (ESN) नामक तंत्रिका नेटवर्क का उपयोग करता है, जो एक अल्पकालिक स्मृति बैंक की तरह कार्य करता है। यह उन "ब्लॉक्स" के अनुक्रम को देखता है जिनका रोबोट अपनी गति के दौरान उपयोग कर रहा है। शोधकर्ताओं द्वारा पूछा गया बड़ा सवाल यह था कि क्या रोबोट को स्थिति के बारे में सब कुछ जानने की आवश्यकता है—जैसे कि वह कौन सी वस्तु पकड़े हुए है, वह कितनी दूर है, या अंतिम लक्ष्य क्या है—ताकी वह वर्तमान में क्या कर रहा है इसे पहचान सके? या क्या केवल गतिविधियों का अनुक्रम ही पर्याप्त है?
यह जानने के लिए, उन्होंने हजारों सिमुलेशन चलाए जहाँ रोबोट ने ये क्रियाएं कीं। उन्होंने सिस्टम का परीक्षण दो तरीकों से किया: पहले, ESN को केवल हाथ और उंगलियों की गतिविधियों के अनुक्रम का उपयोग करके वर्तमान गति चरण का अनुमान लगाने दिया; फिर, उन्होंने इसे अतिरिक्त "संदर्भ" संकेत दिए, जैसे कि क्रिया का नाम या वस्तु की दूरी। परिणाम काफी स्पष्ट थे। जब सिस्टम केवल गति अनुक्रम (मोशन प्रिमिटिव्स) पर निर्भर था, तो इसने वर्तमान चरण को लगभग 93.9% बार सही पहचाना। जब उन्होंने सभी अतिरिक्त संदर्भ संकेत जोड़े, तो सटीकता केवल बढ़कर लगभग 94.9% हुई।
यह सुझाव देता है कि गति द्वारा बताई गई "कहानी" सबसे महत्वपूर्ण हिस्सा है। वस्तु या लक्ष्य के बारे में अतिरिक्त जानकारी मददगार है, जैसे कि एक छोटा सा संकेत, लेकिन यह मुख्य चालक नहीं है। रोबोट का आंतरिक गति मानचित्र पहले से ही अधिकांश भारी काम कर रहा था। लेखक निष्कर्ष निकालते हैं कि रोबोट को अपनी गतिविधियों को इन टोपोग्राफिक मानचित्रों में व्यवस्थित करने देकर और फिर उन मानचित्रों के प्रवाह को देखकर, वह सटीक रूप से पहचान सकता है कि वह इस क्षण में क्या कर रहा है। हालांकि यह सब NICO रोबोट के साथ एक कंप्यूटर सिमुलेशन में परखा गया था, लेकिन इसके निष्कर्ष इस विचार का समर्थन करते हैं कि स्व-संगठित मोटर प्रतिनिधित्व एक शक्तिशाली तरीका है जिससे ऐसे रोबोट बनाए जा सकते हैं जो हर संभावित परिदृश्य के विशाल डेटाबेस की आवश्यकता के बिना, मानवीय क्रियाओं को समझ और अनुमान लगा सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।