Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Motus2 एक स्व-विकसित सामान्य वर्ल्ड मॉडल है जो डेक्सट्रस मैनिपुलेशन (dexterous manipulation) के लिए पॉलिसी, सिमुलेशन और मूल्यांकन को एक क्लोज्ड डिसीजन-एंड-लर्निंग लूप में एकीकृत करता है, जो निरंतर सुधार को सक्षम करने के लिए स्केल्ड मॉडल आर्किटेक्चर और प्रगतिशील रूप से विस्तारित मल्टी-मोडल डेटासेट्स का लाभ उठाता है ताकि विशेषज्ञ प्रदर्शनों और स्व-निर्मित इंटरेक्शन डेटा दोनों के माध्यम से निरंतर सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसा रोबोट बनाने के लिए जो वास्तव में मानवीय कार्यों की अव्यवस्थित और अप्रत्याशित दुनिया को संभाल सके, वैज्ञानिक लंबे समय से एक ऐसी प्रणाली की तलाश कर रहे हैं जो केवल निर्देशों की एक सूची का पालन करने से कहीं अधिक हो। लक्ष्य एक ऐसी मशीन बनाना है जो अपने परिवेश को समझ सके, यह कल्पना कर सके कि आगे क्या हो सकता है, एक कदम उठा सके, और फिर अगली बार बेहतर करने के लिए परिणाम से सीख सके। "वर्ल्ड मॉडल" (विश्व मॉडल) के रूप में जानी जाने वाली यह अवधारणा, रोबोट के लिए एक आंतरिक सिम्युलेटर की तरह कार्य करती है। केवल वर्तमान में जो दिख रहा है उस पर प्रतिक्रिया देने के बजाय, रोबोट अपने वास्तविक आंदोलनों से पहले उनके परिणामों का अनुमान लगाने के लिए मानसिक सिमुलेशन चलाता है। जबकि इन प्रणालियों के शुरुआती संस्करण भविष्य की भविष्यवाणी कर सकते थे या कोई चाल सुझा सकते थे, वे अक्सर एक सीधी रेखा में काम करते थे: देखना, अनुमान लगाना, कार्य करना और रुक जाना। उनमें अपने स्वयं के अनुमानों को पीछे मुड़कर देखने, यह आंकने कि वे अच्छे थे या बुरे, और बिना हर बार किसी इंसान द्वारा सही रास्ता दिखाए, अपने निर्णय लेने के कौशल को सुधारने का तरीका नहीं था।
शोधकर्ताओं की एक टीम ने अब 'मोटस2' (Motus2) नामक एक प्रणाली पेश की है, जो एक स्व-विकसित रोबोटिक मस्तिष्क है जिसे विशेष रूप से औजारों का उपयोग करने या मानव जैसे हाथों से वस्तुओं को संभालने जैसे नाजुक और जटिल कार्यों के लिए डिज़ाइन किया गया है। यह प्रणाली एक महत्वपूर्ण कदम है क्योंकि यह सोचने और सीखने के बीच के चक्र को पूरा करती है। एक निष्क्रिय पर्यवेक्षक या एक साधारण अनुयायी होने के बजाय, मोटस2 अपना स्वयं का शिक्षक बनता है। यह संभावित कदमों की एक श्रृंखला प्रस्तावित करता है, सिमुलेट करता है कि भविष्य में वे कदम कैसे दिखेंगे, और फिर मूल्यांकन करता है कि क्या वे अनुमानित परिणाम सफलता की ओर ले जाएंगे। यदि सिमुलेशन विफलता दिखाता है, तो रोबोट उस गलती से सीखता है। यदि यह सफलता दिखाता है, तो यह उस पथ को सुदृढ़ करता है। यह चक्र रोबोट को अपनी नीति, या कार्य करने के अपने नियमों के सेट को लगातार अपने विचारों का परीक्षण और शोधन करके बेहतर बनाने की अनुमति देता है, भले ही उसके पास हर चरण में मार्गदर्शन के लिए कोई मानव न हो।
इस प्रणाली की नींव मानव हाथों से एकत्र किए गए डेटा की एक विशाल मात्रा पर टिकी है। शोधकर्ताओं ने रोबोट को यह सिखाने से शुरुआत की कि मनुष्य दुनिया के साथ कैसे बातचीत करते हैं, इसके लिए प्रथम-व्यक्ति परिप्रेक्ष्य (first-person perspective) से रिकॉर्ड किए गए वीडियो का उपयोग किया गया, जैसे कि कैमरा व्यक्ति के सिर पर लगा हो। उन्होंने सरल, एकल-लेंस वाले वीडियो के साथ शुरुआत की जिसमें खाना पकाने से लेकर व्यवस्थित करने तक विभिन्न प्रकार के कार्य दिखाए गए थे, और फिर अधिक उन्नत, सिंक्रोनाइज़्ड स्टीरियो वीडियो की ओर बढ़े जो मानव द्विनेत्री दृष्टि (binocular vision) की तरह गहराई का अहसास कराते हैं। इसने रोबोट को इस सूक्ष्म भौतिकी को समझने में मदद की कि हाथ कैसे पकड़ते हैं, उठाते हैं और वस्तुओं का संचालन करते हैं। हालाँकि, केवल मनुष्यों को देखना एक अलग शरीर वाले रोबोट के लिए पर्याप्त नहीं है। शोधकर्ताओं ने फिर सिस्टम को प्रशिक्षण के एक मध्य चरण के माध्यम से निर्देशित किया जहाँ इसने उन मानवीय गतिविधियों को अपने स्वयं के रोबोटिक हाथों और भुजाओं के विशिष्ट यांत्रिकी में अनुवाद करना सीखा। इस प्रक्रिया में रोबोट को हजारों घंटों के मानव डेटा के साथ-साथ मानव और रोबोट कैसे मिलकर काम कर सकते हैं, इसके विशिष्ट उदाहरण दिखाए गए, जिससे मानवीय अंतर्ज्ञान और रोबोटिक निष्पादन के बीच के अंतर को पाटने में मदद मिली।
मोटस2 जो इसे अद्वितीय बनाता है वह यह है कि यह इस ज्ञान का उपयोग कैसे करता है। यह प्रणाली एक एकल, एकीकृत मॉडल के इर्द-गिर्द बनी है जो एक साथ तीन अलग-अलग भूमिकाएँ निभाती है। पहला, यह एक 'पॉलिसी' के रूप में कार्य करता है, जो अगला कदम उठाने का सुझाव देता है। दूसरा, यह एक 'सिम्युलेटर' के रूप में कार्य करता है, जो भविष्यवाणी करता है कि उस क्रिया के बाद दुनिया कैसी दिखेगी। तीसरा, यह एक 'इवैल्यूएटर' (मूल्यांकक) के रूप में कार्य करता है, जो यह निर्णय लेता है कि वह अनुमानित भविष्य अच्छा है या बुरा। पारंपरिक प्रणालियों में, ये कार्य अक्सर अलग या असंबद्ध होते हैं, लेकिन यहाँ वे आपस में मजबूती से जुड़े हुए हैं। जब रोबोट किसी चाल पर विचार करता है, तो वह तुरंत परिणामों को देखने के लिए एक मानसिक सिमुलेशन चलाता है। फिर वह खुद से पूछता है कि क्या वह परिणाम वांछनीय है। यदि उत्तर 'नहीं' है, तो वह उस पथ को त्याग देता है और दूसरा प्रयास करता है। यदि उत्तर 'हाँ' है, तो वह उस क्रिया को पूरा करता है। यह आंतरिक संवाद इतनी तेज़ी से होता है कि रोबोट कई चरणों आगे की योजना बना सकता है, और अपनी मांसपेशी हिलाने से पहले ही सबसे अच्छे पथ का चयन कर सकता है।
शोधकर्ताओं ने इस प्रणाली का परीक्षण एक पूर्णतः रोबोटिक प्लेटफॉर्म पर किया जो दो भुजाओं, दो कुशल हाथों और स्पर्श महसूस करने वाले सेंसरों से लैस है, जो मानव उंगलियों के समान हैं। उन्होंने रोबोट को कठिन कार्यों की एक श्रृंखला दी, जैसे कि एक गेंद को एक विशिष्ट स्थान पर रखना, सॉकेट में बल्ब पेंच से कसना, या पेन से इरेज़र जोड़ना। इन परीक्षणों में, कार्यों के दौरान अपने आंतरिक मूल्यांकनकर्ता का उपयोग करने की रोबोट की क्षमता निर्णायक साबित हुई। जब सिस्टम को कार्य के दौरान सर्वोत्तम विकल्पों का चयन करने के लिए अपने आंतरिक मूल्यांकनकर्ता का उपयोग करने की अनुमति दी गई, तो इसकी सफलता दर में उल्लेखनीय सुधार हुआ। इससे भी अधिक प्रभावशाली बात यह थी कि जब सिस्टम को अपने स्वयं के भविष्यवाणियों का उपयोग करके अपने सीखने के नियमों को अपडेट करने की अनुमति दी गई, तो यह कार्य में और भी बेहतर हो गया। रोबोट केवल भाग्यशाली नहीं हुआ; उसने वास्तव में उन गलतियों से बचना सीखा जिन्हें उसने सिम्युलेट किया था और उन कार्यों को दोहराना सीखा जिन्हें उसने सफलता के लिए सिम्युलेट किया था।
इस सफलता का एक प्रमुख हिस्सा कार्य के दौरान पहले क्या हुआ था, इसे याद रखने की रोबोट की क्षमता थी, भले ही वह जानकारी अस्थायी रूप से दृश्य से ओझल हो गई हो। कई जटिल कार्यों में, एक हाथ वस्तु के दृश्य को बाधित कर सकता है, या एक महत्वपूर्ण चरण अंतिम परिणाम दिखने से बहुत पहले हो सकता है। इसे संभालने के लिए, शोधकर्ताओं ने रोबोट को एक प्रकार की 'वर्किंग मेमोरी' (कार्यकारी स्मृति) दी जो अतीत के महत्वपूर्ण दृश्य विवरणों को थामे रख सकती थी। उन्होंने इस स्मृति को प्रबंधित करने के विभिन्न तरीकों का परीक्षण किया, जिसमें हाल की घटनाओं की एक छोटी, चलती हुई विंडो रखने से लेकर एक लंबे, अधिक विस्तृत इतिहास को बनाए रखने तक शामिल था। परिणामों ने दिखाया कि लंबी स्मृति तक पहुँच होने से रोबोट को उन कार्यों को हल करने में मदद मिली जिनमें लंबे समय तक घटनाओं के क्रम को याद रखने की आवश्यकता थी, जिससे यह सिद्ध हुआ कि अतीत को याद रखना भविष्य की भविष्यवाणी करने जितना ही महत्वपूर्ण है।
सिस्टम में स्पर्श के लिए एक विशेष मॉड्यूल भी शामिल किया गया था। जबकि दृष्टि शक्तिशाली है, यह हमेशा यह नहीं बता सकती कि पकड़ ढीली हो रही है या सतह बहुत नरम है। रोबोट को स्पर्श संबंधी फीडबैक (tactile feedback) को संसाधित करने के लिए समर्पित एक हल्का विशेषज्ञ सिस्टम दिया गया था। इसने उसे वास्तविक समय में अपनी गतिविधियों को परिष्कृत करने, पकड़ ढीली होने या दबाव में बदलाव महसूस होते ही अपनी पकड़ को समायोजित करने की अनुमति दी। देखने, महसूस करने, सोचने और सीखने के इस संयोजन ने एक मजबूत प्रणाली बनाई जो वास्तविक दुनिया की अनिश्चितताओं को संभालने में सक्षम है।
निष्कर्ष बताते हैं कि वास्तव में सक्षम रोबोट का मार्ग केवल अधिक डेटा एकत्र करने में नहीं, बल्कि ऐसी प्रणालियाँ बनाने में है जो उस डेटा का उपयोग स्वयं को प्रश्न पूछने और सुधारने के लिए कर सकें। बड़े पैमाने पर मानवीय संपर्क डेटा को भविष्यवाणी और मूल्यांकन के स्व-सुधार चक्र के साथ जोड़कर, मोटस2 ने प्रदर्शित किया कि रोबोट भौतिक दुनिया को हेरफेर करने के लिए अनुकूलन क्षमता के एक ऐसे स्तर को प्राप्त कर सकते हैं जो पहले पहुंच से बाहर था। शोधकर्ताओं ने पाया कि जैसे-जैसे उन्होंने प्रशिक्षण के लिए उपयोग किए गए स्टीरियो वीडियो डेटा की मात्रा बढ़ाई, मानव क्रियाओं की भविष्यवाणी करने की रोबोट की क्षमता में निरंतर और अनुमानित सुधार हुआ। यह स्केलिंग (पैमाना) बताती है कि और भी अधिक डेटा के साथ, ये प्रणालियाँ और भी अधिक कुशल हो सकती हैं। अंततः, यह कार्य दर्शाता है कि एक रोबोट को हर संभव समस्या के लिए हर संभावित समाधान के साथ प्रोग्राम करने की आवश्यकता नहीं है। इसके बजाय, यदि वह भविष्य का सिमुलेशन कर सकता है, परिणाम का निर्णय ले सकता है, और अंतर से सीख सकता है, तो वह एक जटिल और कुशल दुनिया की चुनौतियों का सामना करने के लिए अपने कौशल विकसित कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।