UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex
UniReflex एक सार्वभौमिक, प्लग-एंड-प्ले फ्रेमवर्क है जो एक फास्ट-स्लो रिफ्लेक्स मैकेनिज्म के माध्यम से क्लोज्ड-लूप वेरिएबल इम्पीडेंस कंट्रोल के साथ प्रीट्रेन्ड जेनरेटिव पॉलिसियों को बढ़ाता है, जो नेटवर्क को पुन: प्रशिक्षित किए बिना मजबूत संपर्क विनियमन और पोजीशन तथा फोर्स निष्पादन के बीच निर्बाध संक्रमण को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट मानव गतिविधियों को देखने और उनकी नकल करने में उल्लेखनीय रूप से कुशल हो गए हैं। हजारों वीडियो प्रदर्शनों का अध्ययन करके, आधुनिक आर्टिफिशियल इंटेलिजेंस सिस्टम वस्तुओं को उठाने, ब्लॉकों को एक के ऊपर एक रखने, या मेज पर औजारों को हिलाने जैसी चीजें प्रभावशाली सटीकता के साथ सीख सकते हैं। ये सिस्टम, जिन्हें अक्सर जेनेरेटिव पॉलिसियाँ (generative policies) कहा जाता है, एक धीमे, विचारशील योजनाकार की तरह कार्य करते हैं जो यह तय करता है कि रोबोट का हाथ आगे कहाँ जाना चाहिए। हालाँकि, खाली हवा में चलने और भौतिक दुनिया के साथ अंतःक्रिया करने के बीच एक बड़ा अंतर है। जब एक रोबोट को किसी सतह को पोंछना होता है, बटन दबाना होता है, या किसी चीज़ को पेंच की तरह कसना होता है, तो उसे उस बल (force) को प्रबंधित करना होता है जो वह लगाता है। यदि रोबोट बहुत ज़ोर से दबाव डालता है, तो वह वस्तु को तोड़ सकता है या फिसल सकता है; यदि वह बहुत हल्का दबाव डालता है, तो वह कार्य पूरा करने में विफल रहता है। वर्तमान रोबोट अक्सर यहाँ संघर्ष करते हैं क्योंकि उन्हें एक दृश्य पथ (visual path) का पूरी तरह से पालन करने के लिए डिज़ाइन किया गया है, वे दुनिया को ऐसे मानकर चलते हैं जैसे कि वह कांच से बनी हो जो कभी मुड़ेगी या प्रतिरोध नहीं दिखाएगी। उनमें प्रतिरोध को महसूस करने और वास्तविक समय में अपनी पकड़ या दबाव को समायोजित करने की क्षमता की कमी होती है, जो एक ऐसा कौशल है जो मनुष्यों के लिए स्वाभाविक है लेकिन केवल देखने वाले मशीनों को सिखाना कठिन है।
त्सिंहहुआ विश्वविद्यालय और नानयांग टेक्नोलॉजिकल यूनिवर्सिटी के शोधकर्ताओं ने इस अंतर को पाटने के लिए एक नया दृष्टिकोण विकसित किया है जिसे 'यूनिफ्लेक्स' (UniReflex) कहा जाता है, और यह पूरे रोबोट के मस्तिष्क को फिर से बनाए बिना किया गया है। मौजूदा विशाल, जटिल AI मॉडल को फिर से प्रशिक्षित करने की कोशिश करने के बजाय, उन्होंने उनके ऊपर एक हल्का, तेज़-अभिक्रिया देने वाला स्तर (layer) जोड़ दिया है। मुख्य AI को एक ऐसे ड्राइवर के रूप में सोचें जो मार्ग और गंतव्य जानता है, जबकि यह नया जुड़ाव एक रिफ्लेक्स (reflex) की तरह कार्य करता है जो कार के गड्ढे में जाने पर तुरंत स्टीयरिंग व्हील को समायोजित करता है। यह प्रणाली रोबट के उन आंतरिक विचारों को सुनने के साथ-साथ काम करती है कि वह कहाँ जाना चाहता है, और साथ ही रोबोट की कलाई पर लगने वाले बलों को भी देखती है। यदि रोबोट को अप्रत्याशित प्रतिरोध का सामना करना पड़ता है, तो यह तेज़ स्तर एक सेकंड के अंश के लिए नियंत्रण संभाल लेता है ताकि स्पर्श को कोमल बनाया जा सके या कोण बदला जा सके, जिससे यह सुनिश्चित हो सके कि संपर्क स्थिर बना रहे। महत्वपूर्ण बात यह है कि इस नए स्तर के लिए मूल AI को फिर से प्रशिक्षित करने या संशोधित करने की आवश्यकता नहीं है, जिससे इसे विभिन्न मौजूदा रोबोट मस्तिष्क में तुरंत प्लग किया जा सकता है।
टीम ने कई कठिन कार्यों पर इस पद्धति का परीक्षण किया जिनमें निरंतर भौतिक संपर्क की आवश्यकता होती है, जैसे कि एक घुमावदार सतह को पोंछना, नोट से स्टिकर उतारना, या पोर्ट में चार्जर डालना। इन प्रयोगों में, उन्होंने तीन अलग-अलग प्रकार के प्री-ट्रेंड रोबोट मस्तिष्क का उपयोग किया, जो छोटे मॉडलों से लेकर अरबों पैरामीटर्स वाले विशाल मॉडलों तक विस्तृत थे। जब रोबोटों को केवल उनकी मूल नियोजन क्षमताओं के साथ छोड़ दिया गया, तो वे अक्सर किसी वस्तु को छूते ही विफल हो जाते थे, या तो फिसल जाते थे या बहुत अधिक दबाव डाल देते थे। हालाँकि, जब यूनिफ्लेक्स स्तर को सक्रिय किया गया, तो इन संपर्क-प्रधान कार्यों के लिए सफलता की दर नाटकीय रूप से बढ़ गई। उदाहरण के लिए, स्टिकर उतारने के कार्य में, सफलता की दर एक निम्न आधार रेखा से बढ़कर लगभग नब्बे प्रतिशत हो गई। यह प्रणाली सही दबाव बनाए रखने में विशेष रूप से प्रभावी थी, जिससे रोबोट का हाथ स्थिर रहा, भले ही वस्तु हिल रही हो या सतह असमान हो।
शोध का एक प्रमुख निष्कर्ष यह है कि यह सुधार रोबोट की लक्ष्य तक सटीक रूप से पहुँचने की मूल क्षमता का त्याग किए बिना आता है। नया स्तर एक स्विच की तरह कार्य करता है जो यह जानता है कि कब मुख्य योजनाकार को काम करने देना है और कब सूक्ष्म समायोजन के लिए नियंत्रण लेना है। इससे पहले कि रोबोट किसी भी चीज़ को छुए, वह मूल AI के इच्छित अनुसार बिल्कुल सटीक रूप से चलता है, जिससे उसके उच्च-स्तरीय नियोजन कौशल सुरक्षित रहते हैं। जैसे ही संपर्क का पता चलता है, तेज़ रिफ्लेक्स स्तर सक्रिय हो जाता है ताकि बलों का प्रबंधन किया जा सके, जिससे यह सुनिश्चित हो सके कि रोबोट वस्तु से टकरा न जाए या अपनी पकड़ न खो दे। कर्तव्यों का यह अलगाव रोबोट को उसके आंदोलनों में सटीक और उसकी अंतःक्रियाओं में कोमल दोनों बनाता है। शोधकर्ताओं ने यह भी पाया कि यह दृष्टिकोण अविश्वसनीय रूप से कुशल है। क्योंकि उन्होंने केवल छोटे, तेज़ रिफ्लेक्स स्तर को प्रशिक्षित किया और विशाल मुख्य AI को स्थिर रखा, इसलिए पूरे रोबोट मस्तिष्क को शुरू से फिर से प्रशिक्षित करने की तुलना में इस प्रणाली को प्रशिक्षित करने में लगने वाला समय पच्चीस से छियासठ गुना कम हो गया।
अध्ययन ने यह भी पता लगाया कि सिस्टम अप्रत्याशित बाधाओं को कितनी अच्छी तरह संभालता है, जैसे कि एक सतह जो रोबोट द्वारा पोंछे जाने के दौरान खिसक जाती है या कोई हिस्सा जो थोड़ा हटकर है। इन परिदृश्यों में, मानक रोबोट मॉडल अक्सर संपर्क खो देते थे और कार्य में विफल हो जाते थे। यूनिफ्लेक्स-संवर्धित रोबोटों ने, हालांकि, तेजी से रिकवरी की, और एक सेकंड या उससे कम समय के भीतर सही संपर्क बल को फिर से स्थापित कर लिया। यह लचीलापन बताता है कि यह प्रणाली पिछली विधियों की तुलना में वास्तविक दुनिया की अनिश्चितता के प्रति बेहतर अनुकूलन कर सकती है। शोधकर्ताओं ने नोट किया कि जबकि यह विधि पोंछने या दबाने जैसे निरंतर कार्यों के लिए बहुत अच्छी तरह से काम करती है, लेकिन यह बहुत संक्षिप्त, उच्च-गति वाली क्रियाओं जैसे कि एक तंग सॉकेट में प्लग को तेज़ी से फिट करने में अधिक चुनौतियों का सामना करती है, जहाँ समायोजन का समय अत्यंत कम होता है। फिर भी, परिणाम रोबोट को स्पर्श की भावना देने का एक शक्तिशाली नया तरीका प्रदर्शित करते हैं, जिससे वे बिना पूरी तरह से पुनर्गठित हुए, अधिक सुरक्षित और प्रभावी ढंग से भौतिक दुनिया के साथ अंतःक्रिया कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।