Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control
यह शोध पत्र एक रनटाइम-इन्क्रीमेंटल ट्रांसफॉर्मर तंत्र प्रस्तुत करता है जो संदर्भ प्रतिनिधित्व क्षमता (context representational capacity) और हेड रिडंडेंसी के आधार पर सुदृढीकरण लर्निंग (reinforcement learning) के दौरान अटेंशन हेड्स को गतिशील रूप से बढ़ाता और छाँटता है, जिससे गैर-अवलोकनीय घर्षण स्मृति (non-observable friction memory) वाले रोबोटिक मैनिपुलेटर्स के दीर्घ-क्षितिज अनुकूलन (long-horizon adaptive control) में होने वाली विनाशकारी विफलताओं को समाप्त किया जा सके और लागतपूर्ण ऑफलाइन हाइपरपैरामीटर ट्यूनिंग की आवश्यकता को हटाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
सटीकता के साथ चलने वाले रोबोट, जैसे कि कारें असेंबल करने या नाजुक सामग्रियों को संभालने के लिए कारखानों में उपयोग किए जाने वाले हाथ (आर्म्स), यह जानने के लिए कि कितना बल लगाना है, जटिल गणित पर निर्भर करते हैं। दशकों से, इंजीनियर 'कंप्यूटेड-टॉर्क कंट्रोल' नामक एक विधि का उपयोग करते रहे हैं, जो किसी जोड़ (जॉइंट) को वांछित स्थान पर ले जाने के लिए आवश्यक सटीक धक्के या खिंचाव की गणना करता है। यह तब अच्छी तरह काम करता है जब रोबोट की गति अनुमानित होती है, लेकिन वास्तविक दुनिया की मशीनें एक छिपी हुई समस्या का सामना करती हैं: घर्षण (फ्रिक्शन)। जबकि कुछ घर्षण सरल और स्थिर होता है, अन्य प्रकार के घर्षण, जैसे कि 'स्ट्राइबेक फ्रिक्शन' के रूप में ज्ञात चिपचिपा-फिसलन (स्टिकी-स्लिप) व्यवहार, एक छिपी हुई आंतरिक अवस्था पर निर्भर करता है जो समय के साथ बदलती रहती है। चूंकि रोबोट के सेंसर इस छिपी हुई अवस्था को सीधे नहीं देख सकते, इसलिए सिस्टम अपनी वर्तमान स्थिति के आधार पर अपने भविष्य के व्यवहार की भविष्यवाणी करने की क्षमता खो देता है। इसे हल करने के लिए, शोधकर्ताओं ने आर्टिफिशियल इंटेलिजेंस की ओर रुख किया है, विशेष रूप से 'रीइन्फोर्समेंट लर्निंग' नामक सीखने के एक प्रकार की ओर, जहाँ एक कंप्यूटर प्रोग्राम प्रयास और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखता है। हालाँकि, ये प्रोग्राम अक्सर एक विशिष्ट आर्किटेक्चरल विशेषता का उपयोग करते हैं जिसे 'अटेंशन मैकेनिज्म' कहा जाता है, जो एक स्पॉटलाइट की तरह कार्य करता है, जिससे AI को अपने हालिया इतिहास के विभिन्न हिस्सों पर ध्यान केंद्रित करने की अनुमति मिलती है। इन स्पॉटलाइट्स, या "हेड्स" की संख्या आमतौर पर प्रशिक्षण शुरू होने से पहले ही तय कर दी जाती है, जिसे एक लंबी और महंगी खोज प्रक्रिया के माध्यम से चुना जाता है। यदि चुनी गई संख्या बहुत कम है, तो रोबोट सीखने में विफल रहता है; यदि यह बहुत अधिक है, तो सिस्टम अक्षम हो जाता है।
इस अध्ययन के पीछे के शोधकर्ताओं ने इस कठोरता को ठीक करने के लिए एक ऐसा सिस्टम बनाने का लक्ष्य रखा जो सीखने के दौरान अपना निर्णय स्वयं बदल सके। उन्होंने एक नया कंट्रोलर विकसित किया जो पहले से हेड्स की संख्या तय नहीं करता है। इसके बजाय, यह प्रशिक्षण प्रक्रिया के दौरान अपने प्रदर्शन को देखता है और जब इसे कार्य की जटिलता से अभिभूत महसूस होता है, तो नए हेड्स जोड़ देता है, या जब इसे एहसास होता है कि कुछ हेड्स कुछ भी नहीं कर रहे हैं, तो उन्हें हटा देता है। यह वास्तविक समय में होता है, बिना सीखने की प्रक्रिया को रोके। सिस्टम निर्णय लेने के लिए दो सरल संकेतों का उपयोग करता है। पहला, यह मापता है कि रोबकी इतिहास से कितनी नई जानकारी आ रही है; यदि जानकारी वर्तमान हेड्स की संख्या के लिए बहुत जटिल है, तो सिस्टम एक नया हेड विकसित करता है। दूसरा, यह जाँचता है कि प्रत्येक हेड अंतिम निर्णय में कितना योगदान दे रहा है; यदि कोई हेड बहुत कम काम कर रहा है, तो सिस्टम उसे चुपचाप हटा देता है। महत्वपूर्ण रूप से, शोधकर्ताओं ने सिस्टम को इस तरह से डिज़ाइन किया है कि हेड को जोड़ने या हटाने से रोबोट के व्यवहार में अचानक उछाल या त्रुटि न आए। जब एक नया हेड जोड़ा जाता है, तो यह शून्य प्रभाव के साथ शुरू होता है, जिससे रोबोट की गति सुचारू बनी रहती है। जब एक हेड हटाया जाता है, तो परिवर्तन इतना सूक्ष्म होता है कि वह सीखने में बाधा नहीं डालता।
टीम ने इस दृष्टिकोण का परीक्षण एक सिम्युलेटेड दो-जोड़ वाले रोबोटिक आर्म पर किया, जो अल्पकालिक से दीर्घकालिक देरी तक विभिन्न स्तरों की 'फ्रिक्शन मेमोरी' का सामना कर रहा था। हेड्स की निश्चित संख्या का उपयोग करने वाले पिछले प्रयोगों में, सिस्टम सबसे कठिन, लंबी-स्मृति वाले परिदृश्यों में पूरी तरह से विफल रहा, जिससे अक्सर रोबोट नियंत्रण खो देता था या अपने द्वारा उठाए जा रहे भार को अनदेखा कर देता था। नए रनटाइम-एडजस्टेबल सिस्टम के साथ, रोबोट हर एक परीक्षण में सफल रहा, यहाँ तक कि उन कठिन मामलों में भी जहाँ पुराना तरीका विफल हो गया था। शोधकर्ताओं ने पाया कि सिस्टम ने हेड्स की किसी विशिष्ट "प्राकृतिक" संख्या की खोज नहीं की जो कार्य के लिए अंतर्निहित हो; इसके बजाय, इसने मुख्य अभियान के प्रत्येक रन में अधिकतम हेड-काउंट कैप को संतृप्त (सैचुरेट) कर दिया, और अप्रयुक्त हेड्स को हटाने के लिए प्रून ट्रिगर कभी सक्रिय नहीं हुआ। दिलचस्प बात यह है कि लाभ सिस्टम के अंतिम आकार से नहीं आया, बल्कि इस बात से आया कि यह कैसे विकसित हुआ। हेड्स को जोड़ने की क्रमिक प्रक्रिया ने एक 'ट्रेनिंग करिकुलम' की तरह कार्य किया, जिससे रोबोट को एक साथ एक जटिल कार्य में झोंकने के बजाय चरण-दर-चरण सीखने में मदद मिली। यह सुझाव देता है कि सीखने के दौरान आर्किटेक्चर को अनुकूलित करने की क्षमता, एक विशाल, पूर्व-निर्मित संरचना होने से अधिक महत्वपूर्ण है। परिणाम स्वरूप, वास्तविक दुनिया के अव्यवस्थित और अप्रत्याशित घर्षण को संभालने के लिए रोबोट को सिखाने का एक अधिक मजबूत और कुशल तरीका प्राप्त हुआ, जिससे रोबोट के चलने से पहले सही सेटिंग्स खोजने के लिए महंगी ट्रायल-एंड-एरर खोज की आवश्यकता समाप्त हो गई।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।