REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff
यह शोध पत्र REVERSAL-BENCH प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह दर्शाता है कि स्वायत्त सुदृढीकरण शिक्षण (reinforcement learning) एजेंट एक तीव्र "रीसेट-मुक्त ढलान" (reset-free cliff) का सामना करते हैं जहाँ पर्यावरणीय अपरिवर्तनीयता में वृद्धि उन्हें बाहरी रीसेट पर निर्भर एपिसोडिक एजेंटों के विपरीत, स्थायी रूप से अपूरणीय अवस्थाओं में फँसा देती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोटिक हाथ मेज पर ब्लॉक को एक के ऊपर एक रखने (स्टैक करने) का अभ्यास कर रहा है। कंप्यूटर सिमुलेशन की आदर्श दुनिया में, यदि रोबोट एक ब्लॉक को गिरा देता है, तो एक मानव प्रोग्रामर बस एक बटन दबाकर ब्लॉक को वापस अपनी जगह पर रख देता है, और रोबोट फिर से प्रयास करता है। यह 'रीसेट' एक सुरक्षा जाल की तरह काम करता है जो आर्टिफिशियल इंटेलिजेंस को वास्तविक दुनिया को नुकसान पहुँचाए बिना, परीक्षण और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखने की अनुमति देता है। हालाँकि, रोबोटिक्स का अंतिम लक्ष्य ऐसी मशीनें बनाना है जो बिना किसी मानवीय हस्तक्षेप के, बिना कभी भी उस 'रीसेट' बटन को दबाए, निरंतर कार्य कर सकें। चुनौती यह है कि वास्तविक दुनिया स्थायी गलतियों से भरी होती है। यदि कोई रोबोट कप को मेज से नीचे धकेल देता है, तो कप टूट जाता है या दूर लुढ़क जाता है; यदि वह रेत का ढेर बिखेर देता है, तो कण बिखर जाते हैं और उन्हें केवल गति को उलटने (रिवर्स करने) से वापस एक व्यवस्थित ढेर में नहीं इकट्ठा किया जा सकता। ये अपरिवर्तनीय अवस्थाएँ (irreversible states) हैं, वे क्षण जहाँ शुरुआत पर वापस जाने का मार्ग भौतिक रूप से अवरुद्ध हो जाता है। एक ऐसे रोबोट के लिए जिसे रीसेट नहीं किया जा सकता, ऐसी अवस्था में प्रवेश करने का अर्थ है कि सीखने की प्रक्रिया हमेशा के लिए रुक जाती है, और वह एक ऐसी विफलता में फंस जाता है जिससे वह बाहर नहीं निकल सकता।
एप्पल (Apple) के शोधकर्ताओं ने REVERSAL-BENCH नामक एक नया परीक्षण मैदान बनाया है ताकि यह अध्ययन किया जा सके कि जब रोबोट को रीसेट नहीं किया जा सकता, तो वे कैसे विफल होते हैं। 'रिवर्सिबिलिटी' (पुनरावर्तनीयता) को केवल हाँ या ना की स्थिति मानने के बजाय, उन्होंने एक निरंतर डायल (dial) बनाया है जो यह नियंत्रित करता है कि गलती से उबरना कितना आसान या कठिन है। डायल के एक छोर पर, वातावरण पूरी तरह से क्षमशील है; एक रोबोट किसी भी चीज़ से टकरा सकता है और अपनी शुरुआती स्थिति में वापस आ सकता है। दूसरे छोर पर, वातावरण अक्षम है, जिसमें ऐसे जाल हैं जो रोबोट को कार्य से स्थायी रूप से बाहर कर देते हैं। इस डायल को घुमाकर, टीम देख सकी कि जैसे-जैसे स्थायी विफलता का जोखिम बढ़ता गया, विभिन्न शिक्षण रणनीतियाँ कितनी सफल रहीं। उन्होंने इन रणनीतियों का परीक्षण पांच अलग-अलग फिजिक्स इंजन के माध्यम से किया, जो जटिल कंप्यूटर प्रोग्राम हैं कि कैसे वास्तविक दुनिया की वस्तुएं चलती हैं, टकराती हैं और अपना आकार बदलती हैं।
परिणामों ने प्रदर्शन में एक तीव्र और अचानक गिरावट दिखाई, जिसे लेखक "रिवर्सिबिलिटी क्लिफ" (reversibility cliff) कहते हैं। जैसे ही वातावरण थोड़ा कम सुधारात्मक हुआ, बिना रीसेट के सीखने पर निर्भर रहने वाले रोबोट विनाशकारी रूप से विफल होने लगे। वे केवल अपने कार्यों में थोड़े खराब नहीं हुए; वे स्थायी रूप से खराब अवस्थाओं में फंस गए। एक बार जब रोबोट एक अपरिवर्तनीय क्षेत्र में प्रवेश कर गया, जैसे कि वह क्षेत्र जहाँ बल इतना अधिक था कि वह उसके विरुद्ध वापस धक्का नहीं दे सका, तो वह कभी भी सुरक्षित शुरुआती क्षेत्र में वापस नहीं लौट सका। क्योंकि उसे रीसेट नहीं किया जा सकता था, वह वहीं फंस गया, प्रभावी ढंग से सीखने या कार्य करने में असमर्थ। यह कई प्रकार के रोबोटों और कार्यों में लगातार हुआ, सरल नेविगेशन से लेकर वस्तुओं के जटिल हेरफेर तक। इसके विपरीत, जिन रोबोटों को समय-समय पर रीसेट करने की अनुमति दी गई, भले ही वह हर कुछ मिनटों में ही क्यों न हो, वे निरंतर सीखते रहे और वे स्थायी रूप से फंसने की समस्या से नहीं घिरे।
यह सुनिश्चित करने के लिए कि यह विफलता विशेष रूप से 'उबरने की अक्षमता' के कारण हुई थी, न कि केवल इसलिए कि कार्य कठिन हो रहे थे, शोधकर्ताओं ने एक चतुर नियंत्रण (control) बनाया। उन्होंने प्रत्येक कठिन, अपरिवर्तनीय कार्य को उसके बिल्कुल समान दिखने वाले एक जुड़वां संस्करण के साथ जोड़ा जो भौतिक रूप से परिवर्तनीय (reversible) था। इन जुड़वां दुनियाओं में, बाधाएं बिल्कुल वैसी ही थीं, लेकिन वे बल जो रोबोट को फंसा देते थे, उन्हें इतना कमजोर कर दिया गया था कि उनसे बचना संभव हो सके। जब रोबोटों का परीक्षण इन परिवर्तनीय जुड़वां दुनियाओं में किया गया, तो उन्होंने पूरी तरह से प्रदर्शन किया, भले ही बाधाएं बड़ी थीं। इससे सिद्ध हुआ कि प्रदर्शन में गिरावट कार्य की ज्यामिति की जटिलता या लक्ष्य की कठिनाई के कारण नहीं थी, बल्कि केवल इसलिए थी क्योंकि रोबोट ने अपनी गलतियों को सुधारने की क्षमता खो दी थी। अध्ययन ने दिखाया कि यह घटना तब भी सत्य है जब रोबोट सरल नियमों का उपयोग कर रहा हो या उन्नत लर्निंग एल्गोरिदम का, और यह कठोर वस्तुओं, नरम सामग्रियों और रेत जैसी दानेदार वस्तुओं के अत्यधिक यथार्थवादी सिमुलेशन में भी बनी रहती है।
टीम ने एक सुरक्षा प्रणाली भी विकसित की जिसे एक ढाल के रूप में कार्य करने के लिए डिज़ाइन किया गया है, जो भविष्यवाणी करती है कि रोबकर कब किसी जाल में फंसने वाला है और उसे उससे दूर ले जाती है। उन्होंने पाया कि यह प्रणाली कैमरा छवियों और स्टेट डेटा से खतरे का सटीक पता लगा सकती है, और अक्सर गिरने या बिखराव होने से पहले ही इसकी भविष्यवाणी कर देती है। हालाँकि, इस प्रणाली की एक सीमा थी: यह रोबोट को तभी बचा सकती थी जब रोबोट के पास शारीरिक रूप से उस जाल से दूर जाने या मुड़ने की क्षमता हो। उन मामलों में जहाँ स्थिति का भौतिक विज्ञान (physics) ऐसी रिकवरी को असंभव बना देता था—जैसे कि मेज के किनारे से फिसलती हुई कोई वस्तु जो रोबोट के हाथ की पहुँच से बहुत करीब थी—सुरक्षा ढाल विफलता की चेतावनी तो दे सकती थी, लेकिन उसे भौतिक रूप रूप से रोक नहीं सकती थी। रोबोट के पास आपदा को रोकने के लिए आवश्यक यांत्रिक उत्तोलन (mechanical leverage) ही नहीं था। यह अंतर महत्वपूर्ण है: जबकि हम ऐसे रोबोट बना सकते हैं जिन्हें पता हो कि वे खतरे में हैं, हम हमेशा ऐसे रोबोट नहीं बना सकते जो हर खतरे से भौतिक रूप से बच सकें।
शोधकर्ताओं ने लगभग 4.5 करोड़ रिकॉर्ड किए गए रोबोट मूवमेंट के क्षणों वाला एक विशाल डेटासेट जारी किया है, जिसमें यह लेबल लगा है कि क्या रोबोट उस विशिष्ट क्षण से उबर सकता है। यह संसाधन अन्य वैज्ञानिकों को एक ज्ञात मानक के विरुद्ध अपनी स्वयं की सुरक्षा प्रणालियों का परीक्षण करने की अनुमति देता है। अध्ययन निष्कर्ष निकालता है कि वास्तविक दुनिया में स्वायत्त रूप से कार्य करने के लिए, हमें यह स्वीकार करना होगा कि कुछ गलतियाँ स्थायी होती हैं। आगे का रास्ता न केवल बेहतर लर्निंग एल्गोरिदम है, बल्कि रिकवरी की भौतिक सीमाओं की मौलिक समझ भी है। यदि एक रोबोट को बिना मानवीय सहायता के काम करना है, तो उसे या तो अपरिवर्तनीय जाल से पूरी तरह बचना होगा या उन्हें बचने की भौतिक क्षमता के साथ डिज़ाइन किया जाना चाहिए, क्योंकि एक बार जब वह ऐसी अवस्था में गिर जाता है जिसे वह उलट नहीं सकता, तो सीखने की प्रक्रिया समाप्त हो जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।