Robust Peak-cost Constrained Reinforcement Learning
यह शोध पत्र पीक-कॉस्ट (peak-cost) द्वारा सीमित मार्कोव निर्णय प्रक्रियाओं (Markov decision processes) के लिए एक सुदृढ़ सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो इंटीग्रल प्रोबेबिलिटी मेट्रिक्स (integral probability metrics) के साथ एक सरोगेट अनुकूलन विधि विकसित करके शून्य द्वैत अंतराल (zero duality gap) की कमी और सिम्युलेटर-से-वास्तविक-दुनिया के बेमेल (simulator-to-real-world mismatches) को संबोधित करता है, जिससे डायनेमिक्स व्यवधानों के तहत सुरक्षा सुनिश्चित करते हुए मजबूत रिवॉर्ड प्रदर्शन बनाए रखा जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को रस्सी पर चलने (tightrope walking) के लिए प्रशिक्षित कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) कहा जाता है। रोबोट चीज़ों को आज़माकर, गिरकर और फिर से उठकर सीखता है, और अंततः संतुलन बनाना समझ जाता है। आमतौर पर, हम रोबोट को बताते हैं, "बहुत अधिक बार मत गिरना, और जितनी जल्दी हो सके दूसरी ओर पहुँचने की कोशिश करना।" यह एक छात्र को बताने जैसा है, "साल भर में 10 से ज़्यादा 'F' ग्रेड मत लेना, लेकिन जितने हो सकें उतने 'A' ग्रेड पाने की कोशिश करना।"
हालाँकि, वास्तविक दुनिया में, कुछ गलतियाँ इतनी बड़ी होती हैं जिन्हें माफ नहीं किया जा सकता। यदि वह रोबोट एक नाजुक फूलदान लेकर चल रहा है, तो रस्सी से एक बार गिर जाना भी फूलदान को चकनाचूर कर सकता है, भले ही उसने पिछले 99 कदमों में बिल्कुल सही ढंग से चलना सीखा हो। मानक AI प्रशिक्षण अक्सर गलतियों की "औसत" या "कुल" लागत पर ध्यान देता है, जो किसी एक विनाशकारी चूक को छिपा सकता है। यह शोध पत्र एक विशिष्ट, उच्च-जोखिम वाले समस्या का समाधान करता है: हम एक AI को कैसे सिखाएं कि वह अपने पुरस्कारों को अधिकतम करे और साथ ही यह गारंटी भी दे कि उसके द्वारा की गई कोई भी एकल सबसे खराब गलती एक खतरनाक सीमा से नीचे रहे? इसके अलावा, लेखक चिंतित हैं कि रोबोट को एक आदर्श वीडियो गेम सिमुलेशन में प्रशिक्षित किया जा सकता है, लेकिन उसे एक अव्यवस्थित, हवादार वास्तविक दुनिया में तैनात किया जा सकता है। वे पूछते हैं: हम यह कैसे सुनिश्चित करें कि रोबोट केवल इसलिए क्रैश न हो जाए क्योंकि हवा सिमुलेटर के अनुमान से थोड़ी तेज़ चल रही थी?
लेखक, जो अमेरिका के विश्वविद्यालयों के शोधकर्ताओं की एक टीम है, "रॉबस्ट पीक-कॉस्ट कंस्ट्रेंड रीइन्फोर्समेंट लर्निंग" (Robust Peak-cost Constrained Reinforcement Learning) नामक एक क्षेत्र में गहराई से उतरते हैं। वे शुरुआत में पुराने सोचने के तरीके में एक दोष की ओर इशारा करते हैं। वर्षों से, वैज्ञानिक इन सुरक्षा पहेलियों को हल करने के लिए "लैग्रेंजियन मेथड्स" (Lagrangian methods) नामक एक गणितीय उपकरण का उपयोग करते रहे हैं। ये विधियाँ तब बहुत अच्छा काम करती हैं जब आपको समय के साथ होने वाले कुल नुकसान की चिंता होती है। लेकिन लेखकों ने कुछ आश्चर्यजनक खोजा: जब आप किसी भी एक क्षण में होने वाले अधिकतम नुकसान (पीक कॉस्ट) की परवाह करते हैं, तो पुराने गणितीय उपकरण विफल हो जाते हैं। उन्होंने सिद्ध किया कि मानक समस्याओं के विपरीत, इन "पीक कॉस्ट" समस्याओं में हमेशा एक सरल गणितीय शॉर्टकट (जिसे "जीरो डुअलिटी गैप" कहा जाता है) नहीं होता है जो यह गारंटी दे सके कि पुराने तरीके सबसे अच्छा उत्तर ढूंढ लेंगे। वास्तव में, उन्होंने दिखाया कि एक अत्यंत छोटे, सरल दो-अवस्था वाले संसार में भी, पुराने तरीके एक ऐसे समाधान पर अटक सकते हैं जो वास्तव में सबसे अच्छा नहीं है।
तो, उन्होंने इसके बजाय क्या किया? उन्होंने एक नया ढांचा बनाया, जिसे वे RP-CRL कहते हैं। इसे एक नए प्रशिक्षण नियम (training regimen) के रूप में सोचें। रोबोट को केवल "औसत रूप से अच्छा करने" के लिए कहने के बजाय, वे एक "सरोगेट" (surrogate) खेल तैयार करते हैं। इस खेल में, रोबोट को एक साथ दो लक्ष्यों को संतुलित करना होता है: उच्च स्कोर (पुरस्कार) प्राप्त करना और अपने उच्चतम एकल दोष (पीक कॉस्ट) को एक सख्त सीमा के भीतर रखना। लेखकों ने एक विशेष "ट्यूनिंग नॉब" (हाइपरपै參數) का उपयोग करके इन दो लक्ष्यों को संतुलित करने का एक चतुर तरीका डिज़ाइन किया है। यदि रोबोट सुरक्षा नियम तोड़ रहा है, तो प्रशिक्षण पूरी तरह से उस नियम को ठीक करने पर केंद्रित होता है। यदि रोबोट सुरक्षित है, तो प्रशिक्षण उच्च स्कोर प्राप्त करने पर केंद्रित होता है।
"सिम-टू-रियल" (sim-to-real) समस्या (प्रशिक्षण वीडियो गेम और वास्तविक दुनिया के बीच का अंतर) को संभालने के लिए, उन्होंने इसमें "मजबूती" (robustness) की एक परत जोड़ी। कल्पना कीजिए कि रस्सी पर चलने वाले को केवल एक शांत दिन पर प्रशिक्षित नहीं किया जा रहा है, बल्कि सिमुलेटर में यादृच्छिक रूप से हवा के झोंके जोड़े जा रहे हैं और रस्सी के घर्षण (friction) को बदला जा रहा है। रोबोट सबसे खराब स्थिति में जीवित रहने के लिए सीखता है। लेखकों ने यह अनुमान लगाने के लिए एक विधि विकसित की कि अनिश्चित परिस्थितियों में चीजें कितनी खराब हो सकती हैं और उस सबसे खराब स्थिति के लिए तैयार होने के लिए रोबोट की सीखने की प्रक्रिया को समायोजित किया।
उन्होंने अपने नए तरीके का परीक्षण कुछ अलग-अलग परिदृश्यों में किया। सबसे पहले, उन्होंने एक क्लासिक "कार्टपोल" (CartPole) गेम का उपयोग किया, जहाँ एक कार्ट को एक पोल को संतुलित करना होता है। उन्होंने प्रशिक्षण के दौरान गुरुत्वाकर्षण में रैंडम शोर जोड़कर वातावरण को कठिन बना दिया। जब उन्होंने बाद में उन रोबोटों का परीक्षण किया जिनमें गुरुत्वाकर्षण परिवर्तन और भी तेज़ थे, तो पुराने तरीके विफल हो गए—रोबोट गिर गए या सुरक्षा नियमों का उल्लंघन किया। लेकिन नया RP-CRL रोबोट? उसने अपना संतुलन बनाए रखा और सुरक्षित रहा, यहाँ तक कि जंगली गुरुत्वाकर्षण के साथ भी। उन्होंने इसे जटिल, वास्तविक रोबोट सिमुलेशन (जैसे कि एक चार पैरों वाला चींटी या एक तैरने वाला रोबोट) पर भी परखा और समान परिणाम पाए: नए तरीके ने "पीक कॉस्ट" (जैसे कि रोबोट द्वारा उपयोग किया गया अधिकतम बल) को सुरक्षा सीमा के भीतर सुरक्षित रखा, जबकि प्रदर्शन भी अच्छा रहा।
यह शोध पत्र यह दावा नहीं करता है कि उन्होंने ब्रह्मांड की हर सुरक्षा समस्या को हल कर लिया है। वे स्वीकार करते हैं कि यह सिद्ध करना कि उनका नया तरीका कितनी तेज़ी से सटीक उत्तर तक पहुँचता है, भविष्य के शोध का विषय है। हालाँकि, अपने सिमुलेशन के माध्यम से, उन्होंने दिखाया कि उनका दृष्टिकोण एक सुरक्षित सिमुलेशन और एक अराजक वास्तविक दुनिया के बीच के अंतर को प्रभावी ढंग से पाटता है। उन्होंने सिद्ध किया कि गणित के प्रति अपने दृष्टिकोण को बदलकर (पुराने लैग्रेंजियन शॉर्टकट को छोड़कर एक मजबूत सरोगेट को अपनाकर), हम ऐसे AI एजेंट बना सकते हैं जो न केवल औसत रूप से अच्छे हैं, बल्कि जब चीजें गलत होती हैं, तब भी विश्वसनीय रूप से सुरक्षित हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।