Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
यह शोध पत्र एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो रिवॉर्ड अनिश्चितता को रिवॉर्ड फंक्शन के एक वितरण के रूप में मानकर उद्देश्य को पुनर्गठित करके एजेंट के विविध और नियंत्रणीय व्यवहार को स्वाभाविक रूप से प्रेरित करता है, जिससे पारंपरिक एंट्रॉपी रेगुलराइजेशन या ह्यूरिस्टिक विधियों में निहित प्रदर्शन-विविधता ट्रेड-ऑफ को समाप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कहानियाँ लिखना, गणित की समस्याएँ हल करना या नई दवाएँ खोजना सिखा रहे हैं। पुराने तरीके में (जिसे "रीइन्फोर्समेंट लर्निंग" कहा जाता था), आप रोबोट को एक एकल, सख्त नियम पुस्तिका देते थे: "वही करो जिससे सबसे अधिक स्कोर मिले।"
समस्या क्या है? रोबोट जल्दी ही एक उबाऊ, एक ही काम करने वाला यंत्र बन जाता है। वह एक ही 'परफेक्ट' उत्तर ढूँढ लेता है और हर बार वही करता है, जिससे अन्य सभी अच्छे विकल्पों की अनदेखी हो जाती है। यदि आपकी नियम पुस्तिका थोड़ी भी गलत है (जो अक्सर होता है जब इंसान रोबोट का मूल्यांकन करते हैं), तो रोबोट उस छोटी सी गलती को बहुत अधिक सीख सकता है और कुछ बुरा करना शुरू कर सकता है।
यह पेपर रोबोट को सिखाने का एक स्मार्ट तरीका प्रस्तावित करता है। उसे एक नियम पुस्तिका देने के बजाय, आप उसे कई अलग-अलग, थोड़ी भिन्न नियम पुस्तिकाओं का एक बॉक्स देते हैं। आप रोबोट से कहते हैं: "मुझे 100% यकीन नहीं है कि कौन सी नियम पुस्तिका 'असली' है, इसलिए कृपया उन सभी में से हर एक में अच्छा बनने के लिए सीखें।"
यहाँ बताया गया है कि इस पेपर का नया तरीका, जिसे ROSA (रैंडमाइज्ड ऑब्जेक्टिव्स, सेट एक्शन्स) कहा जाता है, रोजमर्रा के उदाहरणों का उपयोग करके कैसे काम करता है:
1. "नियम पुस्तिकाओं का बॉक्स" (रिवॉर्ड अनसर्टेन्टी/पुरस्कार अनिश्चितता)
वास्तविक दुनिया में, हम अक्सर ठीक से नहीं जानते कि हमें क्या चाहिए।
- पुराना तरीका: आप एक शेफ को बताते हैं, "एक परफेक्ट स्टेक बनाओ।" शेफ एक विशिष्ट स्टेक बनाता है और उसे हमेशा के लिए परोसता रहता है। यदि वास्तव में आपको 'रेयर' (कम पका हुआ) स्टेक चाहिए था लेकिन आपने 'परफेक्ट' कह दिया, तो शेफ वहीं अटक जाता है।
- नया तरीका (ROSA): आप शेफ से कहते हैं, "यहाँ 10 अलग-अलग जज हैं। जज A को रेयर पसंद है, जज B को मीडियम, और जज C को वेल-डन (अच्छी तरह पका हुआ)। मुझे नहीं पता कि आज कौन सा जज सही है। कृपया ऐसा स्टेक बनाना सीखें जो इनमें से किसी भी जज को खुश कर सके।"
रोबोट यह सीखता है कि क्योंकि उसे "असली" नियम का पता नहीं है, इसलिए सबसे समझदारी भरा कदम यह है कि वह अपने विकल्पों को खुला रखे और अलग-अलग शैलियों के बीच स्विच करने के लिए तैयार रहे। यह स्वाभाविक रूप से विविधता (diversity) पैदा करता है, बिना रोबोट को केवल 'रैंडम' होने के लिए मजबूर किए।
2. "बेस्ट-ऑफ-मेनी" ट्रिक (सेट एक्शन्स)
रोबोट इस बॉक्स ऑफ नियम पुस्तिकाओं को कैसे संभालना सीखता है?
- पुराना तरीका: रोबोट एक क्रिया (action) करता है, स्कोर प्राप्त करता है, और अपडेट होता है। यदि स्कोर कम है, तो वह घबरा जाता है।
- नया तरीका (ROSA): कल्पना कीजिए कि रोबोट एक परीक्षा दे रहा है। एक प्रश्न का उत्तर देने और बेहतर होने की उम्मीद करने के बजाय, वह एक ही समय में पाँच अलग-अलग उत्तर लिख देता है।
- फिर, बॉक्स में मौजूद हर संभावित "नियम पुस्तिका" (जज) के लिए, रोबोट अपने पाँच उत्तरों को देखता है और उस विशिष्ट जज के लिए सबसे अच्छा उत्तर चुनता है।
- उसे उस "बेस्ट पिक" के आधार पर स्कोर मिलता है।
- अंत में, वह इन स्कोरों का सभी जजों के बीच औसत निकालता है।
यह कहने जैसा है कि: "मुझे एक साथ सब कुछ में परफेक्ट होने की ज़रूरत नहीं है। मुझे बस यह सुनिश्चित करना है कि किसी भी जज के आने पर, मेरी जेब में कम से कम एक ऐसा उत्तर हो जो उन्हें प्रभावित कर सके।"
3. यह "एंट्रॉपी" से बेहतर क्यों है
वैज्ञानिकों ने पहले "कन्फ्यूजन बोनस" (जिसे एंट्रॉपी रेगुलराइजेशन कहा जाता है) जोड़कर रोबोट को विविध बनाने की कोशिश की थी।
- उपमा: यह एक छात्र को यह बताने जैसा है, "तुम्हें अतिरिक्त अंक मिलेंगे यदि तुम अपने उत्तर अजीब या अप्रत्याशित तरीके से लिखते हो।" छात्र केवल बोनस पाने के लिए बड़बड़ाना या अर्थहीन बातें लिखना शुरू कर सकता है, भले ही उत्तर गलत हो।
- ROSA का लाभ: ROSA अव्यवस्था (messiness) के लिए नहीं कहता। यह तैयारी (preparedness) के लिए कहता है। रोब "विविध" इसलिए रहता है क्योंकि उसे अलग-अलग जजों के लिए तैयार रहने की आवश्यकता है। वह उच्च स्कोर पाने के लिए अपनी क्षमता का त्याग नहीं करता; बल्कि, वह अनिश्चितता को संभालने में वास्तव में बेहतर हो जाता है।
4. इस पेपर ने क्या सिद्ध किया
लेखकों ने इस विचार को कई परीक्षणों के माध्यम से चलाया:
- विरोधाभासी जज (Conflicting Judges): जब दो जज विपरीत चीजें चाहते थे (जैसे, "उत्तर को सम बनाओ" बनाम "उत्तर को विषम बनाओ"), तो पुराने तरीके पूरी तरह विफल हो गए क्योंकि निर्देश एक-दूसरे को रद्द कर रहे थे। ROSA दोनों करना सीख गया, संदर्भ के आधार पर सम और विषम उत्तरों के बीच स्विच करना सीख गया।
- एकाधिक सही उत्तर (Multiple Correct Answers): गणित की समस्याओं में, अक्सर एक समस्या को हल करने के कई तरीके होते हैं (छोटा और सरल, या लंबा और विस्तृत)। पुराने तरीकों ने एक शैली चुनी और उसी पर टिके रहे। ROSA ने सभी अलग-अलग वैध शैलियों को उत्पन्न करना सीखा, जिससे उपयोगकर्ता को अधिक विकल्प मिले।
- शोर वाले जज (Noisy Judges): जब जज भ्रमित थे या उन्होंने गलतियाँ कीं (वास्तविक दुनिया की अनिश्चितता का अनुकरण करते हुए), तो ROSA भ्रमित नहीं हुआ। उसने स्वस्थ विविधता बनाए रखी, जबकि अन्य तरीके बुरी आदतों में फंस गए।
निष्कर्ष (The Bottom Line)
यह पेपर तर्क देता है कि विविधता कोई खामी नहीं है; यह तब समझदारी का लक्षण है जब आप सुनिश्चित न हों।
पुरस्कार (reward) को एक एकल संख्या के रूप में नहीं, बल्कि संभावनाओं के वितरण (distribution of possibilities) के रूप में मानकर, और रोबोट को एक साथ संभावित उत्तरों के सेट को देखने के लिए प्रशिक्षित करके, हमें एक ऐसा सिस्टम मिलता है जो है:
- मजबूत (Robust): यदि नियम थोड़े भी गलत हों, तो यह टूटता नहीं है।
- विविध (Diverse): यह स्वाभाविक रूप से कई अलग-अलग अच्छे समाधान पेश करता है।
- कुशल (Efficient): यह केवल रैंडम होने के लिए समय बर्बाद नहीं करता; यह विविध इसलिए रहता है क्योंकि भविष्य अनिश्चित होने पर ऐसा करना ही तर्कसंगत है।
संक्षेप में: एक विशेषज्ञ (specialist) को प्रशिक्षित करने के बजाय जो केवल एक उत्तर जानता है, ROSA एक जनरललिस्ट (generalist) को प्रशिक्षित करता है जो किसी भी चीज़ के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।