Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning
यह शोध पत्र एंट्रॉपी-स्केल्ड ट्रस्ट रीजन्स (ESTR) को प्रस्तुत करता है, जो एक नवीन एसिंक्रोनस सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो हानिकारक सैंपलिंग शोर और वैध अन्वेषण के बीच अंतर करने के लिए टोकन एंट्रॉपी के आधार पर ऑफ-पॉलिसी सुधार थ्रेशोल्ड को गतिशील रूप से समायोजित करती है, जिससे सटीकता से समझौता किए बिना सिंक्रोनस GRPO की तुलना में 2.6 गुना अधिक गति के साथ बेहतर प्रशिक्षण स्थिरता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को जटिल पहेलियाँ सुलझाना सिखाने की कोशिश कर रहे हैं, जैसे कि भूलभुलैया से रास्ता खोजना या उन्नत गणित करना। इसमें वास्तव में कुशल होने के लिए, रोबोट को चीजों को आजमाकर, यह देखकर कि क्या होता है, और फिर अपने प्रयासों से सीखकर अभ्यास करने की आवश्यकता है। इस प्रक्रिया को 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) कहा जाता है। आमतौर पर, रोबोट तब सबसे अच्छी तरह सीखता है जब वह अभ्यास करता है और ठीक उसी समय सीखता है, अपने सबसे वर्तमान ज्ञान का उपयोग करते हुए। लेकिन यहाँ एक पेच है: यदि रोबोट बहुत लंबी, जटिल पहेली को हल करने की कोशिश कर रहा है जिसमें बहुत समय लगता है, तो एक प्रयास समाप्त होने का इंतजार करने के बाद दूसरा शुरू करना अविश्वसनीय रूप से धीमा हो जाता है। यह एक ऐसे शेफ की तरह है जो एक भोजन बनाता है, उसे चखता है, एक नई रेसिपी लिखता है, और फिर अगला भोजन बनाने से पहले रसोई को ठंडा होने का इंतजार करता है।
गति बढ़ाने के लिए, इंजीनियर "एसिंक्रोनस" (asynchronous) लर्निंग नामक एक तरकीब का उपयोग करते हैं। रोबोट को नए पहेली प्रयास (rollouts) उत्पन्न करने देने के बजाय, इंजीनियर इसे जारी रखते हैं, जबकि उसका मस्तिष्क साथ-साथ अपने पुराने प्रयासों के आधार पर अपने मस्तिष्क को अपडेट (optimizing the policy) कर रहा होता है। यह एक व्यस्त रसोई की तरह है जहाँ शेफ एक नया व्यंजन बना रहा है जबकि सहायक-शेफ (sous-chef) उस व्यंजन को चख रहा है जिसे पाँच मिनट पहले शुरू किया गया था। समस्या यह है कि "पुराना" व्यंजन शायद उस रेसिपी से थोड़ा अलग था जिसका उपयोग शेफ वर्तमान में कर रहा है। यदि शेफ उस पुराने व्यंजन से सीखने की कोशिश करता है बिना यह जाने कि खाना पकाने के बीच में ही रेसिपी बदल गई थी, तो वे भ्रमित हो सकते हैं, गलत सबक सीख सकते हैं, या यहाँ तक कि बहुत खराब खाना बनाना शुरू कर सकते हैं। इस भ्रम को शोधकर्ता "ऑफ-पॉलिसी" (off-policy) डेटा कहते हैं, और यह रोबोट के प्रदर्शन को गिरा सकता है।
यह शोध पत्र, जिसका शीर्षक "Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning" है, ठीक इसी गिरावट को संबोधित करता है। लेखकों ने, जो बायडू (Baidu) और कई शीर्ष विश्वविद्यालयों की एक टीम है, पाया कि इस भ्रम को ठीक करने का सामान्य तरीका त्रुटिपूर्ण था। उन्होंने पाया कि मानक विधि एक कठोर सुरक्षा गार्ड की तरह कार्य करती है जो किसी भी ऐसे व्यक्ति को रोक देती है जो सामान्य से "बहुत अलग" दिखता है, चाहे स्थिति कुछ भी हो। शोधकर्ताओं ने महसूस किया कि एसिंक्रोनस लर्निंग की अराजक, तेज़ दुनिया में, "अलग दिखना" हमेशा बुरा नहीं होता है। कभी-कभी, अलग होना स्वस्थ अन्वेषण (exploration) का संकेत होता है, खासकर जब रोबोट अनिश्चित होता है कि क्या करना है।
टीम ने एक नई विधि पेश की जिसे ESTR (एंट्रॉपी-स्केल्ड ट्रस्ट रीजन) कहा जाता है। एक एकल, कठोर नियम का उपयोग करने के बजाय यह तय करने के लिए कि किस डेटा को रखना है, ESTR एक बुद्धिमान गुरु की तरह कार्य करता है जो संदर्भ को समझता है। यह देखता है कि किसी भी दिए गए क्षण में रोबोट कितना "अनिश्चित" या "भ्रमित" है (एक अवधारणा जिसे एंट्रॉपी कहा जाता है)। यदि रोबोट बहुत आत्मविश्वासी है (कम एंट्रॉपी), तो गुरु सख्त होता है: किसी भी छोटी गलती को खतरनाक शोर (noise) माना जाता है और फेंक दिया जाता है। लेकिन यदि रोबोट अनिश्चित है और अन्वेषण कर रहा है (उच्च एंट्रॉपी), तो गुरु उदार होता है: बड़े बदलावों की अनुमति दी जाती है क्योंकि वे बेहतर समाधान खोजने की कुंजी हो सकते हैं।
इस लचीले, संदर्भ-जागरूक दृष्टिकोण का उपयोग करके, शोधकर्ताओं ने पाया कि ESTR प्रशिक्षण को स्थिर और तेज़ रख सकता है। उनके परीक्षणों में, इसने दिखाया कि ESTR पुराने, धीमे सिंक्रोनस तरीके की तुलना में 2.6 गुना तेज़ी से सीख सकता है, जबकि सटीकता का वही उच्च स्तर प्राप्त करता है। उन्होंने दिखाया कि अनिश्चितता के आधार पर अपने नियमों को स्केल करके, वे मूल्यवान, साहसी अन्वेषण को गलती से फेंकने के बजाय खतरनाक शोर को फ़िल्टर कर सकते हैं जो सफलताओं की ओर ले जाता है। यह साबित हुआ कि AI को सिखाने की दौड़ में, आपको केवल गति की ही नहीं; बल्कि यह जानने के लिए एक स्मार्ट तरीके की भी आवश्यकता है कि कब सख्त होना है और कब रोबोट को भटकने देना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।