Co-Evolving Skill Generation and Policy Optimization
यह शोध पत्र एक ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो मिलान किए गए रोलआउट समूहों की तुलना करके भंडारण से पहले उम्मीदवार कौशलों की सीमांत उपयोगिता को सत्यापित करता है, जिससे अप्रभावी कौशलों को फ़िल्टर किया जाता है और एक ऐसी नीति को प्रशिक्षित किया जाता है जो महंगी मालिकाना मॉडलों पर निर्भर हुए बिना उपयोगी प्रक्रियात्मक ज्ञान को स्वायत्त रूप से उत्पन्न करने और प्राथमिकता देने में सक्षम है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट बटलर को अपना घर साफ करने, रात का खाना बनाने या ऑनलाइन किराने की खरीदारी करने के लिए सिखा रहे हैं। इन कार्यों में वास्तव में कुशल होने के लिए, रोबोट को "कौशल" (skills) सीखने की आवश्यकता होगी—जैसे कि दोबारा उपयोग किए जाने वाले रेसिपी या चरण-दर-चरण मार्गदर्शिका जिन्हें वह किसी भी समान स्थिति का सामना करने पर अपनी याददाश्त से निकाल सके।
यह शोध पत्र SAPO (स्किल-ऑगमेंटेड पॉलिसी ऑप्टिमाइज़ेशन) नामक एक नई प्रणाली पेश करता है ताकि इन रोबोट एजेंटों को बेहतर, तेज़ और सस्ता सीखने में मदद मिल सके। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है।
समस्या: "खराब रेसिपी" का जाल
अतीत में, जब रोबोट नए कौशल सीखने की कोशिश करते थे, तो वे एक बहुत ही बुद्धिमान (लेकिन बहुत महंगे) AI से एक नई "रेसिपी" (कौशल) लिखने के लिए कहते थे, जो रोबोट द्वारा की गई किसी गलती पर आधारित होती थी। रोबोट फिर उस नई रेसिपी को तुरंत अपने पुस्तकालय (library) में सहेज लेता था और उसका उपयोग करना शुरू कर देता था।
लेखकों ने इस दृष्टिकोण में एक बड़ी खामी पाई: सिर्फ इसलिए कि कोई रेसिपी एक स्मार्ट शेफ द्वारा बनाई गई है, इसका मतलब यह नहीं है कि वह अच्छी है।
- कभी-कभी नई रेसिपी शानदार होती है।
- कभी-कभी यह बेकार होती है।
- कभी-कभी यह वास्तव में हानिकारक होती है और रोबोट को और भी अधिक गलतियाँ करने पर मजबूर कर देती है।
चूंकि रोबोट इन रेसिपीज़ को तुरंत सहेज लेता था, इसलिए वह खराब रेसिपीज़ का उपयोग करने लगा, जिससे वह भ्रमित हो जाता था और उसकी सीखने की गति धीमी हो जाती थी। यह एक छात्र की तरह था जो इंटरनेट से मिले खराब अध्ययन सुझावों से अपनी नोटबुक भर रहा है, और फिर उन सुझावों का उपयोग करके पढ़ाई करने की कोशिश कर रहा है, जिससे उसके ग्रेड और भी कम हो रहे हैं।
समाधान: परोसने से पहले "स्वाद परीक्षण" (Taste Test)
SAPO एक प्री-स्टोरेज टेस्ट टेस्ट (भंडारण से पहले स्वाद परीक्षण) पेश करके खेल बदल देता है। हर नई रेसिपी को आँख मूँदकर सहेजने के बजाय, SAPO यह जाँचता है कि क्या नया कौशल वास्तव में अभी मदद करता है या नहीं, इससे पहले कि उसे लाइब्रेरी में जगह मिले।
यहाँ इसकी प्रक्रिया, चरण-दर-चरण दी गई है:
1. नियंत्रित प्रयोग (एक "A/B टेस्ट")
कल्पना कीजिए कि रोबोट एक विशिष्ट समस्या को हल करने की कोशिश कर रहा है, जैसे "वेबसाइट पर लाल शर्ट ढूँढना।"
- ग्रुप A (कंट्रोल ग्रुप): रोबोट उन कौशलों का उपयोग करके समस्या को हल करने की कोशिश करता है जिन्हें वह पहले से ही जानता है।
- ग्रुप B (टेस्ट ग्रुप): रोबोट ठीक उसी समस्या को हल करने की कोशिश करता है, लेकिन इस बार, वह उस नए संभावित कौशल का भी उपयोग करता है जिसे उसने अभी-अभी बनाया है।
SAPO दोनों समूहों को एक साथ, एक ही कंप्यूटर समय (बजट) का उपयोग करके चलाता है। इसे करने के लिए इसे अतिरिक्त समय या पैसे की आवश्यकता नहीं होती है; यह बस उस समय को विभाजित करता है जिसे यह वैसे भी खर्च करने वाला था।
2. स्कोरकार्ड
SAPO परिणामों को देखता है:
- यदि ग्रुप B (नए कौशल के साथ) ग्रुप A की तुलना में काफी बेहतर प्रदर्शन करता है, तो नए कौशल को स्थायी लाइब्रेरी में प्रमोट कर दिया जाता है।
- यदि ग्रुप B का प्रदर्शन समान या उससे खराब है, तो नए कौशल को तुरंत खारिज कर दिया जाता है। वह रोबोट को दोबारा परेशान करने के लिए कभी नहीं आता।
यह सुनिश्चित करता है कि केवल वे कौशल ही रखे जाएं जो वास्तविक, मापने योग्य लाभ प्रदान करते हैं।
3. रोबोट को अपनी खुद की रेसिपी लिखना सिखाना
पहले, रोबोट अपनी सभी नई रेसिपी लिखने के लिए एक बहुत ही महंगे, बाहरी AI (जैसे एक प्रसिद्ध शेफ) पर निर्भर रहता था। जब भी रोबोट कुछ सीखने की कोशिश करता, तो इसमें बहुत पैसा खर्च होता था।
SAPO रोबोट को अपना खुद का शेफ बनना सिखाता है।
- रोबोट टेस्ट टेस्ट से प्राप्त "स्कोरकार्ड" का उपयोग यह सीखने के लिए करता है: "जब मैं इस तरह की रेसिपी लिखता हूँ, तो यह आमतौर पर मदद करती है। जब मैं उस तरह की रेसिपी लिखता हूँ, तो यह आमतौर पर नुकसान पहुँचाती है।"
- समय के साथ, रोबोट अपने स्वयं के उच्च-गुणवत्ता वाले कौशल लिखने में इतना अच्छा हो जाता है कि उसे महंगे बाहरी शेफ को बुलाने की आवश्यकता नहीं पड़ती। वह अपने आप में उच्च-गुणवत्ता वाले कौशल उत्पन्न करना सीख जाता है।
4. पुराने पुस्तकालय की सफाई करना
जैसे-जैसे रोबोट स्मार्ट होता जाता है, कुछ पुराने कौशल अप्रचलित हो सकते हैं। हो सकता है कि "लाल शर्ट खोजने" के लिए एक कौशल बहुत अच्छा रहा हो, लेकिन अब वह बेकार हो गया है क्योंकि रोबोट ने खोजने का एक बेहतर तरीका सीख लिया है।
- SAPO रोबोट की अपनी "अंतरात्मा की आवाज़" (प्रोबेबिलिटी स्कोर) का उपयोग करके पुराने कौशलों की जाँच करता है।
- यदि रोबोट को लगता है, "मैं शायद यह कौशल दोबारा नहीं लिखूँगा क्योंकि यह अब उपयोगी नहीं है," तो उस कौशल को बेहतर कौशलों के लिए जगह बनाने के लिए लाइब्रेरी से हटा दिया जाता है।
यह क्यों मायने रखता है
शोध पत्र दिखाता है कि यह तरीका रोबोट को सिखाने के पिछले तरीकों की तुलना में बेहतर काम करता है।
- बेहतर प्रदर्शन: रोबोट कार्यों को अधिक सफलतापूर्वक हल करते हैं।
- उच्च गुणवत्ता वाले कौशल: लाइब्रेरी उपयोगी उपकरणों से भरी है, कचरे से नहीं।
- सस्ता: रोबोट कौशल उत्पन्न करने के लिए महंगे बाहरी AI पर निर्भर होना बंद कर देते हैं, जिससे पैसा और समय बचता है।
संक्षेप में, SAPO रोबोट के मस्तिष्क के लिए एक स्मार्ट संपादक की तरह है। यह केवल हर नए विचार को अंदर नहीं आने देता; यह उनका परीक्षण करता है, विजेताओं को रखता है, रोबोट को बेहतर विचार लिखना सिखाता है, और कचरे की सफाई करता है, जिससे यह सुनिश्चित होता है कि रोबोट हमेशा उपलब्ध सर्वोत्तम उपकरणों के साथ सीख रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।