← नवीनतम पेपर
🤖 machine learning

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो बड़े भाषा मॉडल एजेंटों को विशिष्ट कार्यों के बीच प्रगतिशील अनुक्रमों में व्यवस्थित करके और कार्यों को हल करने तथा एक विकसित होते कौशल दस्तावेज़ को क्यूरेट करने के लिए एक ही नीति का उपयोग करके हस्तांतरणीय कौशल विकसित करने और पुन: उपयोग करने में सक्षम बनाता है, जिससे मौजूदा बहु-चरणीय या स्वतंत्र-कार्य दृष्टिकोणों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

मूल लेखक: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

प्रकाशित 2026-07-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं। पुराने दिनों में, यदि रोबोट लेवल एक में विफल हो जाता, तो वह सब कुछ भूल जाता, लेवल दो को बिल्कुल शुरुआत से शुरू करता और बस बेहतर होने की उम्मीद करता। यह साइकिल चलाना सीखने जैसा था जहाँ आप गिरते हैं, उठते हैं, और तुरंत एक अलग साइकिल चलाने की कोशिश करते हैं बिना यह याद रखे कि आप कैसे गिरे थे। कई कंप्यूटर प्रोग्राम जिन्हें "AI एजेंट" कहा जाता है, वे इसी तरह काम करते थे: वे हर नई चुनौती को एक बिल्कुल नई, अलग घटना मानते थे, जिससे पिछले अनुभवों से सीखी गई सारी सीख बेकार हो जाती थी।

लेकिन क्या होगा अगर रोबroट एक "चीट शीट" या "डायरी" रख सके जो हर बार खेलने के साथ और भी स्मार्ट होती जाए? यही 'रिनफोर्समेंट लर्निंग' (Reinforcement Learning) नामक क्षेत्र का मूल है, जहाँ AI चीजों को आजमाकर, सफलता के लिए पुरस्कार प्राप्त करके और गलतियों से सीखकर सीखता है। हाल ही में, वैज्ञानिक इन एजेंटों को केवल एक पहेली हल करना ही नहीं, बल्कि सामान्य "कौशल" (skills) सीखना सिखाने की कोशिश कर रहे हैं जो उन्हें कई अलग-अलग पहेलियों को हल करने में मदद करें। बड़ा सवाल यह है कि: आप एक AI को अपने स्वयं के सबक इस तरह से लिखना कैसे सिखा सकते हैं जो बाद में वास्तव में मदद करे, बिना पहले पहेली के विशिष्ट विवरणों में उलझे?

यहाँ SkillRise आता है, जो एक नए तरीके के रूप में AI एजेंटों के लिए एक सुपर-स्मार्ट ट्यूटर की तरह काम करता है। एजेंट को अपना अतीत भुलाने देने के बजाय, SkillRise कार्यों को एक "लेवल-अप" अनुक्रम में व्यवस्थित करता है, जो आसान से कठिन की ओर बढ़ता है। जैसे-जैसे एजेंट खेलता है, वह दो काम एक साथ करता है: वह वर्तमान स्तर को हल करने की कोशिश करता है, और वह अपनी कौशल डायरी को अपडेट करने के लिए एक "क्यूरेटर" के रूप में कार्य करता है। इसे एक वीडियो गेम के पात्र की तरह समझें जो, किसी बॉस को हराने के बाद, केवल अगले स्तर पर नहीं जाता बल्कि तुरंत अपनी जर्नल में एक नई प्रविष्टि लिखता है: "हे, याद रखना कि वह बॉस केवल तब हमला करता था जब आप बाईं ओर होते थे? अगली बार, दाईं ओर रहें।"

SkillRise का जादू AI को पुरस्कृत करने के तरीके में है। यह वर्तमान कार्य को हल करने के लिए अंक देता है, लेकिन यह इस बात के लिए भी अंक देता है कि "डायरी प्रविष्टि" भविष्य के कार्यों को हल करने में एजेंट की कितनी अच्छी तरह मदद करती है। यह AI को सामान्य नियम (जैसे "दाईं ओर रहें") लिखने के लिए प्रोत्साहित करता है, न कि विशिष्ट विवरणों (जैसे "बॉस का नाम बॉब था") के लिए। शोधकर्ताओं ने तीन अलग-अलग "दुनियाओं" पर इसका परीक्षण किया: एक घर जहाँ एजेंट को साफ और व्यवस्थित करना होता है (ALFWorld), एक ऑनलाइन स्टोर जहाँ उसे विशिष्ट वस्तुएं खरीदनी होती हैं (WebShop), और एक विज्ञान प्रयोगशाला जहाँ वह प्रयोग चलाता है (ScienceWorld)।

परिणाम प्रभावशाली थे। SkillRise न केवल उन विशिष्ट कार्यों में बेहतर हुआ जिन पर इसे प्रशिक्षित किया गया था; इसने सीखने का एक तरीका सीखा। जब शोधकर्ताओं ने इसे अभ्यास करने के लिए संबंधित कार्यों के लंबे अनुक्रम दिए, तो एजेंट और भी बेहतर हो गया, जिससे पता चलता है कि वह वास्तव में अपने कौशल का पुन: उपयोग कर रहा था, न कि केवल उत्तरों को रट रहा था। वास्तव में, इसने अन्य शीर्ष तरीकों को महत्वपूर्ण अंतर से पीछे छोड़ दिया—सफलता दर में 8.5 प्रतिशत अंक तक सुधार किया। सबसे आश्चर्यजनक रूप से, भले ही इसे अलग-अलग कार्यों पर प्रशिक्षित किया गया था, फिर भी यह उसी कार्य को बार-बार दोहराने में उन तरीकों से बेहतर था जो विशेष रूप से इसके लिए डिज़ाइन किए गए थे। इसने यह सब पुराने तरीकों की तुलना में बहुत तेज़ी से और कम कंप्यूटिंग शक्ति के साथ किया, जिन्हें मेमोरी प्रबंधित करने के लिए जटिल, बहु-चरणीय पाइपलाइनों की आवश्यकता होती थी।

संक्षेप में, SkillRise सुझाव देता है कि यदि आप चाहते हैं कि एक AI अधिक स्मार्ट हो जाए, तो केवल उसे अभ्यास करने न दें; उसे अपनी बुद्धिमत्ता की एक चलती-फिरती, विकसित होती नोटबुक रखना सिखाएं। "करने" के कार्य को "सीखे गएสิ่งที่ लिखने" से अलग करके, और एजेंट को इस बात के लिए पुरस्कृत करके कि उसका लेखन भविष्य की चुनौतियों के लिए कितना उपयोगी है, हम ऐसे एजेंट बना सकते हैं जो केवल समस्याओं को हल नहीं करते, बल्कि वास्तव में समय के साथ बेहतर समस्या-समाधानकर्ता बनने के लिए अपनी रणनीतियों को विकसित करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →