← नवीनतम पेपर
🤖 AI

SkillMaster: Toward Autonomous Skill Mastery in LLM Agents

SkillMaster एक नवीन प्रशिक्षण ढांचा है जो LLM एजेंटों को प्रक्षेपवक्र-सूचित समीक्षा (trajectory-informed review), प्रतितथ्यात्मक उपयोगिता मूल्यांकन (counterfactual utility evaluation) और एक दोहरे-लाभ वाले सुदृढीकरण लर्निंग एल्गोरिदम के माध्यम से स्वायत्त रूप से कौशल बनाने, परिष्कृत करने और चुनने में सक्षम बनाता है, जिससे बिना किसी बाहरी मार्गदर्शन के जटिल कार्यों पर महत्वपूर्ण प्रदर्शन सुधार और आत्म-सुधार क्षमताएं प्राप्त होती हैं।

मूल लेखक: Min Yang, Jinghua Piao, Xu Xia, Xiaochong Lan, Jiaju Chen, Yongshun Gong, Yong Li

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Min Yang, Jinghua Piao, Xu Xia, Xiaochong Lan, Jiaju Chen, Yongshun Gong, Yong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SKILLMASTER पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ समझाया गया है।

मुख्य विचार: एक लाइब्रेरियन से एक स्व-शिक्षित विशेषज्ञ तक

कल्पना कीजिए कि आप एक रोबोट (एक AI एजेंट) को घर की सफाई करने या ऑनलाइन खरीदारी करने जैसे काम करना सिखा रहे हैं।

पुराना तरीका (वर्तमान तकनीक):
एक बहुत ही सख्त, बाहरी लाइब्रेरियन (Librarian) वाले छात्र के रूप में रोबोट की कल्पना करें।

  • रोबोट एक कार्य करने की कोशिश करता है।
  • यदि वह विफल हो जाता है, तो लाइब्रेरियन (एक बाहरी कंप्यूटर प्रोग्राम) देखता है कि क्या हुआ, एक नया "नियम" या "कौशल" (skill) कागज़ के एक टुकड़े पर लिखता है, और उसे एक किताब में रख देता है।
  • रोबोट को ये नियम लिखना नहीं आता; उसे बस ज़रूरत पड़ने पर किताब में उन्हें ढूँढना होता है।
  • समस्या: रोबोट निष्क्रिय है। वह यह तय नहीं कर सकता कि कोई नियम अच्छा है या बुरा, और वह एक गलत नियम को ठीक भी नहीं कर सकता। वह बस लाइब्रेरियन के निर्देशों का पालन करता है।

नया तरीका (SKILLMASTER):
SKILLMASTER रोबोट को एक स्व-शिक्षित विशेषज्ञ (Self-Taught Expert) में बदल देता है जो अपनी खुद की नोटबुक का प्रबंधन करता है।

  • रोबोट एक कार्य करने की कोशिश करता है।
  • उसके बाद, वह अपने प्रदर्शन को देखता है और पूछता है: "क्या मैंने अच्छा किया? क्या मैं कोई कदम भूल गया? क्या इसे करने का कोई बेहतर तरीका है?"
  • फिर वह एक विशेष टूल का उपयोग करके एक नया नियम लिखने, एक पुराने नियम को सुधारने, या मौजूदा नियमों को बनाए रखने के लिए करता है।
  • महत्वपूर्ण बात यह है कि वह यह सीखता है कि ये नियम कैसे लिखे जाएँ, यह देखकर कि क्या वे वास्तव में अगली बार उसे बेहतर प्रदर्शन करने में मदद करते हैं।

यह कैसे काम करता है: तीन जादुई तरकीबें

पेपर में इन तीन विशिष्ट तरकीबों का परिचय दिया गया है जो इस स्व-शिक्षण को संभव बनाती हैं।

1. "पोस्ट-गेम रिव्यू" (ट्रैजेक्टरी-इन्फॉर्म्ड स्किल रिव्यू)

उदाहरण: कल्पना कीजिए कि एक बास्केटबॉल खिलाड़ी खेल खेलने के तुरंत बाद अपने खेल का रिकॉर्ड देख रहा है।

  • पुराना तरीका: कोच टेप देखता है और खिलाड़ी को बताता है, "अगली बार, बाईं ओर से शॉट मारना।"
  • SKILLMASTER का तरीका: खिलाड़ी टेप देखता है, महसूस करता है, "मैं इसलिए चूक रहा था क्योंकि मैं पहले कोने की जाँच नहीं कर रहा था," और वह उस नोट को अपनी खुद की प्लेबुक में लिख लेता है।
  • पेपर में: AI किसी कार्य (जैसे फ्रिज में टमाटर ढूँढना) को पूरा करने के बाद, वह पूरी घटना की समीक्षा करता है। फिर वह एक "टूल कॉल" (जैसे डिजिटल पेन) का उपयोग करके निर्णय लेता है: एक नया कौशल प्रस्तावित करें, पुराने को अपडेट करें, या चीज़ों को वैसा ही रहने दें।

2. "टेस्ट ड्राइव" (काउंटरफैक्टुअल यूटिलिटी रिवॉर्ड)

उदाहरण: कल्पना कीजिए कि आपने अपने जूते के फीते बाँधने का एक नया तरीका बनाया है। आपको कैसे पता चलेगा कि यह वास्तव में बेहतर है? आप केवल अनुमान नहीं लगाते; आप इसे दूसरे जूतों पर आज़माते हैं कि क्या यह तेज़ी से काम करता है।

  • समस्या: यदि रोबोट अपनी स्किल्स (कौशल) में बदलाव करता है, तो उसे कैसे पता चलेगा कि बदलाव अच्छा है? सिर्फ इसलिए कि वह एक बार सफल रहा, इसका मतलब यह नहीं है कि नया नियम एकदम सही है।
  • SKILLMASTER का तरीका: जब रोबोट अपने कौशल में बदलाव का सुझाव देता है, तो सिस्टम एक "टेस्ट ड्राइव" चलाता है। यह एक अलग लेकिन समान कार्य (एक "प्रोब टास्क") लेता है और पुराने नियमों बनाम नए नियमों का उपयोग करके उसे करने की कोशिश करता है।
    • यदि नए नियम रोबोट को भविष्य के समान कार्यों पर तेज़ी से या वहां सफल होने में मदद करते हैं जहाँ वह पहले विफल हो रहा था, तो रोबोट को "अच्छा काम किया" वाला रिवॉर्ड मिलता है।
    • यदि नए नियम चीज़ों को बदतर बना देते हैं, तो उसे दंड (penalty) मिलता है।
  • परिणाम: रोबोट केवल उन बदलावों को रखने के लिए सीखता है जो वास्तव में उसके प्रदर्शन में सुधार करते हैं।

3. "दो-ट्रैक वाला दिमाग" (DualAdv-GRPO)

उदाहरण: कल्पना कीजिए कि एक ड्राइवर जो एक मैकेनिक भी है।

  • ट्रैक A (ड्राइविंग): "मुझे गड्ढे से बचने के लिए स्टीयरिंग को बाईं ओर मोड़ना होगा।" (इसके लिए तत्काल फीडबैक चाहिए)।
  • ट्रैक B (मैकेनिक): "मुझे इस बोल्ट को कसना चाहिए ताकि कार अगले सप्ताह बेहतर चले।" (इसके लिए दीर्घकालिक फीडबैक चाहिए)।
  • समस्या: यदि आप इन दोनों लक्ष्यों को मिला देते हैं, तो दिमाग भ्रमित हो जाता है। "क्या मुझे बाईं ओर मुड़ना चाहिए या बोल्ट कसना चाहिए?"
  • SKILLMASTER का तरीका: यह सिस्टम इन दो विचारों को अलग करता है। यह ड्राइविंग क्रियाओं के लिए "स्कोर" को नए नियमों को लिखने के "स्कोर" से अलग गणना करता है। फिर, यह उन्हें सावधानीपूर्वक जोड़ता है ताकि रोबोट ड्राइविंग भी सीख सके और सीखने के तरीके को भी सीख सके, बिना एक-दूसरे को बाधित किए।

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने इसका परीक्षण AI के लिए दो प्रसिद्ध "वीडियो गेम" दुनिया में किया:

  1. ALFWorld: एक सिम्युलेटेड घर जहाँ रोबोट को वस्तुओं को हिलाना होता है (जैसे "ठंडे टमाटर को फ्रिज में रखें")।
  2. WebShop: एक सिम्युलेटेड ऑनलाइन स्टोर जहाँ रोबोट को विशिष्ट आइटम खोजने और खरीदने होते हैं (जैसे "20 डॉलर से कम में एक नीली शर्ट खरीदें")।

परिणाम:

  • बेहतर स्कोर: SKILLMASTER ने सभी अन्य तरीकों को पछाड़ दिया, जिसमें शक्तिशाली, प्री-ट्रेंड "टीचर" मॉडल भी शामिल थे। इसने सफलता दर में लगभग 8.8% से 9.3% का सुधार किया।
  • स्व-सुधार: रोबोट केवल भाग्यशाली नहीं था; उसने वास्तव में अपनी गलतियों को पहचानना सीखा। उदाहरण के लिए, यदि वह बार-बार गलत दराजों में भोजन खोज रहा था, तो उसने एक नया नियम लिखा: "पहले कम संभावना वाले क्षेत्रों को न खोजें।"
  • कौशलों का आंतरिककरण: आश्चर्यजनक रूप से, प्रशिक्षण के बाद, रोबोट को अपनी "नोटबुक" देखने की उतनी आवश्यकता भी नहीं पड़ी। उसने कौशल को इतनी अच्छी तरह से आत्मसात कर लिया था कि वे उसकी स्वाभाविक सोच प्रक्रिया का हिस्सा बन गए, जैसे कि एक इंसान जो साइकिल चलाना सीख जाता है और अब उसे संतुलन बनाने के बारे में सोचने की ज़रूरत नहीं पड़ती।

सारांश

SKILLMASTER एक ऐसा ढांचा (framework) है जो AI कौशल को बाहरी कंप्यूटर द्वारा प्रबंधित स्थिर फाइलों के रूप में मानना बंद कर देता है। इसके बजाय, यह AI को अपने अनुभवों के आधार पर अपने स्वयं के नियम लिखने, संपादित करने और परीक्षण करने की क्षमता देता है। यह एक ऐसे छात्र और एक ऐसे छात्र के बीच का अंतर है जिसे पाठ्यपुस्तक थमा दी जाती है और एक ऐसे छात्र के बीच जो अपनी खुद की पाठ्यपुस्तक लिखता है, अपने अध्यायों का परीक्षण करता है, और केवल उन्हीं को रखता है जो उसे 'A' ग्रेड दिलाने में मदद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →