MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
यह शोध पत्र MUSE-Autoskill को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) एजेंट फ्रेमवर्क है जो कौशल (skills) को निर्माण, स्मृति, प्रबंधन, मूल्यांकन और परिशोधन के एक एकीकृत जीवनचक्र के माध्यम से प्रबंधित करके कार्य-समाधान क्षमताओं को बढ़ाता है, और उन्हें पुन: प्रयोज्यता, विश्वसनीयता और क्रॉस-टास्क स्थानांतरण में सुधार के लिए दीर्घकालिक, अनुभव-जागरूक परिसंपत्तियों के रूप में मानता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन बहुत भुलक्कड़ सहायक (AI एजेंट) है। जब आप उसे कोई जटिल समस्या हल करने के लिए कहते हैं, जैसे कि लीक होता हुआ पाइप ठीक करना या एक विशाल स्प्रेडशीट को व्यवस्थित करना, तो वह आमतौर पर हर बार इसे शून्य से समझने की कोशिश करता है। वह मैनुअल पढ़ सकता है, कुछ चीजें आजमा सकता है, विफल हो सकता है, फिर से मैनुअल पढ़ सकता है और कुछ और आजमा सकता है। यह धीमा, महंगा है और वह अक्सर एक ही गलती बार-बार करता है।
यह शोध पत्र MUSE-Autoskill पेश करता है, जो इस सहायक को सीखने और बढ़ने में मदद करने का एक नया तरीका है। केवल एक "स्मार्ट दिमाग" होने के बजाय, MUSE इस सहायक को एक निपुण शिल्पकार (Master Craftsman) और एक व्यक्तिगत कार्यशाला (Workshop) में बदल देता है।
यह कैसे काम करता है, इसके सरल अवधारणाओं में विवरण यहाँ दिया गया है:
1. समस्या: "वन-ऑफ" (One-Off) दृष्टिकोण
वर्तमान में, अधिकांश AI सहायक हर कार्य को एक नया साहसिक कार्य मानते हैं। यदि वे किसी विशिष्ट प्रकार की कंप्यूटर त्रुटि को हल करना सीख जाते हैं, तो वे वास्तव में उस ज्ञान को "सुरक्षित" नहीं करते हैं। अगली बार जब आप उनसे पूछेंगे, तो उन्हें इसे फिर से सीखना होगा। यह एक ऐसे शेफ की तरह है जो एक बेहतरीन लासग्ना (lasagna) बनाता है, उसे खाता है, और फिर पूरी रेसिपी भूल जाता है, जिससे अगले ग्राहक के लिए उसे फिर से सामग्री का अनुमान लगाना पड़ता है।
2. समाधान: "कौशल कार्यशाला" (Skill Workshop)
MUSE इस खेल को बदलकर सहायक को एक कार्यशाला (Workshop) देता है जहाँ वे कौशल (Skills) बना सकते हैं, उन्हें स्टोर कर सकते हैं और उन्हें परिष्कृत कर सकते हैं।
एक कौशल (Skill) को केवल एक जादुई मंत्र के रूप में नहीं, बल्कि एक पूर्ण, पूर्व-पैकेज्ड टूलकिट के रूप में सोचें।
- नुस्खा (SKILL.md): निर्देशों का एक स्पष्ट सेट कि उपकरण क्या करता है।
- उपकरण (Scripts): वह वास्तविक कोड या चरण जो काम करने के लिए आवश्यक हैं।
- गुणवत्ता जांच (Tests): एक अंतर्निहित निरीक्षक जो शेल्फ पर रखने से पहले यह सुनिश्चित करता है कि उपकरण काम करता है।
- नोटबुक (.memory.md): एक व्यक्तिगत लॉग जहाँ सहायक लिखता है, "हे, यह टूल बहुत अच्छा काम करता है, लेकिन अगर फ़ाइल बहुत बड़ी है, तो यह क्रैश हो जाता है। मैंने इसे कठिन तरीके से सीखा है।"
3. पांच-चरणीय जीवनचक्र (द क्राफ्ट्समैन रूटीन)
शोध पत्र एक निरंतर लूप का वर्णन करता है जिसका उपयोग MUSE इन कौशलों को प्रबंधित करने के लिए करता है, जो एक मास्टर बढ़ई द्वारा अपने औजारों को प्रबंधित करने के समान है:
- निर्माण (उपकरण बनाना): जब सहायक के सामने ऐसी समस्या आती है जिसे वे मौजूदा उपकरणों से हल नहीं कर सकते, तो वे केवल अनुमान नहीं लगाते। वे रुकते हैं और कहते हैं, "मुझे एक नए उपकरण की आवश्यकता है।" वे उसी समय एक नया स्किल पैकेज बनाते हैं।
- स्मृति (व्यक्तिगत लॉग): हर बार जब किसी कौशल का उपयोग किया जाता है, तो सहायक उसके विशिष्ट नोटबुक में एक नोट लिखता है। क्या यह काम कर गया? क्या यह विफल रहा? क्या यह धीमा था? यह स्किल-लेवल मेमोरी है। यह एक मैकेनिक द्वारा रिंच (wrench) के हैंडल पर लिखने जैसा है: "यह रिंच बहुत तेजी से घुमाने पर बोल्ट को छील देता है।"
- प्रबंधन (शेल्फ को व्यवस्थित करना): सहायक अपनी कार्यशाला को व्यवस्थित रखता है। यदि दो उपकरण एक ही काम करते हैं, तो वे उन्हें मिला देते हैं। यदि कोई उपकरण टूटा हुआ है और कभी काम नहीं करता, तो वे उसे फेंक देते हैं। वे "सर्वश्रेष्ठ" उपकरणों को तुरंत उठाने के लिए तैयार रखते हैं।
- मूल्यांकन (सुरक्षा निरीक्षक): इससे पहले कि किसी नए उपकरण को शेल्फ पर आने की अनुमति दी जाए, उसे एक सख्त परीक्षण से गुजरना होगा। सहायक एक सुरक्षित, अलग वातावरण (sandbox) में उपकरण चलाता है। यदि यह परीक्षण में विफल रहता है, तो उपकरण को ठीक करने के लिए वापस कार्यशाला में भेज दिया जाता है। जब तक यह परफेक्ट न हो जाए, यह शेल्फ तक नहीं पहुँचता।
- परिष्करण (उपकरण को चमकाना): यदि कोई उपकरण परीक्षण में विफल रहता है या वास्तविक दुनिया के काम में विफल होता है, तो सहायक हार नहीं मानता। वे त्रुटि देखते हैं, कोड को ठीक करते हैं, और फिर से प्रयास करते हैं। उपकरण समय के साथ बेहतर होता जाता है।
4. "लॉन्ग-होरिज़न" (Long-Horizon) ट्रिक
AI के लिए सबसे बड़ी समस्याओं में से एक उनकी सीमित "एकाग्रता अवधि" (context window) है। यदि किसी कार्य में 50 चरण हैं, तो AI चरण 50 तक पहुँचते-पहुँचते चरण 1 में किए गए काम को भूल जाता है।
MUSE इसे अनुकूली संपीड़न (Adaptive Compression) के साथ हल करता है। कल्पना कीजिए कि आप एक लंबी कहानी लिख रहे हैं। हर शब्द को रखने के बजाय, आप बीच के अध्यायों को एक छोटे पैराग्राफ में सारांशित करते हैं जबकि शुरुआत और अंत को विस्तृत रखते हैं। MUSE इसे स्वचालित रूप से करता है। यह बातचीत के सबसे महत्वपूर्ण हिस्सों को रखता है और बीच के हिस्से को सारांशित करता है, ताकि AI अपना रास्ता न भूले, भले ही कार्य बहुत लंबा क्यों न हो।
5. परिणाम: लैब में क्या हुआ?
शोधकर्ताओं ने SkillsBench पर इसका परीक्षण किया, जो वास्तविक दुनिया के 51 कार्यों (जैसे डेटा विश्लेषण, कोड ठीक करना, या संचालन की योजना बनाना) का एक सेट है।
- "मानव" आधार रेखा (Human Baseline): यहाँ तक कि जब उन्होंने AI को मनुष्यों द्वारा बनाए गए उपकरण दिए, तब भी MUSE सहायक ने सर्वश्रेष्ठ प्रदर्शन किया। यह अन्य AI की तुलना में निर्देशों को पढ़ने और उपकरणों का उपयोग करने में बेहतर था।
- "स्व-शिक्षित" चमत्कार: सबसे रोमांचक हिस्सा? MUSE सहायक खुद को सिखाने में सक्षम था।
- इसने बिना किसी उपकरण के एक कार्य करने की कोशिश की।
- जब यह सफल हुआ, तो इसने अपनी सफलता से एक स्किल बनाया।
- फिर इसने उस कार्य को फिर से करने के लिए उस स्व-निर्मित कौशल का उपयोग किया।
- परिणाम: उन कार्यों पर जहाँ यह एक कौशल बना सकता था, इसकी सटीकता लगभग 53% से बढ़कर लगभग 88% हो गई। यह वास्तव में उन मनुष्यों से बेहतर हो गया जिन्होंने मूल उपकरण लिखे थे।
- साझा करना अच्छी बात है: सबसे अच्छी बात यह है कि ये कौशल एक ही AI के भीतर बंद नहीं हैं। शोधकर्ताओं ने MUSE द्वारा बनाया गया एक कौशल लिया और उसे एक दूसरे AI (Hermes) को दिया। Hermes तुरंत उस कार्य में बहुत बेहतर हो गया, जिससे साबित हुआ कि ये कौशल सार्वभौमिक उपकरण (universal tools) की तरह हैं जिन्हें कोई भी स्मार्ट कार्यकर्ता उठा सकता है और उपयोग कर सकता है।
सारांश उपमा
एक जूनियर इंटर्न (एक मानक AI) बनाम एक मास्टर क्राफ्ट्समैन (MUSE-Autoskill) की कल्पना करें।
- इंटर्न हर टूटी हुई मशीन को ठीक करने के लिए हर बार पेज एक से मैनुअल पढ़कर कोशिश करता है। वे धीमे होते हैं, गलतियाँ करते हैं, और कल जो सीखा था उसे भूल जाते हैं।
- मास्टर क्राफ्ट्समैन के पास एक कार्यशाला (Workshop) होती है।
- जब वे किसी नई समस्या का सामना करते हैं, तो वे उसके लिए एक कस्टम टूल बनाते हैं।
- वे टूल को टेस्ट करते हैं ताकि यह सुनिश्चित हो सके कि यह काम करता है।
- वे टूल पर इसके सर्वोत्तम उपयोग के बारे में नोट्स लिखते हैं।
- वे अपने शेल्फ को व्यवस्थित रखते हैं ताकि अगली बार सही टूल तुरंत मिल सके।
- यदि कोई टूल टूट जाता है, तो वे उसे ठीक करते हैं और उसे और मजबूत बनाते हैं।
शोध पत्र दिखाता है कि AI को यह "कार्यशाला" और अपने स्वयं के उपकरण बनाने की क्षमता देकर, यह पहले की तुलना में काफी तेज़, अधिक सटीक और कठिन समस्याओं को हल करने में सक्षम हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।