← नवीनतम पेपर
💬 NLP

SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System

SkillMAS एक नॉन-पैरामीट्रिक फ्रेमवर्क है जो अनुकूलन बाधाओं (adaptation bottlenecks) को दूर करने और विविध कार्यों में प्रभावी पोस्ट-डिप्लॉयमेंट विशेषज्ञता सक्षम करने के लिए यूटिलिटी लर्निंग, बाउंडेड स्किल रिफाइनमेंट और एविडेंस-गेटेड रीऑर्गनाइजेशन के माध्यम से कौशल विकास (skill evolution) को मल्टी-एजेंट सिस्टम पुनर्गठन के साथ एक साथ जोड़ता है।

मूल लेखक: Shuai Pan, Yixiang Liu, Jiaye Gao, Te Gao, Weiwen Liu, Jianghao Lin, Zhihui Fu, Jun Wang, Weinan Zhang, Yong Yu

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuai Pan, Yixiang Liu, Jiaye Gao, Te Gao, Weiwen Liu, Jianghao Lin, Zhihui Fu, Jun Wang, Weinan Zhang, Yong Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास जटिल समस्याओं को हल करने के लिए विशेषज्ञ श्रमिकों की एक टीम (एक "Multi-Agent System") है, जैसे कि घर व्यवस्थित करना, कंप्यूटर ठीक करना, या एक स्टोर का प्रबंधन करना। आमतौर पर, जब ये टीमें गलतियाँ करती हैं, तो हम उन्हें दो अलग-अलग तरीकों से ठीक करने की कोशिश करते हैं:

  1. श्रमिकों को नई तरकीबें सिखाना: हम उन्हें बेहतर निर्देश या नए उपकरण देते हैं (Skill Evolution)।
  2. टीम के ढांचे को बदलना: हम और लोगों को काम पर रखते हैं, गलत लोगों को निकाल देते हैं, या यह बदलते हैं कि कौन किसे रिपोर्ट करता है (MAS Restructuring)।

समस्या:
यह पेपर तर्क देता है कि इन दोनों चीजों को अलग-अलग करना आपदा का नुस्खा है। यह एक शेफ को एक परफेक्ट स्टेक बनाना सीखने (Skill) और उसी समय रेस्टोरेंट मैनेजर द्वारा किचन के लेआउट और शेफ की संख्या को बिना शेफ से बात किए बार-बार बदलने (Structure) जैसा है।

  • यदि शेफ को एक नया, फैंसी चाकू मिलता है लेकिन किचन बहुत छोटा है, तो नया कौशल बेकार है।
  • यदि मैनेजर एक नया सहायक शेफ रखता है लेकिन पुराने शेफ ने अभी तक नए उपकरणों का उपयोग करना नहीं सीखा है, तो नया कर्मचारी केवल भ्रमित ही रहेगा।

यह अलगाव ऐसे "बॉटलनेक" (अवरोध) पैदा करता है जहाँ टीम फंस जाती है, अभिभूत हो जाती है, या इस बात को लेकर भ्रमित हो जाती है कि किसे क्या करना चाहिए।

समाधान: SkillMAS
लेखक SkillMAS पेश करते हैं, जो एक ऐसा सिस्टम है जो नए कौशल सीखने और टीम के ढांचे को बदलने को एक ही, जुड़े हुए संवाद के रूप में देखता है। इन्हें अलग-अलग ठीक करने के बजाय, SkillMAS टीम के वास्तविक प्रदर्शन रिकॉर्ड (verified traces) को देखता है ताकि यह तय किया जा सके कि आगे क्या करना है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "स्कोरकार्ड" (Utility Learning)

एक सख्त मैनेजर की कल्पना करें जो केवल प्रमाण के आधार पर क्रेडिट देता है।

  • यदि कोई कार्यकर्ता एक नई तरकीब आजमाता है और वह सफल होती है, तो मैनेजर उसे "सफलता" के रूप में लिख लेता है।
  • यदि कोई कार्यकर्ता एक तरकीब आजमाता है लेकिन विफल हो जाता है, तो मैनेजर नोट करता है कि वह क्यों विफल हुआ।
  • महत्वपूर्ण: मैनेजर केवल इसलिए क्रेडिट नहीं देता क्योंकि किसी कार्यकर्ता ने कुछ कोशिश की थी। वे क्रेडिट तभी देते हैं जब कार्यकर्ता ने वास्तव में वह काम किया हो और वह सफल रहा हो। यह टीम को उन बेकार "कौशलों" को इकट्ठा करने से रोकता है जो केवल अनुमान मात्र थे।

2. "टूलबॉक्स अपडेट" (Bounded Skill Evolution)

जब टीम विफल होती है, तो SkillMAS श्रमिकों को केवल लाखों नए निर्देश नहीं थमा देता। यह एक सावधानीपूर्वक संपादक की तरह कार्य करता है:

  • यह विफलता को देखता है और पूछता है: "क्या यह एक साधारण गलती थी, जैसे कोई स्टेप भूल जाना?" यदि हाँ, तो यह उस एक स्टेप को ठीक करता है।
  • यह पूछता है: "क्या यह एक टूटा हुआ टूल था?" यदि हाँ, तो यह टूल को तेज करता है।
  • "बाउंडेड" (सीमित) वाला हिस्सा: यह तब तक नया कौशल जोड़ने से इनकार करता है जब तक कि वह अत्यंत आवश्यक न हो और प्रमाणित न हो जाए। यह टूलबॉक्स को आधे-अधूरे विचारों वाले एक बिखरे हुए कबाड़ के डिब्बे में बदलने से रोकता है।

3. "टीम पुनर्गठन" (Evidence-Gated Restructuring)

यह इस पेपर का सबसे बड़ा नवाचार है। सिस्टम टीम के ढांचे (भर्ती/छंटनी/विलय) को केवल तभी बदलता है जब प्रमाण यह साबित कर दें कि वर्तमान ढांचा ही समस्या है।

  • परिदृश्य A: टीम इसलिए विफल होती है क्योंकि उन्हें नहीं पता कि कोई काम कैसे करना है। -> उपाय: उन्हें एक नया कौशल सिखाएं। टीम न बदलें।
  • परिदृश्य B: टीम इसलिए विफल होती है क्योंकि बहुत से लोग एक ही काम करने की कोशिश कर रहे हैं, या एक व्यक्ति बहुत सारे अलग-अलग काम करने की कोशिश कर रहा है। -> उपाय: टीम को विभाजित करें। एक विशेषज्ञ को नियुक्त करें।
  • द गेट (द्वार): सिस्टम टीम को पुनर्गठित नहीं करेगा जब तक कि "स्कोरकार्ड" यह न दिखाए कि वर्तमान टीम का लेआउट ही विफलता का विशिष्ट कारण है। यह अनावश्यक ड्रामा और लगातार भर्ती-बदोली से बचता है।

पेपर से वास्तविक दुनिया के उदाहरण

लेखकों ने तीन अलग-अलग "कार्यस्थलों" पर इसका परीक्षण किया:

  1. वर्चुअल हाउस (ALFWorld): एक रोबोट की कल्पना करें जो एक अस्त-व्यस्त कमरे को साफ करने की कोशिश कर रहा है।
    • परिणाम: सिस्टम ने महसूस किया कि रोबोट "वस्तु को खोजने" और "उसे उठाने" के बीच भ्रमित हो रहा था। इसने केवल रोबोट को बेहतर बनाने के बजाय, काम को दो विशेष श्रमिकों में विभाजित कर दिया: एक "खोजकर्ता" (Searcher) और एक "हटाने वाला" (Mover)। इसने सफलता दर को काफी बढ़ा दिया।
  2. कंप्यूटर टर्मिनल (Lifelong Agent Bench): एक कार्यकर्ता की कल्पना करें जो कंप्यूटर फाइलों को ठीक कर रहा है।
    • परिणाम: सिस्टम ने "टेक्स्ट लॉग्स" के लिए एक विशेषज्ञ और "फाइल परमिशन्स" के लिए दूसरा विशेषज्ञ बनाया। इसने एक व्यक्ति को सब कुछ करने से रोका, जिससे त्रुटियां कम हुईं।
  3. रिटेल स्टोर (τ-Bench): एक ग्राहक सेवा एजेंट की कल्पना करें जो रिटर्न और एक्सचेंज संभाल रहा है।
    • परिणाम: आश्चर्यजनक रूप से, सिस्टम ने टीम को विभाजित करने का निर्णय नहीं लिया। इसने महसूस किया कि इस विशिष्ट कार्य के लिए, एक समिति के बजाय एक अत्यधिक कुशल प्रबंधक होना बेहतर है। इसने टीम में अधिक लोग जोड़ने के बजाय एकल प्रबंधक के कौशल में सुधार किया। यह साबित करता है कि सिस्टम यह जानने में स्मार्ट है कि कब पुनर्गठन नहीं करना है।

मुख्य निष्कर्ष (The Bottom Line)

SkillMAS एक ऐसा फ्रेमवर्क है जो कहता है: "केवल टीम को नई तरकीबें न सिखाएं, और न ही केवल कार्डों को इधर-उधर घुमाते रहें। साक्ष्य देखें। यदि समस्या कौशल की कमी है, तो सिखाएं। यदि समस्या खराब टीम संरचना है, तो पुनर्गठन करें। लेकिन सुनिश्चित करें कि आप केवल तभी एक काम करें जब दूसरा वास्तव में बाधा (bottleneck) हो।"

सीखने (learning) और व्यवस्थित करने (organizing) को ठोस साक्ष्य के साथ जोड़कर, यह सिस्टम उस भ्रम और अक्षमता से बचता है जो तब होता है जब इन दोनों प्रक्रियाओं को स्वतंत्र रूप से चलने के लिए छोड़ दिया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →