SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale
SkillDAG एक स्व-विकसित (self-evolving), टाइप किया हुआ निर्देशित ग्राफ (typed directed graph) ढांचा पेश करता है जो LLM एजेंटों को निष्पादन के दौरान कौशल संबंधों के बारे में गतिशील रूप से पुनर्प्राप्त करने और संरचनात्मक रूप से तर्क करने में सक्षम बनाता है, जिससे यह निष्पादन-आधारित ज्ञान को संचित करके और कौशल पुस्तकालयों के विस्तार के साथ मजबूत उम्मीदवार रैंकिंग बनाए रखकर जटिल कार्य वातावरणों में मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जटिल पहेलियाँ सुलझाने में मदद करने के लिए विशेषज्ञों की एक विशाल टीम (कौशल/skills) को काम पर रख रहे हैं। अतीत में, जब टीम छोटी थी, तो आप बस हर किसी का बायोडाटा (resume) पढ़ सकते थे और सही लोगों को चुन सकते थे। लेकिन अब, कल्पना कीजिए कि आपकी टीम हजारों श्रमिकों तक बढ़ गई है।
यदि आप एक साथ सभी के बायोडाटा पढ़ने की कोशिश करते हैं, तो आपके पास समय और स्थान की कमी हो जाएगी। यदि आप केवल एक कंप्यूटर से पूछें कि कार्य के लिए "सबसे समान" बायोडाटा कौन सा है, तो आप उस महत्वपूर्ण व्यक्ति को खो सकते हैं जिसकी आपको वास्तव में आवश्यकता है, क्योंकि उनका बायोडाटा कार्य जैसा दिखता नहीं है, भले ही वे इसके लिए अनिवार्य हों।
SkillDAG एक नया सिस्टम है जिसे AI एजेंटों के लिए इस "बहुत अधिक श्रमिकों" वाली समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:
1. समस्या: "फ्लैट" सूची बनाम "मानचित्र" (The "Flat" List vs. The "Map")
वर्तमान AI सिस्टम अक्सर कौशल को नामों की एक सपाट सूची की तरह मानते हैं। यदि आप "खाना पकाने के कौशल" के लिए पूछते हैं, तो सिस्टम "पकाना" शब्द ढूँढ लेता है। लेकिन यह शायद यह भी मिस कर देता है कि आपको "काटने के कौशल" (एक पूर्व शर्त/prerequisite) की भी आवश्यकता हो सकती है, या आपको "खाना पकाने" और "जमाने" (freezing) को एक साथ उपयोग नहीं करना चाहिए (एक संघर्ष/conflict)।
- पुराना तरीका: यह एक शहर में केवल सड़कों के नामों की सूची का उपयोग करके नेविगेट करने जैसा है। आप गंतव्य को जान सकते हैं, लेकिन आप यह नहीं जानते कि कौन सी सड़कें उससे जुड़ती हैं, कौन सी सड़कें डेड एंड (बंद रास्ता) हैं, या कौन सी सड़कें वन-वे (एकतरफा) हैं।
- SkillDAG का तरीका: यह एक जीवित मानचित्र (ग्राफ) बनाता है जहाँ प्रत्येक कौशल एक शहर का ब्लॉक है, और उनके बीच के संबंध स्पष्ट रूप से लेबल किए गए रास्ते हैं। कुछ रास्ते कहते हैं "वहाँ पहुँचने के लिए आपको यह लेना ही होगा" (Prerequisite), कुछ कहते हैं "यह एक शॉर्टकट है" (Specialization), और कुछ कहते हैं "यहाँ न जाएँ" (Conflict)।
2. नवाचार: एजेंट के पास होता है मानचित्र (The Agent Holds the Map)
पिछले सिस्टम में, एक निश्चित कंप्यूटर प्रोग्राम तय करता था कि मानचित्र के आधार पर कौन से कौशल लोड करने हैं, और AI एजेंट को केवल एक पहले से तैयार सूची प्राप्त होती थी। एजेंट यह नहीं पूछ सकता था, "आपने इसे क्यों चुना?" या "क्या मैं एक नया रास्ता जोड़ सकता हूँ?"
SkillDAG इसे उलट देता है।
- एजेंट एक नेविगेटर है: AI एजेंट को स्वयं मानचित्र दिया जाता है। वह कनेक्शन देख सकता है, प्रश्न पूछ सकता है और यह तय कर सकता है कि कौन से कौशल लोड करने हैं।
- "खोज" टूल (The "Search" Tool): नामों की सूची प्राप्त करने के बजाय, एजेंट मानचित्र से पूछता है: "इस कार्य के करीब कौन है?" (Matches), "वे किससे जुड़े हैं?" (Neighbors), और "मुझे किन्हें टालना चाहिए?" (Conflicts)। यह एजेंट को स्मार्ट निर्णय लेने के लिए तीन अलग-अलग प्रकार के सुराग देता है।
3. "स्व-विकसित" होने वाला हिस्सा: नए रास्ते बनाना (The "Self-Evolving" Part: Drawing New Roads)
मानचित्र शुरुआत में एकदम सही नहीं होता है। यह एक "कोल्ड स्टार्ट" (बायोडाटा पढ़ने) से बनता है, लेकिन यह उन चीजों को मिस कर देता है जो केवल तब होती हैं जब रोबोट वास्तव में काम करता है।
- "प्रस्ताव और प्रतिबद्धता" प्रोटोकॉल (The "Propose and Commit" Protocol): यदि एजेंट एक कार्य करने की कोशिश करता है और उसे एहसास होता है कि, "अरे, मुझे स्किल B का उपयोग करने से पहले स्किल A की आवश्यकता थी," तो वह मानचित्र पर उन्हें जोड़ने के लिए एक नया रास्ता प्रस्तावित कर सकता है।
- सुरक्षा रेलिंग (The Safety Guardrails): नया रास्ता बनाने से पहले, सिस्टम तीन नियमों की जाँच करता है:
- कोई लूप नहीं (No Loops): आप एक चक्र नहीं बना सकते जहाँ A को B की आवश्यकता हो, और B को A की आवश्यकता हो (इससे एजेंट फंस जाएगा)।
- कोई विरोधाभास नहीं (No Contradictions): आप एक ही जोड़ी के लिए एक सड़क "यहाँ जाएँ" और दूसरी "यहाँ न जाएँ" नहीं बना सकते।
- अनडू बटन (Undo Button): यदि एजेंट कोई गलती करता है, तो सिस्टम एक लॉग रखता है ताकि बाद में उस रास्ते को मिटाया जा सके।
इसका मतलब है कि एजेंट हर बार जब कोई पहेली सुलझाता है, तो मानचित्र अधिक स्मार्ट और विस्तृत होता जाता है, और अपने अनुभव से सीखता है।
4. परिणाम: स्मार्ट और तेज़ (The Results: Smarter and Faster)
इस पेपर का परीक्षण दो प्रकार की चुनौतियों पर किया गया:
- ALFWorld (आभासी घर): एजेंट को घर में वस्तुओं को इधर-उधर ले जाना था।
- SkillsBench (कोडिंग कार्य): एजेंट को समस्याओं को हल करने के लिए कोड लिखना था।
परिणाम:
- बेहतर सफलता: SkillDAG एजेंट ने पिछले सबसे अच्छे तरीकों की तुलना में काफी अधिक पहेलियाँ सुलझाईं। यह विशाल टूल लाइब्रेरी में से सही उपकरण चुनने में विशेष रूप से अच्छा था।
- बेहतर मेमोरी: भले ही कौशल की संख्या 10 गुना बढ़ गई, SkillDAG एजेंट भ्रमित नहीं हुआ। इसने सही कौशल ढूँढना जारी रखा, जबकि अन्य तरीके विफल होने लगे।
- आंतरिक सुधार (Intrinsic Improvement): सिस्टम केवल भाग्यशाली नहीं था; इसने वास्तव में सही "ग्राउंड ट्रुथ" कौशल को अधिक बार प्राप्त किया, जिससे सिद्ध हुआ कि मानचित्र संरचना काम कर रही है।
सारांश उपमा (Summary Analogy)
सोचिए कि SkillDAG एक AI एजेंट को एक स्व-अपडेट होने वाला GPS देने जैसा है।
- पुराना सिस्टम: आप एजेंट को एक स्थिर कागजी मानचित्र देते हैं। यदि रास्ता बदल जाता है या कोई नया शॉर्टकट खुल जाता है, तो एजेंट पुराने मानचित्र के साथ फंसा रह जाता है।
- SkillDAG: एजेंट के पास एक डिजिटल GPS है। वह ट्रैफिक (संघर्ष), कनेक्शन (निर्भरता), और जैसे-जैसे वह चलता है, भविष्य की यात्राओं के लिए मानचित्र पर नए शॉर्टकट बनाता है। एजेंट तय करता है कि कहाँ जाना है, मानचित्र का उपयोग एक उपकरण के रूप में करता है, न कि एक नियम के रूप रूप में।
पेपर का दावा है कि यह दृष्टिकोण AI एजेंटों को एक विशाल लाइब्रेरी से सही उपकरण चुनने में बहुत बेहतर बनाता है, जिससे जटिल कार्यों में सफलता दर बढ़ जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।