EvoSkill: Automated Skill Discovery for Multi-Agent Systems
EvoSkill एक स्व-विकसित होने वाला ढांचा है जो पुन: प्रयोज्य एजेंट कौशल को पुनरावृत्ति विफलता विश्लेषण और पारेटो-आधारित चयन के माध्यम से स्वचालित रूप से खोजता और परिष्कृत करता है, जो विशेष तर्क और खोज-संवर्धित QA बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है और कार्यों के बीच ज़ीरो-शॉट हस्तांतरणीयता प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक प्रतिभाशाली, अति-बुद्धिमान इंटर्न को काम पर रखा है जो कोड लिख सकता है, गणित की समस्याओं को हल कर सकता है और वेब ब्राउज़ कर सकता है। यह इंटर्न अविश्वसनीय रूप से लचीला है—यदि आप उन्हें सही निर्देश दें तो वे लगभग कुछ भी कर सकते हैं। हालाँकि, एक पेच है: उन्हें आपके विशेष काम के लिए विशिष्ट "व्यापार के गुर" (tricks of the trade) का पता नहीं है।
यदि आप उन्हें जटिल वित्तीय रिपोर्टों का विश्लेषण करने के लिए कहते हैं, तो वे स्प्रेडशीट को पढ़ना जान सकते हैं, लेकिन वे मुद्रास्फीति (inflation) की गणना कैसे की जाए या छिपे हुए डेटा को कहाँ देखना है, इसके सूक्ष्म नियमों को छोड़ सकते हैं। यदि आप उन्हें किसी समाचार कहानी पर शोध करने के लिए कहते हैं, तो वे बहुत जल्दी खोज बंद कर सकते हैं क्योंकि पहला खोज परिणाम अच्छा लग रहा था, भले ही वह गलत हो।
वर्तमान में, इसे ठीक करने के लिए, मनुष्यों को मैन्युअल रूप से "चीट शीट्स" या "मानक संचालन प्रक्रियाएं" (जिन्हें कौशल/skills कहा जाता है) लिखनी पड़ती हैं। लेकिन इन चीट शीट्स को हाथ से लिखना धीमा, उबाऊ और बड़े पैमाने पर लागू करने में कठिन है।
एवोस्किल (EvoSkill) से मिलिए: वह AI जो खुद को विशेषज्ञ बनाना सिखाता है।
मुख्य विचार: गलतियों से सीखना
EvoSkill को एक शिक्षक के रूप में नहीं, बल्कि एक कठोर कोच के रूप में सोचें जो एक एथलीट को अभ्यास करते हुए देखता है, सटीक रूप से पहचानता है कि वह कहाँ लड़खड़ा रहा है, और फिर उस विशिष्ट कमजोरी को ठीक करने के लिए एक नया अभ्यास (drill) लिखता है।
यह प्रक्रिया कैसे काम करती है, यहाँ एक सरल उपमा दी गई है:
1. तीन-अंकों वाला नाटक (The Three-Act Play)
EvoSkill तीन अलग-अलग AI "पात्रों" का उपयोग करता है जो एक लूप में मिलकर काम करते हैं:
- द रनर (एग्जीक्यूटर एजेंट): यह मुख्य AI है जो समस्या को हल करने की कोशिश कर रहा है। यह अपने पास मौजूद किसी भी "चीट शीट" (कौशल) का उपयोग करके कार्य को निष्पादित करता है।
- द कोच (प्रपोजर एजेंट): यह एजेंट रनर को विफल होते हुए देखता है। यह गलती, वास्तविक उत्तर (ground truth) और रनर की विचार प्रक्रिया को देखता है। यह पूछता है: "हमने गलती क्यों की? क्या हमने कोई चरण छोड़ दिया? क्या हमने कोई संख्या गलत पढ़ ली?" फिर, यह एक नए नियम या अभ्यास का विवरण लिखता है जिसकी आवश्यकता इस गलती को सुधारने के लिए है।
- द आर्किटेक्ट (स्किल-बिल्डर एजेंट): यह एजेंट कोच के विवरण को लेता है और उसे एक वास्तविक, उपयोगी "चीट शीट" में बदल देता है। यह वास्तविक निर्देश लिखता है, आवश्यक कोड स्क्रिप्ट बनाता है, और सब कुछ एक व्यवस्थित फोल्डर में व्यवस्थित करता है जिसे रनर अगली बार उपयोग कर सके।
2. "पारेटो फ्रंटियर" (द हॉल ऑफ फ़ेम)
कल्पना कीजिए कि एक जिम है जिसमें सीमित संख्या में लॉकर हैं (मान लीजिए 3)। केवल शीर्ष 3 एथलीट ही अपने लॉकर रख सकते हैं।
- हर बार जब कोच और आर्किटेक्ट एक नई "चीट शीट" बनाते हैं, तो वे उसका परीक्षण करते हैं।
- यदि नई चीट शीट रनर को 'हॉल ऑफ फ़ेम' में मौजूद सबसे खराब व्यक्ति की तुलना में बेहतर स्कोर प्राप्त करने में मदद करती है, तो वह अंदर आ जाती है, और सबसे खराब व्यक्ति को बाहर कर दिया जाता है।
- यदि नई चीट शीट मदद नहीं करती है, तो उसे कचरे में फेंक दिया जाता है।
यह सुनिश्चित करता है कि AI केवल उन्हीं कौशलों को रखता है जो वास्तव में इसे स्मार्ट बनाते हैं, और यह अपने सबसे अच्छे गुर कभी नहीं भूलता।
पेपर से वास्तविक दुनिया के उदाहरण
शोधकर्ताओं ने यह देखने के लिए कि क्या यह काम करता है, इसे दो बहुत अलग "नौकरियों" पर परखा:
नौकरी 1: ट्रेजरी एनालिस्ट (OfficeQA)
- कार्य: AI को विशाल, उबाऊ सरकारी वित्तीय रिपोर्टों (सैकड़ों पन्नों की टेबल) को पढ़ना था और उनसे विशिष्ट गणितीय प्रश्नों के उत्तर देने थे।
- समस्या: AI संख्याओं को गलत पढ़ रहा था या टेबल में गलत पंक्ति चुन रहा था।
- EvoSkill का समाधान: सिस्टम ने "डेटा एक्सट्रैक्शन वेरिफिकेशन" नामक एक कौशल की खोज की। यह एक नियम की तरह है जो कहता है: "हे, टेबल से कोई संख्या लिखने से पहले, रो (row) और कॉलम (column) के हेडर की दोबारा जांच करें। यदि नंबर अजीब लग रहे हैं, तो पूरे सेक्शन को फिर से पढ़ें।"
- परिणाम: AI की सटीकता 7.3% बढ़ गई।
नौकरी 2: खोजी पत्रकार (SealQA)
- कार्य: AI को किसी तथ्य के बारे में सच्चाई खोजने के लिए अव्यवस्थित, अराजक इंटरनेट को खोजना था, जहाँ अक्सर फर्जी खबरें या विरोधाभासी रिपोर्ट होती हैं।
- समस्या: AI एक खोज परिणाम देखता था, उत्साहित हो जाता था और खोजना बंद कर देता था। वह अपूर्ण जानकारी के आधार पर उत्तर दे देता था।
- EvoSkill का समाधान: सिस्टम ने एक "सर्च पर्सिस्टेंस प्रोटोकॉल" बनाया। यह एक नियम है जो कहता है: "पहले परिणाम पर कभी न रुकें। उत्तर देने से पहले आपको कम से कम तीन अलग-अलग स्रोतों को मिलना चाहिए जो एक दूसरे से सहमत हों। यदि स्रोत असहमत हैं, तो और गहराई से खोज जारी रखें।"
- परिणाम: AI की सटीकता 12.1% बढ़ गई।
जादू का कमाल: ज़ीरो-शॉट ट्रांसफर (Zero-Shot Transfer)
यहाँ सबसे रोमांचक हिस्सा है। शोधकर्ताओं ने "सर्च पर्सिस्टेंस प्रोटोकॉल" (जल्दी न रुकने का नियम) लिया जिसे पत्रकार की नौकरी करते समय सीखा गया था।
उन्होंने यह सटीक नियम एक दूसरे AI एजेंट को दिया जो एक बिल्कुल अलग काम (BrowseComp नामक बेंचमार्क पर सामान्य ज्ञान के प्रश्न answering) कर रहा था। उन्होंने नियम को बिल्कुल नहीं बदला।
परिणाम: AI उस नए काम में 5.3% बेहतर हो गया क्योंकि उसने पुराने नियम का उपयोग किया।
यह एक बड़ी बात क्यों है?
आमतौर पर, यदि आप किसी छात्र को भाग (division) करना सिखाते हैं, तो वे स्वचालित रूप से निबंध लिखना नहीं सीख जाते। लेकिन EvoSkill सोचने की आदतों (जैसे "अपने स्रोतों को सत्यापित करें" या "अपने गणित की दोबारा जांच करें") को सिखाता है जो हर जगह उपयोगी हैं। यह केवल एक विशिष्ट परीक्षा के उत्तर रटने के बजाय छात्र को पढ़ाई कैसे करनी है यह सिखाने जैसा है।
सारांश
EvoSkill एक ऐसा सिस्टम है जो AI एजेंट को अपनी विशेषज्ञता विकसित करने की अनुमति देता है। हजारों नियम मैन्युअल रूप से लिखने के बजाय, AI:
- एक कार्य करता है।
- विफल होता है।
- विफलता का विश्लेषण करता है।
- अगली बार इस विफलता को रोकने के लिए अपना नया नियम लिखता है।
- सबसे अच्छे नियमों को रखता है और खराब को हटा देता है।
यह एक स्व-सुधार लूप है जो एक सामान्य-उद्देश्य वाले AI को एक विशिष्ट विशेषज्ञ में बदल देता है, और जो कौशल यह सीखता है वे इतने मौलिक होते हैं कि उनका उपयोग उन समस्याओं को हल करने के लिए किया जा सकता है जिन्हें इसने पहले कभी नहीं देखा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।