Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
Evo-Harness एक स्व-विकसित एजेंट फ्रेमवर्क पेश करता है जो कॉन्टेक्स्ट-टू-हार्नेस स्किल कंपाइलेशन का उपयोग करके अनुभवों को पुन: प्रयोज्य, संरचित स्किल हार्नेसेज में संकलित करता है, ताकि नए वास्तविक दुनिया के कार्यों में शोर वाले, वन-शॉट इंटरैक्शन से सीखने की चुनौती को हल किया जा सके और निरंतर क्रॉस-डोमेन सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, एक विशिष्ट प्रकार के सॉफ्टवेयर के रूप में जिसे 'लार्ज लैंग्वेज मॉडल एजेंट' कहा जाता है, जटिल समस्याओं को हल करने के लिए एक शक्तिशाली उपकरण के रूप में उभरा है। ये एजेंट निर्देशों को पढ़ सकते हैं, चरणों की योजना बना सकते हैं, डिजिटल उपकरणों का उपयोग कर सकते हैं, और वेबसाइटों या कंप्यूटर सिस्टम के साथ ठीक वैसे ही बातचीत कर सकते हैं जैसे कि एक इंसान करता है। हालाँकि, एक निरंतर चुनौती ने उनकी क्षमता को सीमित कर दिया है: जब ये एजेंट किसी कार्य में विफल होते हैं, तो वे अक्सर उस विफलता को एक मृत अंत (डेड एंड) मान लेते हैं। वे भविष्य में इसे दोहराने से बचने के लिए अपनी गलती से स्वाभाविक रूप से नहीं सीखते हैं। इन प्रणालियों को सिखाने के पारंपरिक तरीकों में आमतौर पर हजारों पिछले प्रयासों को एकत्र करना और पैटर्न खोजने के लिए उन्हें ऑफलाइन विश्लेषण करना शामिल होता है, जो एक धीमी प्रक्रिया है और अक्सर वास्तविक समय के कार्य प्रवाह से कटी हुई होती है। कई व्यावहारिक स्थितियों में, एक एजेंट को एक नया, कठिन कार्य केवल एक बार मिलता है, जिसमें सफल होने या विफल होने का केवल एक ही अवसर होता है, जिससे पारंपरिक शिक्षण के लिए आवश्यक डेटा के धीमे संचय के लिए बहुत कम गुंजाइश बचती है।
शोधकर्ताओं ने अब इन डिजिटल कार्यकर्ताओं के लिए ऑन-द-फ्लाई (काम के दौरान ही) सुधार करने का एक नया तरीका प्रस्तावित किया है, जिसे वे 'ऑनलाइन हार्नेस लर्निंग' कहते हैं। एजेंट के मुख्य मस्तिष्क (कोर ब्रेन) को फिर से प्रशिक्षित करने के बजाय, जो अक्सर स्थिर और अपरिवर्तनीय होता है, वे एक बाहरी मार्गदर्शिका (गाइडबुक) संलग्न करते हैं जो हर नए अनुभव के साथ विकसित होती है। यह मार्गदर्शिका, या "हार्नेस", पिछले प्रयासों से सीखे गए पाठों का एक संरचित संग्रह है। जब एजेंट विफल होता है, तो सिस्टम केवल त्रुटि को संग्रहीत नहीं करता है; यह विफलता के अव्यवस्थित विवरणों को एक स्पष्ट, पुन: प्रयोज्य नियम में सक्रिय रूप से संकलित करता है। यह नियम फिर मार्गदर्शिका में जोड़ा जाता है, जो भविष्य में समान चुनौतियों का सामना करने में एजेंट की मदद करने के लिए तैयार रहता है। लक्ष्य एक शोर भरे, एक-बार होने वाले दोष को एक स्वच्छ, कार्रवाई योग्य ज्ञान के टुकड़े में बदलना है जिसे विभिन्न प्रकार के कार्यों में लागू किया जा सके।
इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने 'इवो-हार्नेस' (Evo-Harness) नामक एक प्रणाली बनाई और इसे पांच विशिष्ट और कठिन बेंचमार्क पर परखा। ये परीक्षण जटिल वेबसाइटों को नेविगेट करने से लेकर सॉफ्टवेयर कोड रिपॉजिटरी प्रबंधित करने, सटीक कमांड-लाइन निर्देश निष्पादित करने और विभिन्न डिजिटल उपकरणों का उपयोग करने तक फैले हुए थे। हर परिदृश्य में, एजेंट को एक के बाद एक कार्यों की एक धारा दी गई, जिसमें उसके मूल मॉडल को रोकने और पुनः प्रशिक्षित करने का कोई अवसर नहीं था। सिस्टम को प्रत्येक प्रयास के कच्चे संदर्भ (इंस्ट्रक्शन, किए गए कार्य, परिणाम और प्राप्त फीडबैक) को लेने और उसे एक संरचित पाठ में बदलने के लिए डिज़ाइन किया गया था। यदि एजेंट विफल होता, तो एक विशेष प्रक्रिया इस बात पर चिंतन करती कि क्या गलत हुआ, और एक नया नियम या मौजूदा नियम में संशोधन प्रस्तावित करती। फिर एक अन्य प्रक्रिया यह निर्णय लेती कि इस नए नियम को जोड़ना है, इसे मौजूदा ज्ञान के साथ मिलाना है, या यदि यह उस एकल विफल प्रयास के लिए बहुत विशिष्ट है तो इसे हटा देना है।
इस प्रयोग के परिणाम चौंकाने वाले थे। मार्गदर्शिका का उपयोग करने वाले एजेंटों ने लगातार उन एजेंटों की तुलना में बेहतर प्रदर्शन किया जिन्होंने इसका उपयोग नहीं किया था, और उन्होंने पिछले उदाहरणों को केवल पुनः प्राप्त करने या असंरचित स्मृतियों को संग्रहीत करने वाले अन्य तरीकों को भी पीछे छोड़ दिया। कमांड-लाइन कार्यों पर केंद्रित एक बेंचमार्क पर, सुधार विशेष रूप से नाटकीय था, जहाँ सफलता दर लगभग 63 प्रतिशत से बढ़कर 73 प्रतिशत से अधिक हो गई। यह सुझाव देता है कि शोर भरे, सिंगल-शॉट अनुभवों को संरचित मार्गदर्शन में संकलित करने की क्षमता विशेष रूप से उन कार्यों के लिए मूल्यवान है जिनमें सटीक संचालन के अनुक्रम की आवश्यकता होती है, जैसे कि फाइलों का निरीक्षण करना या त्रुटियों से उबरना। अध्ययन में यह भी पाया गया कि सिस्टम द्वारा उत्पन्न मार्गदर्शन का प्रकार कार्य के आधार पर भिन्न होता था। वेब नेविगेशन के लिए, मार्गदर्शिका वर्कफ़्लो प्रक्रियाओं से भर गई; सॉफ्टवेयर इंजीनियरिंग के लिए, इसने सत्यापन और रिकवरी चरणों पर ध्यान केंद्रित किया; और रीजनिंग (तर्क) कार्यों के लिए, इसने डोमेन-विशिष्ट तर्क को कैप्चर किया। यह अनुकूलन क्षमता दर्शाती है कि सिस्टम केवल उत्तरों को याद नहीं कर रहा है, बल्कि समस्याओं को हल करने के अंतर्निंत संरचना को सीख रहा है।
इस शोध से एक महत्वपूर्ण अंतर्दृष्टि मिलती है कि सभी फीडबैक समान नहीं होते। सिस्टम तब सबसे अच्छा प्रदर्शन करता है जब उसे पर्यावरण से स्पष्ट, जमीनी फीडबैक मिलता है, जैसे कि एक विशिष्ट त्रुटि संदेश या एक परीक्षण परिणाम, बजाय इसके कि उससे अपनी सफलता का निर्णय करने के लिए कहा जाए। जब एजेंट ने बिना बाहरी साक्ष्य के अपना स्वयं का फीडबैक उत्पन्न करने का प्रयास किया, तो उसका प्रदर्शन वास्तव में बेसलाइन से नीचे गिर गया, जो बताता है कि स्व-निर्णय भ्रम पैदा कर सकता है। इसके अलावा, अध्ययन ने खुलासा किया कि एजेंट के मस्तिष्क का आकार और क्षमता मायने रखती है। मजबूत मॉडल विकसित मार्गदर्शन की व्याख्या करने और उसका पालन करने में बेहतर थे, जिससे उन्हें सिस्टम से काफी अधिक लाभ हुआ। दिलचस्प बात यह है कि एक छोटा मॉडल कभी-कभी ऐसी मार्गदर्शिका लिख सकता था जो एक बड़े, अधिक सक्षम मॉडल की मदद करे, लेकिन इसका उल्टा हमेशा सच नहीं था। यदि कार्य को हलने वाला एजेंट मार्गदर्शन को समझने के लिए पर्याप्त परिष्कृत नहीं था, तो अतिरिक्त जानकारी ने मदद नहीं की और वास्तव में प्रदर्शन में बाधा भी डाली।
शोधकर्ताओं ने यह भी पता लगाया कि इन सीखे गए कौशल को कैसे स्थानांतरित किया जा सकता है। उन्होंने पाया कि एक मॉडल द्वारा बनाई गई मार्गदर्शिका दूसरे के लिए उपयोगी हो सकती है, और प्रशिक्षण कार्यों के एक सेट पर सीखे गए कौशल अनदेखे परीक्षण कार्यों पर प्रदर्शन में सुधार कर सकते हैं। हालाँकि, सबसे प्रभावी दृष्टिकोण यह था कि एजेंट के कार्यों को पूरा करने के दौरान मार्गदर्शिका को निरंतर अपडेट किया जाए। यह वास्तविक समय का अनुकूलन सिस्टम को वर्तमान वातावरण की विशिष्ट बारीकियों और विफलता मोड के अनुकूल होने की अनुमति देता है, जो सर्वोत्तम पूर्व-प्रशिक्षित मार्गदर्शिकाओं से भी बेहतर प्रदर्शन करता है। अध्ययन का निष्कर्ष है कि आत्म-सुधार करने वाले एजेंटों की कुंजी उनके मूल मॉडलों को लगातार पुनः प्रशिक्षित करने में नहीं, बल्कि एक मजबूत, बाहरी प्रणाली बनाने में है जो वास्तविक दुनिया की विफलताओं के अराजक स्वरूप को स्पष्ट, संगठित निर्देशों के सेट में बदल सके। मार्गदर्शिका को एक जीवित दस्तावेज़ के रूप में मानकर जो हर बातचीत के साथ खुद को विकसित और परिष्कृत करती है, ये डिजिटल एजेंट जटिल, वास्तविक दुनिया के काम की अप्रत्याशित प्रकृति को संभालने के लिए सीख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।